AI Energy Score:量化、对比并削减模型耗电量的实用指南

·阅读约 10 分钟·Evergreen Tools Team
Solar panels and renewable energy representing efficient AI infrastructure

💡 工具推荐降低模型能耗与成本往往是同一件事。用 Evergreen Tools 的 AI Token 计数器计量单次请求开销、HTML Minifier 压缩网页负载,并用 Compress WebP 压缩 AI 管道服务的媒体资源。 AI Token 计数器, HTML 压缩工具, WebP 图片压缩

AI 的用电量正在成为工程决策的一部分。行业预测,到 2027 年 AI 每年可能消耗 85 至 134 太瓦时电力——大致相当于荷兰这样一个小国的用电量。为此,Hugging Face 与 Salesforce 联合 Cohere、卡内基梅隆大学推出了 AI Energy Score:一个面向模型推理能耗的标准化评分框架,公共排行榜已覆盖 166 个常用模型。对开发者来说,这不是 ESG 报告里的装饰页,而是可以写进模型选型、预算与 CI 策略的具体指标。

1. 为什么能耗透明度现在变得重要

过去两年模型规模与调用量同步暴涨,电力成为推理成本中不可忽视的一项:GPU 功耗直接决定每 token 的边际成本,也决定数据中心的扩张速度。Salesforce Ben 引用的预测指出,到 2027 年 AI 用电量可能达到每年 85 至 134 太瓦时。与此同时,「降低能耗」与「降低成本」高度同向——更高效的模型通常意味着更低的每任务开销,这让能耗指标第一次成为工程团队而非仅合规团队关心的数字。选择高效模型、做量化这类节能动作,同时也会降低云账单:激励是结构性的,而不只是道德性的。

# Illustrative budget: energy belongs in the model-selection
# policy next to price. Score tiers map to stars (1-5).
model-policy:
  default-tier: 4            # aim for 4+ star models on hot paths
  image-generation: tier-3   # generation tasks burn far more
  batch-jobs: tier-any       # low priority can use efficient tiers
  review-before: true        # re-check ratings quarterly

2. AI Energy Score 如何工作

评分机制很直观:按具体任务测量模型的 GPU 瓦时消耗,每个任务分五档,授予 1 至 5 星,5 星代表最节能。所有结果通过 Hugging Face 上的公共排行榜公开,包含模型名称、能耗数据与星级,研究者、开发者与采购方都能直接对比。Salesforce 是第一个在该框架下公开自有专有模型能耗数据的厂商,这为其他模型开发商建立了披露先例。

Global technology network illustrating data center electricity demand
// Convert a model's watt-hour rating into something a finance
// team can compare with the token bill.
function energyCostPerMonth(monthlyTokens, whPer1kTokens, pricePerKwh) {
  const kwh = (monthlyTokens / 1000) * (whPer1kTokens / 1000);
  return {
    kwh,
    usd: (kwh * pricePerKwh).toFixed(2),
    note: 'add cooling overhead of roughly 1.0-1.3x in a data center'
  };
}

// A 4-star chat model might use ~0.04 Wh per 1k tokens;
// a hungrier model can be 3-5x that on the same task.
console.log(energyCostPerMonth(50_000_000, 0.04, 0.15)); // ~30 USD

3. 用排行榜做模型选型

排行榜的价值在于「按任务对比」:同一个模型在不同任务上的星级可能差异很大,聊天、代码、图像生成各自独立评分。选型时可以给热路径设定星级门槛——例如线上聊天默认要求 4 星以上模型,图像生成这类高耗能任务单独设档。注意评分随硬件与批处理配置变化,季度复核一次比年初定死更可靠。

# Quantization is the fastest lever: FP8/INT4 cuts both memory
# bandwidth and energy per token with small quality impact on
# many workloads. Illustrative PyTorch-style flow.
from transformers import AutoModelForCausalLM

model = AutoModelForCausalLM.from_pretrained(
    "your-model",
    torch_dtype="float16",
)
model = model.to("cuda")

# Load the quantized variant for inference where quality allows:
model_fp8 = AutoModelForCausalLM.from_pretrained(
    "your-model-fp8",
    torch_dtype="float8",
)

4. 排行榜之外的节能实践

评级解决「选哪个」,工程实践解决「怎么用得省」。四个杠杆按性价比排序:量化(FP8/INT4 在多数任务上质量损失很小,却能同时降低显存带宽与每 token 能耗)、缓存(重复前缀命中缓存,跳过重复计算)、批处理(合并任务为一次前向传播)、以及用小模型处理简单任务。这些做法同时降低能耗与账单,不需要等任何厂商的更新。务实的顺序是:先给流量最高的模型做量化,再在网关层加前缀缓存,然后重新计量,最后才决定要不要扩容 GPU。

Efficiency dashboard comparing model energy ratings

5. 生态工具正在快速补位

AI Energy Score 之外,工具链在快速成熟:英国初创公司 Greenpixie 发布了免费版本,用于对比主要 AI 厂商的模型排放;Hugging Face 平台持续为更多模型补充能耗评级。这些工具把「可持续 AI」从口号变成可审计的运营实践:采购时对比厂商、部署前检查模型评级、上线后持续计量。

// Batch and cache before you buy more GPUs. Both cut energy
// per completed task, and they compound with token caching.
function scheduleBatches(tasks, maxBatch) {
  const out = [];
  for (let i = 0; i < tasks.length; i += maxBatch) {
    out.push(tasks.slice(i, i + maxBatch));
  }
  return out; // one forward pass per batch instead of per task
}

// Cache repeated prefixes: same system prompt, same repo context.
function cacheablePrefix(prompt) {
  return prompt.length > 500 && prompt.startsWith(systemPrompt);
}

6. 现在该做什么

第一,把能耗写进模型选型策略:为每个高流量任务设定最低星级。第二,在 CI 中加一道能耗门禁,部署前检查所选模型的评级是否达标。第三,先上量化与缓存这两个杠杆,再考虑扩容。第四,把 token 计量与能耗数据放同一张看板——两者同向变动时,你的优化方向基本不会错。

# CI energy gate: fail the deploy if the chosen model's rating
# drops below policy on a high-traffic task. Runs from a policy
# file checked into the repo.
energy-check:
  stage: verify
  script:
    - python scripts/check_model_rating.py --task chat --min-stars 4
    - python scripts/check_model_rating.py --task image --min-stars 3
  when: on_deploy

📌 常见问题 FAQ

AI Energy Score 是什么?

由 Hugging Face 与 Salesforce 联合 Cohere、卡内基梅隆大学推出的模型推理能耗评分框架:按任务测量 GPU 瓦时消耗,分五档授星(1-5 星),结果通过公共排行榜公开,已覆盖 166 个常用模型。

AI Energy Score 是什么?

由 Hugging Face 与 Salesforce 联合 Cohere、卡内基梅隆大学推出的模型推理能耗评分框架:按任务测量 GPU 瓦时消耗,分五档授星(1-5 星),结果通过公共排行榜公开,已覆盖 166 个常用模型。

AI Energy Score 是什么?

由 Hugging Face 与 Salesforce 联合 Cohere、卡内基梅隆大学推出的模型推理能耗评分框架:按任务测量 GPU 瓦时消耗,分五档授星(1-5 星),结果通过公共排行榜公开,已覆盖 166 个常用模型。

AI Energy Score 是什么?

由 Hugging Face 与 Salesforce 联合 Cohere、卡内基梅隆大学推出的模型推理能耗评分框架:按任务测量 GPU 瓦时消耗,分五档授星(1-5 星),结果通过公共排行榜公开,已覆盖 166 个常用模型。

AI Energy Score 是什么?

由 Hugging Face 与 Salesforce 联合 Cohere、卡内基梅隆大学推出的模型推理能耗评分框架:按任务测量 GPU 瓦时消耗,分五档授星(1-5 星),结果通过公共排行榜公开,已覆盖 166 个常用模型。

星级是怎么评出来的?

评测基于模型在特定任务上的 GPU 瓦时消耗,按任务分别分档并授星,5 星代表最节能。同一模型在不同任务上的星级可能不同,所以选型时要按任务对比。

星级是怎么评出来的?

评测基于模型在特定任务上的 GPU 瓦时消耗,按任务分别分档并授星,5 星代表最节能。同一模型在不同任务上的星级可能不同,所以选型时要按任务对比。

星级是怎么评出来的?

评测基于模型在特定任务上的 GPU 瓦时消耗,按任务分别分档并授星,5 星代表最节能。同一模型在不同任务上的星级可能不同,所以选型时要按任务对比。

星级是怎么评出来的?

评测基于模型在特定任务上的 GPU 瓦时消耗,按任务分别分档并授星,5 星代表最节能。同一模型在不同任务上的星级可能不同,所以选型时要按任务对比。

星级是怎么评出来的?

评测基于模型在特定任务上的 GPU 瓦时消耗,按任务分别分档并授星,5 星代表最节能。同一模型在不同任务上的星级可能不同,所以选型时要按任务对比。

AI 到底有多耗电?

行业预测到 2027 年 AI 每年可能消耗 85 至 134 太瓦时电力,约相当于荷兰一年的用电量。具体模型差异很大,这也是评分的意义所在。

AI 到底有多耗电?

行业预测到 2027 年 AI 每年可能消耗 85 至 134 太瓦时电力,约相当于荷兰一年的用电量。具体模型差异很大,这也是评分的意义所在。

AI 到底有多耗电?

行业预测到 2027 年 AI 每年可能消耗 85 至 134 太瓦时电力,约相当于荷兰一年的用电量。具体模型差异很大,这也是评分的意义所在。

AI 到底有多耗电?

行业预测到 2027 年 AI 每年可能消耗 85 至 134 太瓦时电力,约相当于荷兰一年的用电量。具体模型差异很大,这也是评分的意义所在。

AI 到底有多耗电?

行业预测到 2027 年 AI 每年可能消耗 85 至 134 太瓦时电力,约相当于荷兰一年的用电量。具体模型差异很大,这也是评分的意义所在。

除了换模型,还有什么节能手段?

四个杠杆:量化(FP8/INT4)、缓存重复前缀、批处理合并请求、用更小模型处理简单任务。它们同时降低能耗与成本,且立即可用。

除了换模型,还有什么节能手段?

四个杠杆:量化(FP8/INT4)、缓存重复前缀、批处理合并请求、用更小模型处理简单任务。它们同时降低能耗与成本,且立即可用。

除了换模型,还有什么节能手段?

四个杠杆:量化(FP8/INT4)、缓存重复前缀、批处理合并请求、用更小模型处理简单任务。它们同时降低能耗与成本,且立即可用。

除了换模型,还有什么节能手段?

四个杠杆:量化(FP8/INT4)、缓存重复前缀、批处理合并请求、用更小模型处理简单任务。它们同时降低能耗与成本,且立即可用。

除了换模型,还有什么节能手段?

四个杠杆:量化(FP8/INT4)、缓存重复前缀、批处理合并请求、用更小模型处理简单任务。它们同时降低能耗与成本,且立即可用。

Greenpixie 是什么?

一家英国初创公司,已发布免费版本用于对比主流 AI 厂商的模型排放;旗舰客户包括 Mastercard 与 Unilever。它与 AI Energy Score 一起构成可持续 AI 的工具生态。

Greenpixie 是什么?

一家英国初创公司,已发布免费版本用于对比主流 AI 厂商的模型排放;旗舰客户包括 Mastercard 与 Unilever。它与 AI Energy Score 一起构成可持续 AI 的工具生态。

Greenpixie 是什么?

一家英国初创公司,已发布免费版本用于对比主流 AI 厂商的模型排放;旗舰客户包括 Mastercard 与 Unilever。它与 AI Energy Score 一起构成可持续 AI 的工具生态。

Greenpixie 是什么?

一家英国初创公司,已发布免费版本用于对比主流 AI 厂商的模型排放;旗舰客户包括 Mastercard 与 Unilever。它与 AI Energy Score 一起构成可持续 AI 的工具生态。

Greenpixie 是什么?

一家英国初创公司,已发布免费版本用于对比主流 AI 厂商的模型排放;旗舰客户包括 Mastercard 与 Unilever。它与 AI Energy Score 一起构成可持续 AI 的工具生态。