OpenAI 研究员每天为 Agent 烧掉 600 到 7000 美元:搭建你团队需要的 ROI 遥测

·阅读约 11 分钟·Evergreen Tools Team
Analytics dashboard showing daily token spend per developer

💡 工具推荐想判断 Agent 是否赚回成本,先要有干净的用量数据。用 Evergreen Tools 的 JSON 格式化工具整理原始用量 JSON,用 JSON 转 CSV 把每日日志变成可绘图的表格,再用 AI Token 计数器在任务运行前就估算好成本。 JSON 格式化工具, JSON 转 CSV, AI Token 计数器

2026 年 9 月 6 日,OpenAI 发了一篇不同寻常的博客《研究加速:OpenAI 内部视角》,把自家研究员用 AI 编码 Agent 的账本摊开给人看。最抓眼球的是钱:到 8 月中旬,中等水平研究员每天消耗超过 600 美元的推理量,前 10% 的重度用户每天超过 7000 美元——按公开 API 价格计算。更值得琢磨的是效率指标:整个研究组织平均每投入一个工作日的人类劳动,就有 3.1 个 Agent 工作日并行运转;8 月每位活跃研究员的实验数量创下 2025 年 1 月开始追踪以来的新高。OpenAI 说它已经达成了「自动化研究实习生」的目标。这篇文章不聊 OpenAI 的战略,而是把这份报告翻译成大多数工程团队能用的东西:该跟踪哪些数字、如何度量 Agent 的真实回报,以及怎么搭建自己的 ROI 遥测。

1. OpenAI 到底公布了什么

这份报告是 OpenAI 对自己「用 AI 加速自身研究」的内部盘点,9 月 6 日发布在官网,随后被 Fortune、Business Insider 等广泛报道。核心口径不是「我们写了多少代码」,而是三组指标:人均推理花费、Agent 工作日与人类工作日的比例、以及每位活跃研究员的实验数量。报告说,2026 年初中等水平研究员对编码 Agent 的使用还很有限,到 8 月中旬已经把 Agent 融进日常工作,按 API 价格每天推理花费超过 600 美元;组织内前 10% 的用户每天消耗超过 7000 美元的 token。Fortune 的报道还引用了一个总数:整个研究组织平均每 1 个工作日的人类劳动对应 3.1 个 Agent 工作日。

# Load daily usage events and group cost by developer.
import json, collections

def cost_per_user(events):
    by_user = collections.defaultdict(float)
    for e in events:
        u = e["user"]
        by_user[u] += (
            e["input_tokens"] / 1_000_000 * e["input_price_per_mtok"]
            + e["output_tokens"] / 1_000_000 * e["output_price_per_mtok"]
            + e["cache_read_tokens"] / 1_000_000 * e["cache_price_per_mtok"]
        )
    return by_user

with open("usage_2026-09-09.json") as f:
    events = json.load(f)
for user, cost in sorted(cost_per_user(events).items(), key=lambda kv: -kv[1]):
    print(user + ": " + "$" + f"{cost:.2f}")

2. 为什么这些数字对你有用

OpenAI 的数字看似只是大厂的挥霍,其实隐藏着两个对普通团队同样成立的规律。第一,Agent 的用量不是缓慢爬坡,而是过了某个习惯阈值后陡增——从「偶尔用用」到「每天必用」,中间几乎没有过渡。第二,花费高度集中在少数重度用户:中位数 600 美元、90 分位 7000 美元,意味着大约 10% 的人消耗了绝大部分成本。如果你的团队开始大规模铺 Agent,这两条规律几乎必然复现。所以别只看平均值,要同时看中位数和 90 分位,否则你会在预算被前 10% 的用户击穿时才发现问题。

Laptop showing charts of agent usage metrics
# Median and 90th percentile daily spend, OpenAI-style.
def percentiles(values, p):
    values = sorted(values)
    k = (len(values) - 1) * p
    lo, hi = int(k), min(int(k) + 1, len(values) - 1)
    return values[lo] if lo == hi else values[lo] + (values[hi] - values[lo]) * (k - lo)

daily = [120.0, 340.0, 610.0, 820.0, 1500.0, 2400.0, 4600.0, 7100.0]
print("p50: " + "$" + f"{percentiles(daily, 0.5):.0f}")  # median
print("p90: " + "$" + f"{percentiles(daily, 0.9):.0f}")  # heavy user

3. 钱到底花在哪:按任务类别拆解

OpenAI 还披露了 Agent token 的去向:2026 年 1 月时,最大类别是研究与基础设施代码;到 8 月,这个类别仍在扩张,但「技术帮助」和「监控运行」的占比明显上升,而高层级规划始终只占极小一部分。这其实印证了当前 Agent 的能力边界:它们最适合执行明确、可验证的中间层工作,比如写测试、修 bug、盯实验状态,而不太适合做模糊的战略规划。对普通团队,这提示了 ROI 最高的投放方向:把 Agent 放在「有明确完成标准」的任务上,不要指望它们替你决定该做什么。

# Agent-workday ratio: agent minutes vs. human minutes in the loop.
# OpenAI reports 3.1 agent-workdays per human workday inside research.
def agent_ratio(agent_minutes, human_minutes):
    return agent_minutes / max(human_minutes, 1)

# If 3 engineers supervise agents for 6 hours while agents run 55 hours:
print(agent_ratio(55 * 60, 3 * 6 * 60))  # 3.06

4. 度量 Agent 回报的正确姿势

大多数团队衡量 Agent 用的是「token 数」或「生成行数」,这两个指标都容易误导:token 多可能是提示词低效,行数多可能是废话代码。更靠谱的 KPI 是成本/任务比:把一个任务(修一个测试、加一个接口、重构一个模块)作为记账单位,用总成本除以完成数,得到每个任务的真实单价。再乘以任务对业务的价值,你才能判断「这个 Agent 到底值不值」。OpenAI 用「每位活跃研究员的实验数」作为产出指标,本质也是用可验证的成果而非过程量衡量 Agent 的贡献。

Server room representing the inference infrastructure behind agent spend

5. 搭建自己的 ROI 遥测:四步走

第一步,把每个 API 调用的 usage 回包按用户落盘,别只记总额——否则你永远不知道谁在烧钱。第二步,用价格表把 input、output、cache read 三类 token 折算成美元,按用户和任务两个维度聚合。第三步,给每个任务打上 ID,把「成本/任务」作为核心看板指标,配合文本差异对比工具做人工抽检。第四步,设预算门禁:超过日预算 80% 告警、超过 100% 阻断,宁可白天误伤一次,也不要月底收到天价账单。工具层面,用 AI Token 计数器做运行前估算,用 JSON 转 CSV 把日志变成可绘图的表格。

# Cost per completed task beats tokens per prompt as a KPI.
TASKS = {"fix_test": 3, "add_endpoint": 5, "refactor_module": 11}

def cost_per_task(cost_by_task_id, task_ids):
    return {t: cost_by_task_id[t] / task_ids.count(t) for t in set(task_ids)}

costs = {"t1": 4.2, "t2": 9.8, "t3": 12.1, "t4": 1.9}
ids = ["fix_test", "fix_test", "add_endpoint", "refactor_module"]
print(cost_per_task(costs, ids))

6. 别把 OpenAI 的账本当你的预算书

最后一点清醒剂:OpenAI 的 600 美元中位数是「内部研究组织 + 自研模型 + 实验优先文化」的结果,直接照抄会得出错误预算。你的团队更可能面对的是:外部 API 价格、更保守的任务类型、以及必须人工评审的交付物。务实的做法是把 OpenAI 的数字当上限参照,而不是平均值:先小范围试点两周,记录每类任务的成本/任务比和人工抽检率,再决定是否扩张。同时记住报告的另一个隐含信息——高层级规划仍然只占极小比例的 token,说明人机分工的边界短期内不会消失:让 Agent 干活,让人决定干什么、验收干得对不对,这才是 ROI 最高的组织形态。

# A daily budget gate: warn, then block, as spend climbs.
class AgentBudget:
    def __init__(self, daily_limit):
        self.daily_limit = daily_limit
        self.spent = 0.0

    def charge(self, amount):
        self.spent += amount
        if self.spent > self.daily_limit * 0.8:
            print("WARN: over 80% of daily budget")
        if self.spent > self.daily_limit:
            raise RuntimeError("BLOCK: daily budget exceeded")

budget = AgentBudget(daily_limit=100.0)
budget.charge(95.0)  # prints WARN

📌 常见问题 FAQ

OpenAI 的研究报告是什么时候发布的?

2026 年 9 月 6 日发布于 OpenAI 官网,标题为《Research acceleration: The view inside OpenAI》,随后被 Fortune、Business Insider 等媒体在 9 月 7-8 日广泛报道。

OpenAI 的研究报告是什么时候发布的?

2026 年 9 月 6 日发布于 OpenAI 官网,标题为《Research acceleration: The view inside OpenAI》,随后被 Fortune、Business Insider 等媒体在 9 月 7-8 日广泛报道。

OpenAI 的研究报告是什么时候发布的?

2026 年 9 月 6 日发布于 OpenAI 官网,标题为《Research acceleration: The view inside OpenAI》,随后被 Fortune、Business Insider 等媒体在 9 月 7-8 日广泛报道。

OpenAI 的研究报告是什么时候发布的?

2026 年 9 月 6 日发布于 OpenAI 官网,标题为《Research acceleration: The view inside OpenAI》,随后被 Fortune、Business Insider 等媒体在 9 月 7-8 日广泛报道。

OpenAI 的研究报告是什么时候发布的?

2026 年 9 月 6 日发布于 OpenAI 官网,标题为《Research acceleration: The view inside OpenAI》,随后被 Fortune、Business Insider 等媒体在 9 月 7-8 日广泛报道。

OpenAI 研究员每天花多少钱在 Agent 上?

按 OpenAI 报告,到 2026 年 8 月中旬,中等水平研究员按 API 价格每天消耗超过 600 美元推理量,组织内前 10% 用户每天超过 7000 美元。

OpenAI 研究员每天花多少钱在 Agent 上?

按 OpenAI 报告,到 2026 年 8 月中旬,中等水平研究员按 API 价格每天消耗超过 600 美元推理量,组织内前 10% 用户每天超过 7000 美元。

OpenAI 研究员每天花多少钱在 Agent 上?

按 OpenAI 报告,到 2026 年 8 月中旬,中等水平研究员按 API 价格每天消耗超过 600 美元推理量,组织内前 10% 用户每天超过 7000 美元。

OpenAI 研究员每天花多少钱在 Agent 上?

按 OpenAI 报告,到 2026 年 8 月中旬,中等水平研究员按 API 价格每天消耗超过 600 美元推理量,组织内前 10% 用户每天超过 7000 美元。

OpenAI 研究员每天花多少钱在 Agent 上?

按 OpenAI 报告,到 2026 年 8 月中旬,中等水平研究员按 API 价格每天消耗超过 600 美元推理量,组织内前 10% 用户每天超过 7000 美元。

「3.1 个 Agent 工作日」是什么意思?

Fortune 报道称,OpenAI 研究组织平均每投入 1 个工作日的人类劳动,就有相当于 3.1 个工作日的 Agent 并行工作,反映 Agent 已深度嵌入日常研发流程。

「3.1 个 Agent 工作日」是什么意思?

Fortune 报道称,OpenAI 研究组织平均每投入 1 个工作日的人类劳动,就有相当于 3.1 个工作日的 Agent 并行工作,反映 Agent 已深度嵌入日常研发流程。

「3.1 个 Agent 工作日」是什么意思?

Fortune 报道称,OpenAI 研究组织平均每投入 1 个工作日的人类劳动,就有相当于 3.1 个工作日的 Agent 并行工作,反映 Agent 已深度嵌入日常研发流程。

「3.1 个 Agent 工作日」是什么意思?

Fortune 报道称,OpenAI 研究组织平均每投入 1 个工作日的人类劳动,就有相当于 3.1 个工作日的 Agent 并行工作,反映 Agent 已深度嵌入日常研发流程。

「3.1 个 Agent 工作日」是什么意思?

Fortune 报道称,OpenAI 研究组织平均每投入 1 个工作日的人类劳动,就有相当于 3.1 个工作日的 Agent 并行工作,反映 Agent 已深度嵌入日常研发流程。

普通团队应该照抄 OpenAI 的预算吗?

不应该。OpenAI 是内部研究组织加自研模型的特例;普通团队应先用成本/任务比做两周试点,把 OpenAI 的数字当上限参照而不是平均值。

普通团队应该照抄 OpenAI 的预算吗?

不应该。OpenAI 是内部研究组织加自研模型的特例;普通团队应先用成本/任务比做两周试点,把 OpenAI 的数字当上限参照而不是平均值。

普通团队应该照抄 OpenAI 的预算吗?

不应该。OpenAI 是内部研究组织加自研模型的特例;普通团队应先用成本/任务比做两周试点,把 OpenAI 的数字当上限参照而不是平均值。

普通团队应该照抄 OpenAI 的预算吗?

不应该。OpenAI 是内部研究组织加自研模型的特例;普通团队应先用成本/任务比做两周试点,把 OpenAI 的数字当上限参照而不是平均值。

普通团队应该照抄 OpenAI 的预算吗?

不应该。OpenAI 是内部研究组织加自研模型的特例;普通团队应先用成本/任务比做两周试点,把 OpenAI 的数字当上限参照而不是平均值。

衡量 Agent ROI 最该看什么指标?

看「成本/已完成任务」而不是 token 数或生成行数:把一个可验证的任务作为记账单位,配合人工抽检率,才能判断 Agent 是否真的赚回成本。

衡量 Agent ROI 最该看什么指标?

看「成本/已完成任务」而不是 token 数或生成行数:把一个可验证的任务作为记账单位,配合人工抽检率,才能判断 Agent 是否真的赚回成本。

衡量 Agent ROI 最该看什么指标?

看「成本/已完成任务」而不是 token 数或生成行数:把一个可验证的任务作为记账单位,配合人工抽检率,才能判断 Agent 是否真的赚回成本。

衡量 Agent ROI 最该看什么指标?

看「成本/已完成任务」而不是 token 数或生成行数:把一个可验证的任务作为记账单位,配合人工抽检率,才能判断 Agent 是否真的赚回成本。

衡量 Agent ROI 最该看什么指标?

看「成本/已完成任务」而不是 token 数或生成行数:把一个可验证的任务作为记账单位,配合人工抽检率,才能判断 Agent 是否真的赚回成本。