---
格式版本: 2
标题: "AI 时代的记分卡 | OpenAI"
原文链接: "https://openai.com/zh-Hans-CN/index/a-scorecard-for-the-ai-age/"
发布日期: "2026-07-17"
发布时间校准状态: "provisional"
发布时间需复核: "是"
发布时间来源: "fallback:local:strict_original_body"
发布时间证据: "2026年7月17日"
发布时间校准原因: "LLM 仲裁服务异常，按现有强证据临时采用 2026-07-17，后续需复核"
发布时间校准置信度: "medium"
发布时间候选数量: 14
发布时间严格候选数量: 3
发布时间原页读取状态: "source template page reused from URL open"
发布时间未找到原因: ""
发布时间校准时间: "2026-08-10T16:22:22+08:00"
发布时间仲裁状态: "service-error"
发布时间仲裁尝试次数: 2
发布时间仲裁耗时毫秒: 75539
发现时间: "2026-08-10T16:18:32+08:00"
入库时间: "2026-08-10T08:23:38.544Z"
来源平台: "固定入口"
搜索渠道: "fixed_url"
搜索词: "https://openai.com/news/"
匹配关键词:
  - "计算"
  - "交付"
  - "部署"
  - "性能"
相关厂家:
  - "OpenAI"
相关专家:
  []
内容类型: "网页"
抓取工具: "CDP Render"
清洗工具: "CDP Text + Defuddle/Readability 正文提取"
原始附件:
  []
AI优质: "否"
AI打分: 40
AI分档: "非优质"
AI质检状态: "不通过"
AI打分理由: "全文讨论AI投资回报率与模型经济性，未涉及超节点、AI Rack、机柜级系统、硬件架构、供电、散热或互连等主题，与项目关注范围无关。"
AI质检模型: "deepseek-v4-flash"
AI质检时间: "2026-08-10T16:23:44+08:00"
AI主题相关性: 0
AI来源权威性: 15
AI新颖性: 10
AI技术细节: 0
AI商业部署信号: 5
AI完整性: 10
采集批次: "2026年8月10日15点37分56秒"
采集批次ID: "20260810-153756-703"
去重键: "https://openai.com/zh-Hans-CN/index/a-scorecard-for-the-ai-age"
---

2026年7月17日

[公司](https://openai.com/zh-Hans-CN/news/company-announcements/)

我从各地 CFO 那里听到的问题很简单：我们如何从 AI 投入中获得更多价值？

多年来，市场一直通过采用情况来衡量软件的成功：购买了多少席位、活跃用户有多少、续订了多少许可证。理解 AI 的价值，需要一个更有力的衡量标准：完成的工作。

CFO 和其他企业领导者面临的基本经济问题是：AI 完成的工作所创造的价值，是否比产出这些工作的成本增长得更快。

回答这个问题，需要比“每个 Token 成本”这类指标看得更深。成本较低的模型或许 Token 更便宜，但要获得出色结果，可能需要更多尝试、更多时间或更多人工审核。能力更强的模型或许 Token 更贵，但可以一次完成同一项任务。真正重要的是产出成功结果的全部成本，以及这个结果所创造的价值。

AI 时代的终极记分卡可以被理解为“每美元有用智能”。这个指标回答四个关键问题：

1. AI 是否在完成重要的工作？
2. 每项成功任务的成本是多少？
3. 人们能否信赖结果？
4. 随着使用量增长，每一美元 AI 投入是否创造更多价值？

## 1\. 完成了多少有用的工作？

从工作本身开始。

AI 帮助解决了多少客户问题？它帮助发布了多少代码变更？它审核了多少份合同？它为人们节省了多少时间？有多少决策因为在正确时刻获得了正确上下文而得到改善？

当 Token 转化为人们可用的工作时，才会创造价值。随着模型能力增强，它们可以承担更长、更复杂的任务：保持上下文、进行多步推理、跨工具工作，并在过程中持续适应。

最好的起点是一个工作流。定义“完成”意味着什么，并在工作发生的系统中衡量这个结果。

对支持团队来说，“完成”可能意味着一个客户问题得到解决。对工程团队来说，可能意味着一次代码变更通过了测试。对法务团队来说，可能意味着一份合同被准确且按时审核完毕。

以一个准备开展预测评审的财务团队为例。很多工作发生在最终决策之前：找到最新预测，把数据移入 Excel 或 Sheets，识别变化，核对各个标签页，重做幻灯片，并检查所有数字是否完全吻合。  
  
ChatGPT 工作可以承担其中大部分流程，让团队有更多时间专注于真正重要的问题：发生了什么变化？为什么？接下来我们该怎么做？

这就是“每美元有用智能”的实际体现。更多工作以更快速度完成，同时人们把更多时间用于判断、创造力和专业能力。

## 2\. 一项成功任务的实际成本是多少？

下一个问题是，高质量完成这项工作的成本是多少。

AI 任务差异很大。快速回答可能只需要很少计算。编码、研究或财务工作流可能涉及更深入的推理、工具使用和许多操作。这些更复杂的任务可能需要更多计算，但也能创造大得多的价值。

在模型层面，每项成功任务的成本取决于价格、使用的计算量，以及达到正确结果的可能性。对企业来说，完整成本还包括员工时间、人工审核、重试和返工。

计算方法很直接：

- 加总完成工作的全部成本。
- 统计达到所需质量标准的任务数量。
- 用全部成本除以成功任务数。

这就是为什么最低的每 Token 价格并不总能带来最低的每结果成本。即使是常规请求，前沿模型也可能带来最佳价值：如果它能一次给出正确答案，就能减少重试、延迟、审核和总计算量。

分层模型系列让客户有更多方式优化这个等式。我们上周发布的 GPT‑5.6 有三个层级：Sol 是我们的旗舰；Terra 在性能与成本之间取得平衡；Luna 是我们速度最快、价格最亲民的模型。

这些层级提供了有用的起点。最终，应由完整任务的经济性来决定合适的模型。客户可以将 Luna 用于快速、高容量的工作流，将 Terra 用于需要更大深度的工作，或在更强推理能以更少尝试带来最佳结果时使用 Sol。

我们训练 GPT‑5.6，是为了让每个 Token 产出更多有用工作。在 Artificial Analysis 编码智能体指数上，GPT‑5.6 Sol 在最大推理设置下创下新的最先进水平，同时输出 Token 比另一款领先模型少 54%。下方图表展示了这一对比。

***DeepSWE v1.1*** *：长周期工程任务；GPT‑5.6 Sol 达到 72.7% 的新高，高于 Claude Fable 5 的 69.9%，且预估 API 成本低 36.2%。*

在整个 GPT‑5.6 系列中，目标始终一致：每一美元完成更多成功的工作。更高效率让现有任务更可负担。更强能力让全新的工作类型成为可能。

每一代新模型都应改善这个等式的两端。客户应能完成更有价值的工作，同时每项任务的完成成本持续下降。

## 3\. AI 多常把工作做对？

第三项衡量标准是可靠性。

AI 的采用往往会分阶段加深。首先，AI 帮助起草。然后，它寻找上下文，并跨工具和数据进行推理。随着时间推移，它开始采取行动、处理例外情况并完成工作流，而人在需要时提供判断和控制。

每一步都会创造更多价值，也对系统提出更高要求。

可靠性具有直接的经济价值。当结果准确、来源清晰、一致，并能适当地升级处理时，人们用于审核、纠正和重复工作的时间就会减少。成功任务的成本会降低，组织也会更有信心在更重要的工作流中使用 AI。

团队可以通过跟踪三个结果来具体衡量：

- 可直接使用：交付结果已达到质量标准。
- 需要修正：结果需要再次尝试或人工编辑。
- 需要升级处理：需要有人介入并完成工作。

这些指标比单纯的模型准确率讲述了更丰富的故事。它们显示 AI 是否真正减少了完成项目所需的工作量。

可靠性还需要清晰的边界。在 AI 从起草转向采取行动之前，组织应明确：

- 系统可以访问哪些数据。
- 它可以使用或更改哪些系统。
- 何时应由人来审核或批准某项行动。

安全、安保、隐私和控制构成更深入使用的基础。人们需要了解系统如何运行、他们的数据如何被处理，以及系统的行动如何受到治理。

ChatGPT 工作建立在 ChatGPT Enterprise 的安全、隐私、合规和工作空间管理基础之上。这使组织能够为 AI 提供更多上下文，并让它接入更有价值的工作流，同时保持适当监督。

能力赢得首次使用。可靠性让 AI 成为完成工作的方式之一。

## 4\. 随着使用量增长，每一美元 AI 投入能买到更多工作吗？

最后一个问题是，规模扩大时经济性是否改善。

公司可以通过长期跟踪同一个工作流来衡量这一点。跟踪达到质量标准的任务数量、完成这些任务的总成本，以及每项成功任务的成本。如果已完成工作增长快于总成本，而质量保持不变或有所提升，那么每一美元 AI 投入都在创造更多价值。

算力处在这个等式的核心。

算力驱动研究，也驱动 AI 完成的每一项任务。它塑造产品质量、速度、可靠性、可用性和成本。训练算力构建未来能力。推理算力交付今天的有用工作。两者都应转化为客户更好的结果。

更好的模型、更高效的推理、专用硬件、更高利用率、更智能的路由和更强的产品设计，都会提高算力回报。每一代基础设施都有助于训练能力更强的模型。更好的算法、硬件和软件随后帮助更高效地服务这些模型。

客户以人的方式感受到这些改进：更好的答案、更快的结果、更少的修正、更可靠的产品，以及更低的所需工作成本。

这些收益会复合增长。更好的基础设施加速研究。研究产出能力更强、效率更高的模型。更好的模型改进产品。更好的产品推动采用、学习和收入增长。这种增长支持对下一代研究、算力、部署和安全的持续投资。

OpenAI 通过一个共享智能平台把这些要素整合在一起。人们通过 ChatGPT 和 ChatGPT 工作使用它。开发者通过 Codex 和 API 基于它进行构建。企业将它部署到工作发生的系统中。

当其中一层得到改进，每个产品和每位客户都能受益。

综合来看，这四项衡量标准告诉我们，每美元有用智能是否在提升。

有用工作告诉我们 AI 产出了什么。每项成功任务的成本告诉我们，达成结果需要付出什么。可靠性告诉我们，人们能有信心使用多少工作成果。规模化价值告诉我们，随着时间推移，每一美元和每一单位算力是否完成了更多。

目标是让 AI 帮助人们做更多有意义的工作、做出更好的决策，并把更多时间用于工作中需要鲜明的人类判断和创造力的部分。

我们的工作是让这个等式在每一代中变得更好：能力更强的模型，更快速、更可靠的结果，以及客户所需工作更低的成本。

这就是 AI 如何随着时间推移，对更多人和组织变得更加有用。

## 继续阅读[OpenAI 与美国心理学会携手推动青少年负责任地使用 AI](https://openai.com/index/openai-and-apa-partner-to-advance-responsible-ai/)

[

公司

](https://openai.com/index/openai-and-apa-partner-to-advance-responsible-ai/)[全球如何运用 ChatGPT 开展工作](https://openai.com/index/how-the-world-is-putting-chatgpt-to-work/)

[

公司

](https://openai.com/index/how-the-world-is-putting-chatgpt-to-work/)
