返回文章 收藏
← 返回文章列表
AI 应用 · 模型选型

GPT-5.6 Luna 降价、Sol 变得更可靠,DeepSeek 为什么成了 AI 模型选型的“成本斩杀线”?

AI 模型竞争正在从“谁最聪明”转向“谁能以合理成本稳定完成任务”。真正应该比较的是一次通过率、返工时间和单次任务总成本。

CZ Overseas 编辑部
外贸企业按任务风险和成本选择 AI 模型的三层路由概念图

最近 AI 圈有三个明显信号:Luna 的使用费率下降,Sol 在 ChatGPT 里更强调直接回答与事实可靠性,DeepSeek V4 Flash 则继续压低 Agent 和工具调用任务的价格下限。

2026 年 8 月 13 日更新:DeepSeek 官方 API 页面已显示 V4 Pro 0813,xAI 同时发布了 Grok 4.6。本文保留原有模型路由框架,并补充两款模型对价格—能力曲线的最新影响。

把三件事放在一起看,企业不该只问“哪个模型最强”,还要问:这个任务值得使用最强模型吗?更便宜的模型能不能稳定完成?多花十倍甚至几十倍费用,究竟换来了什么?

Q1:GPT-5.6 Luna 真的降价 80% 了吗?

是,但必须区分使用场景。OpenAI 的 ChatGPT/Codex 更新记录写明,GPT-5.6 Luna 的使用费率下降 80%,Terra 下降 20%。这更接近订阅用户的额度与 credits 消耗变化,不能直接理解成 API 价格也下降 80%。

截至 2026 年 8 月 7 日,四款模型的公开 API 标价如下:

模型输入 / 百万 tokens缓存输入输出 / 百万 tokens
GPT-5.6 Sol5 美元0.50 美元30 美元
GPT-5.6 Luna1 美元0.10 美元6 美元
DeepSeek V4 Flash0.14 美元0.0028 美元0.28 美元
DeepSeek V4 Pro0.435 美元0.003625 美元0.87 美元

按标价直接比较,DeepSeek V4 Flash 的非缓存输入价格约为 Luna 的七分之一,输出约为 Luna 的二十一分之一。但实际账单还会受输出长度、推理强度、缓存命中率、工具调用和任务成功率影响。

Q2:GPT-5.6 Sol 的性能提升体现在哪里?

8 月 6 日更新的重点不是跑分再次上涨,而是 ChatGPT 中的实际回答质量。OpenAI 表示,更新后的 Sol 会先回答用户真正关心的问题,减少不必要展开;在日期、数字、规则、来源或假设等场景中,也会更谨慎地使用检索资料。

OpenAI 内部评测显示:与 GPT-5.5 Instant 相比,至少包含一处事实错误的回答在 Sol 上减少约 68%,在 Luna 上减少约 62%。这是内部评测方向,不代表所有真实任务固定提升同样幅度。

边界也很重要:OpenAI 明确说明,8 月 6 日更新只影响 ChatGPT 对话体验,ChatGPT Work 和 Codex 中使用的 Sol 没有随这次发布变化。

OpenAI 7 月公开数据中,Sol 在 Terminal-Bench 2.1、Artificial Analysis Coding Agent Index 和 BrowseComp 上分别为 88.8%、80 和 90.4%;Luna 分别为 84.7%、74.6 和 83.3%。这些数据支持 Sol 更适合复杂编码、研究和工具协作,但不等于每个日常任务都应该使用 Sol。

Q3:DeepSeek 真的是各大 LLM 的“斩杀线”吗?

如果“斩杀线”指能力全面领先,这个说法不准确。NIST 旗下 CAISI 对 DeepSeek V4 Pro 的评测认为,其综合能力仍比当时最前沿模型落后约八个月,在部分隐藏或半私有测试中仍有明显差距。

但如果“斩杀线”指成本效能基线,这个说法有现实依据。同一份 CAISI 评测显示,DeepSeek V4 在七项可比较测试中有五项比能力相近的 GPT-5.4 mini 更省钱,成本差异从便宜 53% 到贵 41% 不等。

7 月 31 日更新后的 V4 Flash 又强化了 Agent、代码执行和工具调用能力。DeepSeek 官方公布 Terminal-Bench 2.1 为 82.7、Toolathlon verified 为 70.3、DeepSWE 为 54.4、DSBench-FullStack 为 68.7,并支持 Responses API、适配 Codex 使用方式。

FACT / JUDGEMENT

来源事实与 CZ Overseas 判断要分开

这些自报分数使用 DeepSeek 自己说明的 harness、max effort 和 temperature 等设置,不能与 OpenAI 表格中的数字直接相减。CZ Overseas 将 DeepSeek 称为“商业选型的最低证明线”,是根据价格、能力更新和第三方评测形成的业务判断,不是厂商或 NIST 的原话。

2026-08-13 更新:DeepSeek V4 Pro 0813 与 Grok 4.6 改变了什么?

先纠正传播最广的一句话:两款模型并不是“同日首次发布”。DeepSeek 已在 4 月推出并开源 V4 Preview,其中包含 V4 Pro;8 月 13 日能够从官方页面确认的新变化,是 deepseek-v4-pro 当前对应版本已经切换为 DeepSeek-V4-Pro-0813。截至本次核验,DeepSeek 尚未发布对应的完整独立公告或新权重说明。

Grok 4.6 则是 8 月 12 日正式发布的新模型。xAI 将它定位于长时间运行的 Agent、复杂编码、知识工作以及交互式和视觉项目,并已经通过 Cursor、Grok Build、xAI API 及多家合作平台提供。

模型输入 / 百万 tokens输出 / 百万 tokens更适合观察的业务位置
DeepSeek V4 Pro 08130.435 美元0.87 美元高并发、长上下文、可复核任务的成本基线
Grok 4.62 美元6 美元复杂 Agent、编码和知识工作的中高价位挑战者
Claude Fable 510 美元50 美元最复杂、长时间运行且容错成本高的旗舰任务

Grok 4.6 的公开标价是 Fable 5 的五分之一输入价和约八分之一输出价;DeepSeek 当前标价又明显低于 Grok。不过 DeepSeek 官方已经提示,近期计划提高 API 整体价格,预计涨幅较大,因此当前价格不能视为长期承诺。

能力上也不能只看一句“逼近 Fable 5”。xAI 自报 Grok 4.6 的 Artificial Analysis Intelligence Index 为 61,GPT-5.6 Sol 为 61,Fable 5 为 62;CursorBench 3.2 为 69.9%,接近 Fable 5 的 70.5%。但 Grok 4.6 在 DeepSWE 1.1 为 65.9%,低于 Sol 的 73% 和 Fable 5 的 70%;Terminal-Bench 3.0 为 26%,也低于两者。更准确的说法是:它在部分 Agent、编码和知识工作指标上进入前沿区间,而不是全面追平。

UPDATED JUDGEMENT

现在出现的是两条商业基线

DeepSeek 继续压低高频、长上下文和可复核任务的成本效能线;Grok 4.6 则用低于顶级旗舰模型的标价,向复杂 Agent 与知识工作施加价格压力。对企业而言,真正要比较的仍是同一任务的一次通过率、返工时间、工具调用稳定性和总成本。

完整时效解读:DeepSeek V4 Pro 切换至 0813,Grok 4.6 发布:外贸团队的 AI 模型成本线怎么变了?

Q4:外贸团队应该怎么选?

不要只选一个模型。更现实的方法是按任务风险、复杂度和复核成本分层。

01高频 · 低风险

Luna / DeepSeek Flash

询盘分类、参数提取、多语言初稿、客户名单清洗、公开网页摘要和批量 FAQ 初稿。

02需要判断 · 可复核

Terra / DeepSeek Pro

客户背调初筛、竞品归纳、报价差异解释、政策影响初步分析和合同结构化对比。

03复杂 · 高后果

Sol + 人工复核

复杂项目方案、多来源研究、自动化系统设计、重要合规分析和长流程 Agent 任务。

旗舰模型的价值不只是“回答更聪明”,而是减少多步骤任务中途跑偏、遗漏证据或错误调用工具的概率。低成本模型则适合大量规则清楚、容易抽查的工作。

Q5:企业选模型时最容易犯什么错?

01

只看 benchmark,不测自己的任务

公开测试领先,不代表它在你的产品资料、客户邮件、内部术语和审批流程上同样领先。

02

只看 token 单价,不看一次任务是否成功

便宜模型如果需要反复重试、输出过长或频繁人工返工,最终成本可能更高。

03

把内部资料直接发给公共模型

客户名单、报价、合同、身份信息和未公开产品资料,应先按企业数据政策分级。

04

所有工作都用同一个模型

简单分类使用旗舰模型是浪费;复杂研究只用最低价模型,也会在错误和返工上付出成本。

一个更实用的模型评测方法

从真实工作里选 30—50 个任务,给不同模型使用同一份输入和验收标准,然后记录:

  1. 一次通过率;
  2. 事实错误和遗漏数量;
  3. 人工修改时间;
  4. 平均响应时间;
  5. 单次任务实际费用;
  6. 工具调用和结构化输出成功率;
  7. 敏感数据与合规边界。

最后比较的不是“谁的总榜分数最高”,而是“谁能用最低总成本,稳定交付可用结果”。

延伸阅读:DeepSeek V4 Flash 获全球开发者关注,低成本 Agent 进入实测窗口

结论:模型选型正在变成路由问题

Luna 降价说明轻量模型正在承担更多高频工作;Sol 的更新说明旗舰模型开始把竞争重点放到事实可靠性和真实使用体验;DeepSeek 则持续压低可接受能力的价格下限。

对外贸企业来说,这不是一场必须押注单一厂商的比赛。更合理的做法,是用低成本模型覆盖大量可复核任务,用旗舰模型处理少量高价值问题,再用自己的业务数据持续评测。

DeepSeek 未必是所有模型的能力“斩杀线”,但它已经成为一条很难绕开的成本效能基线。

FAQ

GPT-5.6 Luna 适合直接替代 Sol 吗?

不适合一刀切替代。Luna 更适合清晰、重复、高并发的任务;复杂推理、长流程工具协作和高后果决策仍应优先测试 Sol。

DeepSeek V4 Flash 能用于商业项目吗?

官方 API 提供商业调用。实际使用前仍需核对许可证、部署方式、数据处理政策、所在行业要求和服务商条款。

benchmark 最高的模型就是最适合企业的模型吗?

不是。企业还应比较成功率、返工时间、延迟、总成本、数据安全和工具稳定性。

外贸团队最值得先测试哪个场景?

优先测试询盘分类、产品参数提取、多语言初稿和公开资料摘要。这些任务量大、风险较低,也容易建立明确验收标准。

来源与核验记录

原文价格和产品状态于 2026 年 8 月 7 日核验;DeepSeek V4 Pro 0813、Grok 4.6 与 Fable 5 信息于 2026 年 8 月 13 日增量核验。厂商可能继续调整费率与版本,正式采购前应重新确认。

  1. OpenAI:Improving GPT-5.6 Sol in ChatGPT(2026-08-06)
  2. ChatGPT Learn:What's new
  3. OpenAI:GPT-5.6
  4. OpenAI API:GPT-5.6 Sol
  5. OpenAI API:GPT-5.6 Luna
  6. DeepSeek API Change Log:V4 Flash Update
  7. DeepSeek API:Models & Pricing
  8. DeepSeek V4 Flash Model Card
  9. NIST CAISI:Evaluation of DeepSeek V4 Pro
  10. Artificial Analysis:Intelligence Index v4.1
  11. DeepSeek:V4 Preview Release(2026-04-24)
  12. DeepSeek V4 Pro 官方模型仓库
  13. xAI:Introducing Grok 4.6(2026-08-12)
  14. Anthropic:Claude Fable 5 官方产品页

从真实任务开始,而不是先押一个模型

先做一轮模型路由测试

如果你正在把 AI 接入询盘处理、客户背调、产品资料整理或市场研究,可以先定义准确率、时间、成本和人工复核标准,再决定哪些任务用低成本模型,哪些值得升级到旗舰模型。

联系 CZ Overseas →