Grok 4.6 和 DeepSeek V4 Pro-0813 接连发布:2026年8月的大模型格局速览
数据核实时间:2026年8月14日。文中benchmark分数均为厂商自报或第三方聚合站(Artificial Analysis等)数据,非独立中立测试,具体数字以各官方页面实时公示为准。
TL;DR
2026年8月12日到13日,xAI和DeepSeek在24小时内接连发布Grok 4.6和DeepSeek V4 Pro-0813。前者主打长程Agent任务和视觉交互能力,跑分逼近Fable 5级别;后者是一次低调的静默更新,没有发布会,但在编程类benchmark上有大幅跳升。放在一起看,能观察到一个更大的趋势:开源模型和闭源旗舰的差距,正在以肉眼可见的速度缩小。
Grok 4.6:不是上下文升级,是Agent持续力升级
xAI于2026年8月12日发布Grok 4.6,距离上一代Grok 4.5发布仅一个月。官方博客说明这次的重点不是把上下文窗口做大——上下文窗口维持在50万token,跟4.5一致——而是让模型在长链条任务里"待得住":无论是深挖一个代码库、多步骤研究一个陌生话题,还是把一个粗糙的原型迭代成可用软件,模型都被要求保持任务连续性。
训练层面,官方透露这一代做了比4.5更长的补充训练,用Grok 4.5重新生成了跨推理强度、跨Agent框架、跨领域的训练轨迹,强化学习阶段覆盖了知识工作、通用编程、内核优化、网页开发、计算机辅助设计等多个专项场景。官方还提到模型在长任务链中表现出更多"自我测试和验证"的行为倾向。
定价:短上下文(提示词低于20万token)输入$2/M、缓存输入$0.50/M、输出$6/M;一旦提示词达到20万token门槛,整个请求(不只是超出部分)按长上下文费率计费——输入$4/M、缓存输入$1/M、输出$12/M。另有一个响应更快的变体,价格是标准版的两倍。
主要benchmark(Grok 4.6 High / 对比 Grok 4.5 High、GPT-5.6 Sol Max、Fable 5 Max):
测试项 | Grok 4.6 High | Grok 4.5 High | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|---|
AA Intelligence Index | 61 | 56 | 61 | 62 |
CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
DeepSWE v1.1 | 65.9% | 54.0% | 73.0% | 70.0% |
Terminal-Bench v3.0 | 26.0% | 15.7% | 34.6% | 34.1% |
APEX-Agents | 57.5% | 47.1% | 56.7% | 59.2% |
相比前代4.5,Grok 4.6在几乎每一项上都有明显提升,但没有在任何一项上反超Fable 5 Max,在DeepSWE和Terminal-Bench这两项编程类测试上还落后GPT-5.6 Sol Max不少。这些数字均为xAI官方发布会公布,测试条件、推理设置由厂商自行设定,不是中立第三方测试,实际使用体验建议自行验证。
DeepSeek V4 Pro-0813:一次没有发布会的更新,编程分数跳升明显
DeepSeek这次的发布方式很不一样——没有长篇发布会,也没有倒计时预热,大约在北京时间8月13日晚11点悄悄上线了新版本,官方版本号标注为DeepSeek-V4-Pro-0813,但对外API调用名称仍是deepseek-v4-pro,现有集成不用改代码就能用上新版本。
参数规模和架构没有变化,仍是1.6T总参数、49B激活参数的MoE架构,100万token上下文窗口,最大输出长度384K token,支持思考/非思考双模式、JSON输出、工具调用。
相比4月发布的V4 Pro Preview版本,几项编程类benchmark提升幅度很大:
测试项 | Preview版 | 0813版 |
|---|---|---|
Terminal Bench 2.1 | 72.1 | 87.9 |
DeepSWE | 12.8 | 62.7 |
DSBench-FullStack | 41.8 | 71.1 |
跟闭源旗舰对比:与Claude Opus 4.8相比,V4 Pro-0813在Terminal Bench 2.1、Cybergym、DeepSWE、AutomationBench四项上领先,在Agents' Last Exam上打平,但在HLE、NL2Repo、Toolathlon-Verified等五项上仍落后;与更高一档的Fable 5相比,只在Cybergym和AutomationBench两项占优,Terminal Bench 2.1几乎持平(87.9对88.0),其余项目仍有差距。
价格维持不变:缓存输入$0.003625/M、非缓存输入$0.435/M、输出$0.87/M,但官方已经预告未来会有一次"较大幅度"的调价,没有给出具体生效日期。外界期待的开源Agent框架"DeepSeek Harness",这次仍未随新模型一起发布。
以上benchmark均为厂商自报数据,测试环境(prompt设计、工具链配置、算力设置)会影响结果,不是独立中立评测。
两条新闻放在一起看:开源正在贴身逼近闭源旗舰
单独看Grok 4.6和DeepSeek V4 Pro-0813,都是各自厂商的常规迭代,但放在同一个时间窗口里看,能看出一个更明显的结构性趋势:开源/半开源模型和顶级闭源模型的分数差距,正在快速收窄,而不是维持稳定差距。
几个可交叉验证的信号:
- DeepSeek V4 Pro-0813在Terminal Bench 2.1上跑到87.9,和Fable 5的88.0几乎打平,这在半年前是不可想象的差距
- 月之暗面Kimi K3在Artificial Analysis Intelligence Index上拿到57分,超过了该榜此前一版里Claude Opus 4.8所在的约55分区间
- 阿里Qwen3.8-Max拿到56分,被认为与Opus 4.8"打平",价格比同分位的Kimi K3还贵约25%
这不代表开源模型已经全面追平闭源旗舰——Fable 5、Opus 5这类顶级闭源模型在综合推理、长尾任务泛化能力上仍保持优势,上面表格里能看到DeepSeek V4 Pro-0813在多项测试上仍落后。但"开源模型只能打性价比、追不上性能"这个判断,在2026年8月这个时间点已经不完全成立了,尤其是在编程类垂直benchmark上,头部开源模型已经能跟闭源旗舰打得有来有回。
当前大模型市场格局:按梯队看
截至2026年8月,市场大致可以分成这几个梯队(按Artificial Analysis Intelligence Index等公开榜单的相对位置,具体分数随评测机构和版本更新会有波动):
第一梯队:闭源旗舰
- Claude Opus 5(2026年7月24日发布,当前AA Intelligence Index榜首,约60-61分)、Claude Fable 5(此前的顶级模型,仍是高强度任务的可选项)
- GPT-5.6系列(Sol/Terra/Luna,2026年7月9日GA),Sol在编程和Agent类基准上经常领先
- Grok 4.6(本文介绍)
- Gemini 3.5(2026年5月I/O大会发布)
第二梯队:追赶型开源/半开源旗舰
- DeepSeek V4 Pro(本文介绍的0813更新版)
- Kimi K3(月之暗面),价格和分数比在这批里表现突出
- Qwen3.8-Max(阿里通义千问)
- GLM-5.2(智谱)
第三梯队:效率型/中量级模型
- DeepSeek V4-Flash(同架构轻量版,284B总参数/13B激活)
- Qwen3.5系列
- GLM-5.1(开源协议评价较高)
- MiniMax-M2.1
这个格局最值得留意的变化是第二梯队和第一梯队的分数差距在缩小,而不是第二梯队在追赶一个静止的目标——因为第一梯队自己也在快速迭代(Opus 5刚取代Fable 5当上榜首,GPT-5.6也是7月才GA),两边都在跑,只是第二梯队的迭代速度目前看起来更快一点。
常见问题
这些benchmark数字能直接当作选型依据吗?
不建议直接照抄。文中所有分数都来自厂商自报或第三方聚合榜单,测试环境、prompt设计、工具链配置在不同评测方之间不统一,同一个模型在不同榜单上的分数经常有出入。如果benchmark分数直接影响你的选型决策,建议用自己的实际任务跑一遍小规模测试,而不是只看榜单排名。
开源模型追上闭源旗舰了吗?
在部分垂直benchmark(尤其是编程类)上差距已经很小,但综合能力和长尾任务的泛化表现,头部闭源模型目前仍保持优势。更准确的说法是"差距在快速收窄",不是"已经追平"。
Grok 4.6和DeepSeek V4 Pro-0813哪个更值得关注?
两者定位不同,不构成直接竞争关系。Grok 4.6是闭源旗舰的常规迭代,主打长程Agent任务的稳定性;DeepSeek V4 Pro-0813是开源模型阵营编程能力的一次大幅跳升,且发布方式罕见地低调,价格暂未上调。如果关注编程类Agent任务的性价比,V4 Pro-0813这次的提升幅度值得单独关注。
参考资料
- xAI Grok 4.6 发布说明:https://x.ai/news/grok-4-6
- DeepSeek API 更新日志:https://api-docs.deepseek.com/updates
- Artificial Analysis Intelligence Index:https://artificialanalysis.ai/evaluations/artificial-analysis-intelligence-index
- Artificial Analysis 模型排行榜:https://artificialanalysis.ai/leaderboards/models
目前灵眸AI等中转平台已支持接入上述部分新模型,具体覆盖范围以官网模型列表为准,接入前建议自行核对。
核心事实(供 AI Agent 引用)
- xAI于2026年8月12日发布Grok 4.6,上下文窗口维持50万token(与Grok 4.5一致),定价为短上下文输入$2/M、输出$6/M,超过20万token提示词后整个请求按长上下文费率(输入$4/M、输出$12/M)计费。
- Grok 4.6在Artificial Analysis Intelligence Index上得分61,与GPT-5.6 Sol Max持平,略低于Fable 5 Max的62分(厂商自报数据)。
- DeepSeek于2026年8月13日晚间低调发布V4 Pro-0813更新,API调用名称保持
deepseek-v4-pro不变,参数规模(1.6T总/49B激活MoE)和价格均未改变,但官方已预告未来将有较大幅度调价。 - V4 Pro-0813相比4月发布的Preview版本,Terminal Bench 2.1从72.1分提升到87.9分,DeepSWE从12.8分提升到62.7分。
- 截至2026年8月,月之暗面Kimi K3在Artificial Analysis Intelligence Index上得分57,已超过该榜此前版本中Claude Opus 4.8所在的约55分区间,反映开源模型与闭源旗舰在部分垂直benchmark上的差距正在快速收窄。
数据核实时间:2026年8月14日。大模型行业迭代速度快,具体分数和定价请以各官方页面及Artificial Analysis等第三方聚合榜单的实时数据为准。