出品 | 网易科技
作者 | 小小
编辑 | 王凤枝
DeepSeek V4 Pro正式版终于来了?
8月12日,DeepSeek官方API定价页悄悄把V4 Pro的模型版本更新为DeepSeek-V4-Pro-0813。新版本继续沿用原来的模型ID和调用方式,已经接入DeepSeek API以及相关开发工具。
比起预览版,这次更新的重点并不只是"模型变强了"。
DeepSeek正在把V4 Pro的能力重点推向智能体、编程、工具调用和长流程任务。模型不仅要回答问题,还要进入代码仓库、调用工具、执行任务、修改代码,再根据结果继续往下走。
从DeepSeek自报数据和开发者测试来看,DeepSeek V4 Pro 0813在编码、智能体任务和工具使用方面的表现有明显提升,一些测试已经接近甚至超过部分海外前沿模型。
与此同时,它依然延续了DeepSeek最具辨识度的低成本路线。在部分智能体任务中,DeepSeek V4 Pro 0813与Claude、Fable等顶级模型的性能差距已缩小到约5%,但Claude、Fable的价格最高却是DeepSeek V4 Pro的45倍。
这背后对应着行业里的一个变化:模型之间比的,已经不只是每百万Token多少钱,而是完成一个复杂任务到底要花多少钱。
不过,真实体验也说明,这条路并没那么容易。
一些开发者发现,在长时间连续执行时,DeepSeek V4 Pro 0813仍会出现提前停止、反复思考以及部分任务完成质量不稳定的问题。
所以V4 Pro这次真正的看点,不在分数,而在它能不能把DeepSeek一贯的价格优势,延伸到智能体和长任务这些更吃稳定性的场景里。
01 0813版上线,最大变化是智能体能力
V4 Pro此前已经存在,但一直是预览阶段。8月12日上线的0813版本,意味着这款旗舰模型进入GA阶段。
DeepSeek官方文档确认,模型ID仍是deepseek-v4-pro,调用方式没变。OpenRouter也将DeepSeek V4 Pro 0813标记为正式发布版本,同一天上线。OpenCode Go随后宣布支持这一模型。
从产品能力看,DeepSeek V4 Pro 0813支持工具调用和结构化输出,同时提供OpenAI ChatCompletions、Anthropic Messages以及DeepSeek自己的Responses API。模型支持不同的推理强度,包括非思考、高推理强度和最大强度。
它还拥有100万Token上下文窗口和384K Token最大输出。对于大型代码库、长文档以及需要多轮执行的智能体任务,这意味着一次调用能塞进更多上下文,也能保留更长的执行过程。
DeepSeek V4 Pro 0813的底层架构也保持了较大规模。模型卡显示,它是一个混合专家模型,总参数约1.6万亿,每个Token激活约490亿参数。DeepSeek称,通过新的注意力机制,可以把百万Token场景下的单Token推理计算量降低到V3.2的27%,KV缓存则降低到10%。
不过,这些架构和模型卡数据主要来自DeepSeek自己披露,0813版最亮眼的一批智能体基准结果,截至资料发布时还没有经过独立评测机构完整复现。
在DeepSeek公布的数据里,DeepSeek V4 Pro 0813在Terminal-Bench 2.1上拿到87.9分,预览版为69.8分;DeepSWE从12.8分提高到62.7分,涨了约5倍;CyberGym从68.5分提高到83.3分;AutomationBench从42.1分提高到68.5分。DSBench-FullStack从35.6分提高到61.4分,DSBench-Hard从18.9分提高到50.6分。
放到其他前沿模型旁边看,差距已经比较小。但这不意味着DeepSeek V4 Pro已经全面超过前沿模型。
在无工具调用的Humanity's Last Exam上,DeepSeek报告的成绩为42.7分,跟Claude Opus 5比仍有明显差距。此外,DeepSeek V4 Pro 0813是纯文本模型,不支持视觉输入。
此前模型卡给出的DeepSeek V4-Pro-Max测试结果也显示,该模型在Terminal Bench 2.0、Humanity's Last Exam等项目上仍落后部分前沿系统,但在LiveCodeBench等编码项目上表现突出。
所以,比较稳妥的说法是,DeepSeek V4 Pro 0813在智能体和编程相关任务上的差距已经明显缩小,但离"所有能力全面领先"还有距离。
X用户@Xudong Han整理智能体测试后认为,DeepSeek V4 Pro 0813相较DeepSeek V4 Flash 0731基本是全面提升,尤其是TerminalBench 2.1、DeepSWE和AutomationBench等偏智能体和编程的项目。
他同时指出,Humanity's Last Exam、Toolathlon和DSBench-Hard等任务上,DeepSeek V4 Pro 0813跟最强的一档模型仍有差距。
02价格几乎没动,这才是它最现实的优势
性能提升之外,DeepSeek V4 Pro 0813还有一个很直接的特点:价格没跟着性能一起涨。
目前API价格是每百万输入Token 3元钱,每百万输出Token 6元钱,缓存读取价格为每百万Token 0.025元。
相比之下,Artificial Analysis给出的Claude Opus 5价格为每百万输入5美元、输出25美元。GPT-5.6 Sol则是输入5美元、输出30美元。按标价算,DeepSeek V4 Pro 0813的成本明显低于这些模型。
OpenRouter的数据也提供了一个实际运行中的参考。该平台显示,DeepSeek V4 Pro 0813的提供商标价为输入0.435美元、输出0.87美元,P50延迟约1.52秒,吞吐量约52 Token/s,工具调用错误率平均1.60%,缓存命中率平均91.86%。
当然,OpenRouter的实际平均价格会受到缓存和折扣影响,所以不能简单理解成所有用户最终都会按这个价格付。
开发者@AdityaShipsHQ专门比较了DeepSeek V4 Pro 0813和DeepSeek V4 Flash 0731的成本和能力。他注意到,Pro的API价格大约是Flash的3倍,但在智能体、编程和长流程任务上表现更强。
他的判断是,主要做日常高频任务,Flash仍然有比较合理的性价比;缓存输入的价格差距较小,所以长时间运行的Agent任务,Pro的成本溢价会相对小一些。
这也解释了DeepSeek为什么同时保留Flash和Pro两条产品线。
Flash是2840亿参数的MoE模型,激活参数约130亿,价格只有每百万输入0.14美元、输出0.28美元。V4 Pro则承担更重的推理、长上下文编码和智能体任务。
从并发限制也能看出这种区别。资料显示,Flash支持2500个并发请求,Pro则限制在500个。Pro更多用算力处理复杂任务,Flash则适合高频、高吞吐量的工作。
所以,如果一个开发者只是大量调用模型完成简单任务,Flash可能已经够用。要长时间让模型处理代码、调用工具、进行多轮修改时,Pro才更有价值。
开发者@gmi_cloud对Pro 0813、Pro Preview和Flash 0731做了100个深度研究问题的测试。数据显示,Pro 0813在法律、学术和医学三个领域分别达到100%、83%和67%的正确率;Flash在学术和法律方面分别为75%和67%。
@gmi_cloud据此建议,研究和文档密集型任务可以考虑Flash,医疗、金融等高风险领域则更适合用Pro 0813,并增加人工验证。
03真正上手后,表现没榜单那么整齐
基准测试很好看,但DeepSeek V4 Pro 0813的实际体验没那么简单。
小红书博主"清歌"做了实际测试。她用同一个"Pelican Cycling SVG Exquisite, Details Ultra"提示词测试自行车骑行鹈鹕图像相关任务,DeepSeek V4 Pro 0813思考了237秒、执行25个步骤,预览版则用了105秒、15个步骤。
她的主观感受是,0813版虽然思考时间和步骤更多,但最终效果反而没有明显优于旧版。
她随后又比较了正式版Flash和Pro制作3D中国地图的表现,发现两个模型都有比较明显的"反思"过程,会不断表示准备开始执行,然后进入下一轮思考。Pro的思维链次数相对少一些,同时在她的测试中,Pro体现出的世界知识更丰富,最终生成质量也更好,而Flash在该任务中直接生成失败。
这个测试有一个点值得注意:模型"想得更久",不一定意味着最终结果一定更好。
小红书博主"工具蛙Frog"看到测试表后认为,DeepSeek V4 Pro 0813这次的重点很明显放在智能体能力上。他特别关注Terminal Bench 2.1、DeepSWE、AutomationBench等指标,同时认为NL2Repo、Toolathlon、DSBench等项目上,Claude和Fable依然有优势。
他的关注点也比较实际:真正用编程智能体时,开发者更在意模型能不能进入代码仓库,能不能连续跑几十步,能不能调用工具,改完代码之后能不能把测试跑通,最后能不能把任务完整做完。
这也是V4 Pro这次升级最值得观察的地方。
开发者@CommandCodeAI对DeepSeek V4 Pro 0813、Kimi K3和Opus 5做了FlappyBench测试,用的是相同的"/design"命令,并从游戏玩法、UX/UI和成本几个方面评价。
测试中,DeepSeek V4 Pro 0813得到8分,单次成本约0.0005美元;Kimi K3为9.5分、0.0740美元;Opus 5为9分、0.2539美元。按这组结果,DeepSeek V4 Pro 0813的成本远低于另外两个模型,但最终输出质量仍然略逊一筹。
@CommandCodeAI随后又测了V4 Pro 0813、Kimi K3和GLM 5.2。V4 Pro同样得到8分,Kimi K3为9.5分,GLM 5.2为9分;对应成本分别为0.0005美元、0.0740美元和0.0480美元。按这组测试,DeepSeek V4 Pro 0813的成本分别约低148倍和96倍,但质量评分并没有达到同样的领先幅度。
@CommandCodeAI因此认为,DeepSeek V4 Pro 0813最突出的地方是成本,生成一个能跑的一次性游戏所需要的费用非常低。但从最终输出质量看,Kimi K3仍然排名更高,GLM 5.2也略高于DeepSeek。
这类测试不能代表模型的整体能力,但它提供了排行榜之外的另一个观察角度:在同一个实际任务里,最终交付质量和完成成本并不一定同步变化。
DeepSeek真正夸张的地方,不是"每次都做得最好",而是"做一次太便宜了"。对于允许反复尝试和自动重试的Agent工作流,这两者的经济意义完全不同。
如果任务需要反复尝试几十次,模型每次调用只花很少的钱,成本优势就会被放大;如果任务更看重一次生成的完成度,质量差距仍然要考虑。
长程任务里,还出现了一个现象:模型会不会"提前交卷"?
X平台用户@Text1G做了50轮测试,在reasoning_effort设置为max的情况下,模型跑到42轮就停了,没把全部测试机会用完。他因此提醒,不能只看DeepSeek V4 Pro 0813公布的benchmark,长周期任务能不能完整跑完同样重要。
小红书博主karminski也做了类似观察。他测试50轮长程智能体编程任务,3次测试里有2次在42到43轮左右停下,同样没有用完全部机会。他明确表示,这只是自己的单个案例,目前还不能据此推断其他任务的表现。
至于原因,目前资料没有给出确定结论。karminski提出的可能性包括强化学习阶段的奖励机制,以及长上下文中的注意力衰减,但这仍属于测试者的猜测,不能当成已经确认的模型缺陷。
这一点尤其值得后续观察,因为DeepSeek自己公布的测试数据恰恰显示,DeepSeek V4 Pro 0813最大的提升集中在长周期智能体任务。
如果模型在标准测试中能连续完成任务,但在真实环境里偶尔提前停止,那开发者实际用时仍然要增加外部的重试、检查和任务恢复机制。
真正的竞争,可能也在模型外面的Harness。
Harness可以简单理解为模型外面的"驾驶系统",负责任务规划、工具调用、记忆、验证、重试和权限控制。对智能体来说,同一个模型放在不同Harness里,最终表现可能完全不同。
这意味着V4 Pro真正的使用效果,可能还取决于模型本身之外的工具链。
04 Token很便宜,但Agent真正比的是"完成一个任务多少钱"
目前DeepSeek V4 Pro 0813仍按0.435美元输入、0.87美元输出的价格提供服务,但这个价格本身有两个变量。
一个变量是,DeepSeek的定价页面已经出现涨价提示。该公司计划在不久的将来大幅提高整体API价格,具体方案将通过正式通知公布。
所以,现在看到的低价未必是长期价格。
另一个更重要的变量是,对Agent来说,真实成本从来不只是Token单价。
如果一个模型单次调用只要很少的钱,却需要开发者不断检查、反复重试,甚至在关键节点重新接管,那表面上便宜的模型,最终并不一定意味着整体使用成本更低。
反过来,如果模型能稳定完成复杂任务,那即便价格有所上涨,开发者也可能愿意为这种效率买单。
对Agent应用来说,更值得比较的指标,是"完成一个任务的总成本":模型单价、Token消耗、调用轮数、失败率、重试次数、Harness效率以及人工接管成本,都会计入其中。
这也让DeepSeek V4 Pro 0813的商业意义变得更直接。在当前价格下,它给开发者提供了一个成本很低的前沿级智能体编程选择。但如果未来价格明显上涨,或者真实任务中的失败和重试次数较多,开发者就要重新算这笔账。
所以,V4 Pro接下来真正要证明的,已经不只是"模型有多强",而是它能不能成为一个值得长期放进真实工作流里的工具。
这也是为什么现在去判断V4 Pro是否"全面领先"还太早。
Benchmark能告诉我们模型在哪些能力上取得了进步,开发者测试能告诉我们模型放进真实环境后会发生什么。
两者结合,才能看见一个更完整的V4 Pro。
而从目前这些测试来看,它的优势和问题其实已经逐渐浮现:能力正在逼近前沿,价格依然非常低;但长流程执行、稳定性以及模型之外的Agent系统,还需要继续打磨。