经济观察报 记者 陈月芹
DeepSeek新模型上线不需要一则正式公告,用户们会自己发现蛛丝马迹并广而告之。2026年8月13日凌晨,其官网API定价页面上,新模型“deepseek-v4-pro”后的版本号从预览版变成DeepSeek-V4-Pro-0813。
两天时间里,头部大模型产品你追我赶,Grok 4.6和总参数达到2.4T并开放权重的Qwen3.8 Max密集发布。
在评估大模型替代能力时,最核心的指标在于其能否胜任复杂、长周期的Agent(智能体)任务。而DeepSeek V4 Pro的Agent能力已经全面逼近Anthropic旗下Claude Fable 5,并在成本端降维打击。Claude Fable 5是目前全球公认最顶级的闭源旗舰模型。
例如,在衡量终端环境中执行自主操作与问题排查能力的Terminal Bench 2.1基准测试中,DeepSeek V4 Pro正式版87.9分,与Claude Fable 5的88分仅有极微弱的差距;在安全性和高度复杂多步骤环境交互上,DeepSeek V4 Pro 83.3分,反超了Claude Fable 5的83.1分。
在官方API定价上,DeepSeek V4 Pro(现行基准)缓存未命中的输入价格为每百万Token 3元,输出价格为6元,仅为Claude Fable 5(约360元)的1/60,只有国内竞品Kimi K3(100元)的零头。
V4 Pro缓存命中的输入价格则低至每百万Token 0.025元,在多轮对话以及写长文、写代码、生成报告等生成型任务场景,近乎“白菜价”。
ChatGPT和Claude等绝大多数模型的输出成本通常是输入成本的4倍—5倍,而DeepSeek V4 Pro的输出成本仅为输入的2倍。
从工作原理上看,大模型在阅读资料(输入)时能一目十行,而输出需要逐字(Token)生成,且生成下一个词时,必须重新读取前面所有词的KV Cache(键值缓存),算力大量闲置在等待数据传输上,因此输出的成本远高于输入。
目前,大模型领域最活跃的应用场景,主要是编程开发、办公、多步骤Agent、合成数据生成(用AI生成数据来训练其他AI),而这些场景几乎都是输出消耗大户。
缩小这一价差,对开发者的利好更明显。如果输出成本是输入的5倍,用户开启深度思考模式明显更“烧钱”,但DeepSeek将输出成本倍数压至2倍,用户用其生成复杂代码、数十页长篇报告,或让智能体在后台持续运作时,花费将大幅降低。
DeepSeek的更新频率也在明显加速。2023年至2024年,其主力模型从Coder到V2、V3,迭代间隔约5—7 个月;2025年全年发布7个版本,主力版本迭代压缩至约3—4个月,从R1更新到V3.1、V3.2,进入高频迭代期;到了2026 年,DeepSeek不再单次上新完整版本,先发布V4预览版再到Flash转正,间隔98天,随后Pro正式版跟进,间隔缩短至13天。
随着模型推理能力接近天花板,决定智能体表现的将是外部的运行框架Harness。Harness框架负责为模型分配权限、调取工具、管理上下文以及审批流程,是决定智能体如何读文件、失败重试和持续执行的关键。此前,在V4 Flash正式版的更新测试中,官方已经透露使用了即将发布的DeepSeek Harness框架。




