7月31日,DeepSeek正式向公众开放V4-Flash正式版API公测,其最亮眼之处是Agent能力大幅跃升。9项基准测试成绩全面披露,多项指标远超此前的V4-Pro-Preview预览版,展现出令人瞩目的“全能Agent”潜质。
从Terminal Bench到DSBench-Hard,从网络安全对抗到全栈开发,DeepSeek -V4-Flash正式版让AI不再只是“能写代码”,而是开始真正像工程师一样工作,能打开终端、分析仓库、调用工具、完成端到端任务。
此次DeepSeek直接亮出9项基准测试的完整成绩,覆盖面广泛。其中,Terminal Bench 2.1以82.7的高分领跑,表明模型在终端环境下的任务执行能力相当成熟,近乎“AI运维工程师”级别。Cybergym拿下76.7分,展示出色网络安全对抗能力。DSBench-FullStack和DSBench-Hard分别取得68.7和59.6分,说明模型能胜任完整开发链路。
同时,DeepSeek披露了详细测试条件,其即将独立发布的DeepSeek Harness极简模式随成绩一同亮相,暗示了在构建标准化Agent评测生态方面的布局。
正式版V4-Flash在工程适配上有重要更新,原生支持Responses API格式,并针对性适配了Codex。这使得开发者能更自然地将V4-Flash接入现有的Codex工作流,降低迁移成本,具体配置方法可参考官方文档。
值得注意的是,DeepSeek -V4-Flash-0731的模型结构和尺寸与Preview版一致,仅重新进行了后训练。这表明在Agent能力赛道上,后训练策略的优化空间依然巨大,同样的模型架构经精细后训练调优,能在基准测试中产生质的飞跃,对整个行业启示深远。
本次升级仅涉及DeepSeek -V4-Flash的API接口,V4-Pro API及APP端 / WEB端模型未升级,V4-Pro正式版将尽快发布。
从9项基准测试名字可看出,AI能力评测正从“写一段代码”进化到“完成一个工程任务”。DeepSeek -V4-Flash正式版在多项Agent基准上远超V4-Pro-Preview,释放出后训练时代竞争焦点转向Agent能力深度优化的信号,或许意味着AI工程师新时代的开启,而DeepSeek正跑在前面。
编辑观点:DeepSeek V4-Flash正式版API公测亮点颇多,其Agent能力提升和工程适配更新极具竞争力。后训练策略优化的成效也给行业带来启示。随着AI能力评测标准转变,DeepSeek有望在Agent时代持续领跑。