MaynorAI
返回博客

DeepSeek V4 Flash 正式版上线:后训练把 Agent 能力拉满

2026-07-31 DeepSeek-V4-Flash 正式版 API 上线公测:MoE 284B/激活13B、1M 上下文、Agent 基准大幅跃升,价格仅 Claude 约 1/90。一篇完整评测。

2026年7月31日Maynor
DeepSeek V4 Flash 正式版上线:后训练把 Agent 能力拉满

DeepSeek V4 Flash 正式版上线:后训练把 Agent 能力拉满

2026 年 7 月 31 日,DeepSeek-V4-Flash 正式版 API 悄然上线公测。它和三个月前的预览版“长得很像”,却把 Agent 能力一口气拉到了逼近旗舰的水平——而且价格依然是那个价格。

今天下午,多家媒体注意到 DeepSeek 官网的更新日志:DeepSeek-V4-Flash 正式版 API 已经开放公测。这距离 4 月 V4 系列预览版发布,正好过去三个月。

有意思的是,DeepSeek 在日志里特别说明:V4-Flash-0731 的模型结构、尺寸和预览版完全一致,仅重新进行了后训练(post-training)。换句话说,这次没有堆参数、没有换架构,纯粹靠“练法”把能力顶了上去。

一、它到底是什么

项目 DeepSeek-V4-Flash 正式版
架构 MoE,总参数 284B(2840 亿),激活 13B(130 亿)
上下文 最长 100 万 token(1M)
最大输出 384K token
思考模式 支持非思考 / 思考(默认开启,强度 high/max)
工具与格式 Tool Calls、JSON Output、原生 Responses API
开源权重 是(MIT 代码许可,权重可商用)
可用范围 仅 API;App / 网页端暂未更新

一句话总结:它是 V4 家族里“快且便宜”的那一档,但这次的正式版把 Agent 和代码工程能力大幅补齐了。

二、这次升级到底改了什么

核心只有一句话:架构不变,重做后训练

官方明确表示,本次升级仅适用于 DeepSeek-V4-Flash API,V4-Pro API 以及 App、Web 端模型均保持不变。V4-Pro 正式版预计 8 月初发布。

这意味着,DeepSeek 想传递的信号很清晰——在基础模型逐渐成熟的当下,后训练的优化空间,可能比单纯堆参数更有杠杆。一个激活参数只有 130 亿的轻量模型,在 Agent 基准上跑出了逼近旗舰的分数,本身就说明问题。

三、基准测试:Agent 能力全面跃升

以下是官方公布的正式版成绩,以及与预览版的对比(部分对比数据来自媒体整理):

基准测试 V4-Flash 正式版 V4-Flash 预览版 说明
Terminal Bench 2.1 82.7 61.8 终端/命令行端到端任务
Cybergym 76.7 38.7 网络安全攻防模拟
DeepSWE 54.4 7.3 SWE 代码修复
NL2Repo 54.2 代码仓库理解修改
Toolathlon verified 70.3 工具调用综合
Agent Last Exam 25.2 综合智能体
Automation Bench (Public) 25.1 10.8 自动化基准
DSBench-FullStack 68.7 37.0 全栈开发
DSBench-Hard 59.6 高难度编码

几个数字尤其值得注意:DeepSWE 从 7.3 跳到 54.4,Cybergym 从 38.7 跳到 76.7,DSBench-FullStack 从 37.0 跳到 68.7。这种量级的提升,很难靠“知识或聊天能力”优化解释得通,更像是把大量工作放在了 Agent 的规划、工具调用与执行策略上。

需要理性看待的是:这些分数来自 DeepSeek 在指定 Harness(DeepSeek Harness,max 档位)下的官方测试,不同测试集考察的能力不同,不宜简单排座次。实际表现仍需第三方评测和生产任务验证。

四、价格:还是那个“价格屠夫”

DeepSeek 官方定价(以百万 token 计):

项目 V4-Flash V4-Pro
输入(缓存命中) ¥0.02 ¥0.025
输入(缓存未命中) ¥1 ¥3
输出 ¥2 ¥6
并发限制 2500 500

另有峰谷定价:高峰时段价格翻倍(输出高峰约 ¥4/百万 token),非高峰更低。有分析指出,V4-Flash 的价格约为 Claude Opus 4.8 的 1/90,是小型模型中成本最低的选项之一,甚至低于部分海外 Nano 级模型。

五、为什么值得普通开发者关注

如果你是每天在用 Cursor、Claude Code、Codex、OpenHands 或各种 MCP 工作流的开发者,这次更新的感知会比“普通聊天用户”强烈得多。因为对 Agent 来说,执行能力往往比单次回答质量更重要

具体利好有三点:

  1. 原生支持 Responses API,并针对 Codex 做了适配——开发者无需修改 Base URL 即可把 V4-Flash 接进 Codex CLI、ChatGPT 桌面端和 VS Code 的 Codex 插件。
  2. 1M 上下文 + 384K 输出,足够把需求文档、项目文件、运行日志、工具返回和历史操作记录塞进同一次任务,适合仓库级开发和企业知识库 Agent。
  3. 便宜到可以“跑量”,批量任务、自动修复、终端代理的成本被压到极低。

六、它适合你吗

  • 适合:日常编码辅助、批量自动化、终端代理、长文档 RAG、成本敏感的高频工作流。
  • 暂不适合:需要顶级综合推理/审美的复杂创作(Pro 或闭源旗舰更稳)、多模态输入(V4-Flash 为纯文本模型)。

DeepSeek V4 Flash 使用链接

👉 https://apipro.maynor1024.live/

(该链接为 DeepSeek V4 Flash 的使用入口,按页面说明自行判断和使用。)

继续阅读

相关推荐