DeepSeek V4 Flash 正式版上线:后训练把 Agent 能力拉满
2026-07-31 DeepSeek-V4-Flash 正式版 API 上线公测:MoE 284B/激活13B、1M 上下文、Agent 基准大幅跃升,价格仅 Claude 约 1/90。一篇完整评测。

DeepSeek V4 Flash 正式版上线:后训练把 Agent 能力拉满
2026 年 7 月 31 日,DeepSeek-V4-Flash 正式版 API 悄然上线公测。它和三个月前的预览版“长得很像”,却把 Agent 能力一口气拉到了逼近旗舰的水平——而且价格依然是那个价格。
今天下午,多家媒体注意到 DeepSeek 官网的更新日志:DeepSeek-V4-Flash 正式版 API 已经开放公测。这距离 4 月 V4 系列预览版发布,正好过去三个月。
有意思的是,DeepSeek 在日志里特别说明:V4-Flash-0731 的模型结构、尺寸和预览版完全一致,仅重新进行了后训练(post-training)。换句话说,这次没有堆参数、没有换架构,纯粹靠“练法”把能力顶了上去。
一、它到底是什么
| 项目 | DeepSeek-V4-Flash 正式版 |
|---|---|
| 架构 | MoE,总参数 284B(2840 亿),激活 13B(130 亿) |
| 上下文 | 最长 100 万 token(1M) |
| 最大输出 | 384K token |
| 思考模式 | 支持非思考 / 思考(默认开启,强度 high/max) |
| 工具与格式 | Tool Calls、JSON Output、原生 Responses API |
| 开源权重 | 是(MIT 代码许可,权重可商用) |
| 可用范围 | 仅 API;App / 网页端暂未更新 |
一句话总结:它是 V4 家族里“快且便宜”的那一档,但这次的正式版把 Agent 和代码工程能力大幅补齐了。
二、这次升级到底改了什么
核心只有一句话:架构不变,重做后训练。
官方明确表示,本次升级仅适用于 DeepSeek-V4-Flash API,V4-Pro API 以及 App、Web 端模型均保持不变。V4-Pro 正式版预计 8 月初发布。
这意味着,DeepSeek 想传递的信号很清晰——在基础模型逐渐成熟的当下,后训练的优化空间,可能比单纯堆参数更有杠杆。一个激活参数只有 130 亿的轻量模型,在 Agent 基准上跑出了逼近旗舰的分数,本身就说明问题。
三、基准测试:Agent 能力全面跃升
以下是官方公布的正式版成绩,以及与预览版的对比(部分对比数据来自媒体整理):
| 基准测试 | V4-Flash 正式版 | V4-Flash 预览版 | 说明 |
|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 终端/命令行端到端任务 |
| Cybergym | 76.7 | 38.7 | 网络安全攻防模拟 |
| DeepSWE | 54.4 | 7.3 | SWE 代码修复 |
| NL2Repo | 54.2 | — | 代码仓库理解修改 |
| Toolathlon verified | 70.3 | — | 工具调用综合 |
| Agent Last Exam | 25.2 | — | 综合智能体 |
| Automation Bench (Public) | 25.1 | 10.8 | 自动化基准 |
| DSBench-FullStack | 68.7 | 37.0 | 全栈开发 |
| DSBench-Hard | 59.6 | — | 高难度编码 |
几个数字尤其值得注意:DeepSWE 从 7.3 跳到 54.4,Cybergym 从 38.7 跳到 76.7,DSBench-FullStack 从 37.0 跳到 68.7。这种量级的提升,很难靠“知识或聊天能力”优化解释得通,更像是把大量工作放在了 Agent 的规划、工具调用与执行策略上。
需要理性看待的是:这些分数来自 DeepSeek 在指定 Harness(DeepSeek Harness,max 档位)下的官方测试,不同测试集考察的能力不同,不宜简单排座次。实际表现仍需第三方评测和生产任务验证。
四、价格:还是那个“价格屠夫”
DeepSeek 官方定价(以百万 token 计):
| 项目 | V4-Flash | V4-Pro |
|---|---|---|
| 输入(缓存命中) | ¥0.02 | ¥0.025 |
| 输入(缓存未命中) | ¥1 | ¥3 |
| 输出 | ¥2 | ¥6 |
| 并发限制 | 2500 | 500 |
另有峰谷定价:高峰时段价格翻倍(输出高峰约 ¥4/百万 token),非高峰更低。有分析指出,V4-Flash 的价格约为 Claude Opus 4.8 的 1/90,是小型模型中成本最低的选项之一,甚至低于部分海外 Nano 级模型。
五、为什么值得普通开发者关注
如果你是每天在用 Cursor、Claude Code、Codex、OpenHands 或各种 MCP 工作流的开发者,这次更新的感知会比“普通聊天用户”强烈得多。因为对 Agent 来说,执行能力往往比单次回答质量更重要。
具体利好有三点:
- 原生支持 Responses API,并针对 Codex 做了适配——开发者无需修改 Base URL 即可把 V4-Flash 接进 Codex CLI、ChatGPT 桌面端和 VS Code 的 Codex 插件。
- 1M 上下文 + 384K 输出,足够把需求文档、项目文件、运行日志、工具返回和历史操作记录塞进同一次任务,适合仓库级开发和企业知识库 Agent。
- 便宜到可以“跑量”,批量任务、自动修复、终端代理的成本被压到极低。
六、它适合你吗
- 适合:日常编码辅助、批量自动化、终端代理、长文档 RAG、成本敏感的高频工作流。
- 暂不适合:需要顶级综合推理/审美的复杂创作(Pro 或闭源旗舰更稳)、多模态输入(V4-Flash 为纯文本模型)。
DeepSeek V4 Flash 使用链接
👉 https://apipro.maynor1024.live/
(该链接为 DeepSeek V4 Flash 的使用入口,按页面说明自行判断和使用。)


