
7 月 31 日午后凤凰网科技查询 DeepSeek 官网发现DeepSeek-V4-Flash 正式版 API 上线公测。与以往 “Pro 强、Flash 弱”的分层逻辑不同这次更新释放了一个值得关注的信号 ——Flash 正式版在多项 Agent 基准测试中的表现已经逼近甚至超越了三个月前 V4-Pro 预览版的水平。官方更新日志显示V4-Flash 正式版在 Terminal Bench 2.1 上拿到 82.7 分NL2Repo 54.2 分Cybergym 76.7 分Toolathlon verified 70.3 分。而 V4-Pro 预览版在 Terminal Bench 2.0 上的得分为 67.9 分。需要说明的是Terminal Bench 2.0 与 2.1 并非同一版本的测试集直接对比并不完全公平。但一个激活参数仅 130 亿的轻量版在 Agent 能力上跑出这样的分数已经在说明后训练阶段的优化空间可能比单纯堆参数更具杠杆效应。此外DeepSeek也特别说明目前公测仅限APIApp和网页端暂无法体验最新能力。DeepSeek-V4-Pro正式版将尽快发布。“仅重新进行了后训练”DeepSeek 官方在更新日志中表示“DeepSeek-V4-Flash-0731 的模型结构、尺寸和 DeepSeek-V4-Flash-preview 保持一致仅重新进行了后训练。”根据 DeepSeek 官方技术报告V4-Flash 总参数 2840 亿激活参数 130 亿V4-Pro 总参数 1.6 万亿激活参数 490 亿。两者在模型规模上相差一个数量级。如果 Flash 能通过后训练把 Agent 能力拉到接近 Pro 的水平那意味着对于特定任务而言模型规模并非决定性因素 —— 训练方法和数据质量的权重正在上升。官方还特别注明本次公开基准测试中的 Code Agent 任务使用了 DeepSeek Harness 极简模式作为框架进行测试max 档位topp0.95temperature1.0。这个细节暗示DeepSeek 可能在 Agent 框架层面也做了针对性优化而非仅仅是模型本身的提升。这也是DeepSeek官方自研Harness首次以正式命名出现此前梁文锋曾把AGI的实现路径比作爬楼梯语言模型是第一级去年解决的是CoT思维链今年的台阶是Agent而Agent之后必须解决的问题是持续学习——让模型像人一样长期积累经验而不是每次都被喂入完整的上下文才能工作。再往后才是自我迭代的“奇点”与具身智能 。“AI现在不缺品位和直觉它缺的是持续学习的能力”他说“投资人看Agent我们看怎么解决学习。”持续学习听起来是模型层面的命题但它的工程落点恰恰在Harness上。DeepSeek的Agent Harness团队组建于今年3月挂帅者崔添翼是90后浙大计算机出身手握6枚ACM亚洲区域赛金牌曾在顶级量化机构Jane Street任职九年今年3月加入DeepSeek此后其在5月大力招兵买马。据透露DeepSeek的Harness规划在V4正式版上线之际同步推出。另据DeepSeek在日志末尾表示“DeepSeek-V4-Pro 正式版将会尽快发布。”生态层面的一次正面交锋如果说 2023 年的大模型竞争是 “拼通用能力”2024 年是 “拼长上下文”那么 2026 年的关键词毫无疑问是 Agent。Agent 能力 —— 即模型自主规划、调用工具、执行复杂任务的能力 —— 正在成为衡量大模型实力的新标尺。从 Terminal Bench终端操作、NL2Repo代码仓库生成到 Cybergym网络安全任务、SWE-bench软件工程一系列 Agent 基准测试正在重新定义什么是好模型。从全球范围看Agent 能力的第一梯队目前仍由闭源巨头把持。据 benchlm.ai 等第三方评测平台数据GPT-5.6 Sol、Claude Opus 系列在多数 Agent 基准测试中位居前列。国产阵营中GLM、Qwen 等也在快速追赶。DeepSeek 此次将 Flash 的 Agent 能力大幅拉升战略意图很清晰用高性价比的轻量模型切入 Agent 应用的庞大市场。毕竟Agent 场景对推理速度和成本的敏感度远高于纯对话场景。一个需要反复调用工具、多轮推理的 Agent 任务如果用旗舰模型跑成本可能是 Flash 的数倍甚至数十倍。如果 Flash 能在 Agent 能力上达到 “够用甚至好用”的水平其性价比优势将极具杀伤力。官方公布的两个内部测试集也目标明确。DSBench-FullStack内部全栈开发测试集得分 68.7DSBench-Hard内部 Coding Agent 难题测试集得分 59.6。这从侧面印证了 DeepSeek 的定位 —— 把 Flash 打造成开发者和 Agent 应用的首选底座。一场生态暗战也在悄然打响正式版 V4-Flash 原生支持 Responses API 格式并针对性适配了 Codex。Responses API 是 OpenAI 力推的新一代 API 格式相比传统的 Chat Completions它更适合 Agent 场景 —— 支持更灵活的工具调用、更复杂的多轮交互、以及更精细的输出控制。DeepSeek 原生支持这一格式意味着开发者可以更低成本地将基于 OpenAI 生态开发的 Agent 应用迁移到 DeepSeek 上。这将是二者在生态层面的一次正面交锋。对 Codex 的适配则瞄准了代码生成与软件开发这一垂直场景。Codex 是 OpenAI 面向代码领域的模型DeepSeek 针对性适配等于直接在 OpenAI 的传统优势领域发起挑战。这些动作放在一起看DeepSeek 的野心不止于做一个“便宜的替代品”而是要在 Agent 时代建立自己的生态位。500 亿融资之后高估值下的时间窗口此次更新距离 DeepSeek 完成首轮外部融资不到两个月。约一个多月前DeepSeek完成成立近三年来的首轮外部融资总额超 500 亿元人民币创下中国 AI 行业单轮融资纪录投后估值约 520 亿美元约合人民币 3500 亿元。投资方阵容包括腾讯、宁德时代、京东等产业巨头以及多家国资产业基金。7 月中旬DeepSeek 有意推进新一轮私募融资投前估值约 710 亿美元折合人民币约 4800 亿元较首轮融资后的 520 亿美元估值上涨约 37%。从 520 亿到 710 亿间隔不足六周。高估值背后是市场对 DeepSeek 技术实力的认可也是对其商业化前景的押注。但高估值同样意味着高预期、高压力。据多家媒体报道DeepSeek 创始人梁文锋本人在首轮融资中出资约 200 亿元人民币通过特殊架构牢牢掌控公司控制权。这位脱胎于幻方量化的创始人此前近三年一直坚持自有资金投入如今从 “不融资不上市” 转向积极拥抱资本本身就是一个强烈的信号 ——DeepSeek 正在加速冲向商业化和 IPO。千问-阿里AI助手何不现在就问千问让每个好奇都有回响。立即体验Flash 正式版的上线或许可以看作 DeepSeek 在资本加持下的一次 技术兑现。但真正的考验还在后面Pro 正式版能否如期而至Agent 能力的提升能否转化为实打实的收入在 OpenAI、Anthropic 等巨头的夹击下DeepSeek 的高性价比路线将如何发挥优势。Agent 战争的大幕才刚刚拉开。DeepSeek 用一个轻量模型的大幅进化给行业出了一道新题 —— 当后训练的红利被充分挖掘当效率的提升开始抵消参数的差距大模型的竞争逻辑可能要被重新书写了。