DeepSeek-V4正式版终于上线,但它真正想说的不是“我更强了“
7 月 31 日DeepSeek-V4-Flash 正式版 API 上线进入公测。如果你只看标题可能觉得哦又一个版本更新。但这次更新里有一句话比分数重要得多。DeepSeek 自己写的是正在将竞争重点从传统对话和代码补全进一步转向 Coding Agent、工具调用和自动化执行。这句话翻译过来就是模型不再满足于陪你聊天、帮你补全代码了。它想自己上手干活。还记得半年前那款爆款游戏吗我们之前拆解过一款叫 AgenTank 的 AI 游戏。它的玩法很反直觉你不是操作坦克你是训练一个 AI 坦克去打排位。你写提示词、看回放、改策略让 AI 越来越强。当时我们提炼过一个公式AI 爆款 经典玩法 × AI Agent 化 × 极低成本 × 竞技社交 × 玩家自带算力那篇文章里最重要的一句话是不要做 AI 陪玩做 AI 被玩——核心玩法是玩家训练 AI不是 AI 陪玩家。当时那只是对一个游戏的观察。现在回过头看整个大模型行业正在走同一条路从AI 陪你走向AI 替你干。DeepSeek-V4-Flash 正式版就是这句判断的最新证据。这次更新到底变了什么直接看官方数据。下面这张表来自 DeepSeek 官方 API 更新日志的完整对比同时加入了 GLM-5.2 和 Claude Opus-4.8 作参照基准测试Flash 0731 正式版Flash PreviewPro PreviewGLM-5.2Opus-4.8测的是什么Terminal Bench 2.182.761.872.181.085.0终端环境实际操作NL2Repo54.239.438.548.969.7代码仓库理解Cybergym76.738.752.7-83.1网络安全 Agent 任务DeepSWE54.47.312.846.258.0软件工程修复Toolathlon Verified70.349.755.959.976.2多工具协同调用Agents Last Exam25.215.816.523.825.7长程 Agent 推理AutomationBench (Public)25.110.812.812.927.2自动化执行DSBench-FullStack68.737.041.861.871.6全栈数据科学任务DSBench-Hard59.625.831.154.571.7高难度数据科学任务数据来源DeepSeek 官方 API 更新日志GLM-5.2 部分分数经 Hugging Face 模型卡交叉核对。几个一眼能看出的结论Flash 正式版 9 项全部超过预览版平均涨幅巨大。比如 DeepSWE 从 7.3 涨到 54.4Cybergym 从 38.7 涨到 76.7——这些不是小数点后波动是能力层面的质变。Pro Preview preview 也被正式版 Flash 反超。除了 NL2Repo 基本持平其余 8 项里 Flash 正式版都超过了 Pro 预览版。这说明后训练带来的 Agent 能力提升甚至能让轻量版反超自家旗舰预览版。和 GLM-5.2、Opus-4.8 比Flash 正式版不是每项都第一但差距已经很小。Terminal Bench 2.1 上Flash 82.7 对 GLM-5.2 的 81.0、Opus-4.8 的 85.0基本在同一梯队。DeepSWE、Toolathlon 上 Opus-4.8 仍领先但 Flash 的价格可能只有它的几分之一。Kimi K3 没在这张表里但顺手比一下Kimi K3 在 Terminal Bench 2.1 上拿了88.3DeepSWE 上拿了67.5两项都高于 Flash 正式版。K3 是 2.8 万亿参数的旗舰Flash 是 2840 亿参数的轻量版本就不是一个定位但国产模型在 Agent 赛道上确实都在往上拱。⚠️一个需要注意的口径问题Opus-4.8 的 Terminal Bench 2.1 分数这张图里是85.0但 llm-stats 等第三方引用的 Anthropic 官方口径是74.6%。两个数字差距不小大概率是评估 harness/设置不同导致的。读 benchmark 时同一个测试名字下可能藏着不同的跑法这是常见坑。模型结构没变参数没变只做了后训练。也就是说DeepSeek 没靠堆参数变强而是靠重新训练把 Agent 能力逼了出来。后训练post-training的红利比很多人以为的更大。几个关键点模型结构没变参数没变只做了后训练。也就是说DeepSeek 没靠堆参数变强而是靠重新训练把 Agent 能力逼了出来。原生支持 Responses API并针对 Codex 做了适配。这意味着它能直接接入智能体的工具调用框架不是一个裸模型。V4-Pro 正式版后续发布APP 和 Web 端模型暂时没动。普通聊天用户暂时无感但开发者的工作流已经可以用了。最值得注意的是官方那句原话——竞争重点的转移。这不是功能更新这是战略转向。会聊天和能干活是两代模型把两种模型放在一起区别一目了然维度会聊天的模型能干活的 Agent 模型核心能力生成文本、补全代码调用工具、执行任务、跑通流程交互方式一问一答多步推理 自主决策衡量标准文采、逻辑、知识量任务完成率、工具调用准确率典型场景写文章、答题、翻译自动化测试、数据清洗、部署上线失败代价答错了重问调错了可能删库所以需要强约束过去的模型你问它怎么写一个排序函数它给你代码。现在的 Agent 模型你告诉它把我这个项目从 PC 端移植到移动端它自己读代码库、改文件、跑测试、修 bug。从教你做到替你做这是本质区别。DeepSeek 这次的分数Terminal Bench 82.7、Toolathlon 70.3测的恰恰是后者——在真实环境里它能不能真的把事办成。这不是 DeepSeek 一家的事千万别以为这只是 DeepSeek 的动作。把视线拉宽一点OpenAIGPT 系列全力推 Operator、Codex让模型直接操作电脑、跑代码AnthropicClaude 的 Computer Use、MCP 协议主打模型接入真实工具链GoogleGemini 深度绑定 Workspace让 Agent 在文档、表格、邮件里干活国内智谱 GLM-5.2 主打工程级 AgentKimi K3 也把软件工程列为核心场景全行业在同一个方向上加速让模型从大脑变成手。DeepSeek 这次的转向只是把这个趋势又往前推了一步。对开发者来说这意味着什么如果你在用 AI 写代码或者正在做 AI 相关的产品这次更新释放的信号很明确写代码的门槛还会继续往下掉定义任务的能力会越来越值钱。以前你的竞争力是我代码写得好。以后你的竞争力变成我能把一个模糊的业务目标拆解成 AI Agent 能稳定执行的任务链。具体到 DeepSeek-V4-Flash 正式版如果你是做自动化测试、DevOps、数据管道的值得真的去测一轮——官方说 Terminal Bench 82.7但文章也提醒了真正需要关注的是它在真实项目中能否稳定完成任务、正确调用工具、减少无效重试。分数只是门票真实项目里的稳定性才是决赛。V4-Pro 正式版还没来如果你对推理深度要求高可以再等等。最后半年前我们写 AgenTank 的时候说AI Agent 化会是一个真实存在的品类。当时那只是对一个游戏的判断。现在 DeepSeek 用一次正式版更新告诉我们模型厂商自己也在把船头调向同一个方向。从会聊天到能干活不是一句口号。Terminal Bench 82.7 是Toolathlon 70.3 是原生支持 Responses API 也是。当模型开始自己读代码、调工具、跑任务——它不再是你的工具它开始变成你的同事。而这一程国产模型和海外巨头站在同一条起跑线上。V4-Pro 正式版还没来。但 Flash 这一步已经把Agent 化三个字从趋势变成了默认。

相关新闻

DeepSeek、豆包、Kimi、千问、文心一言、……到底用哪个?2026年主流AI工具深度横评

DeepSeek、豆包、Kimi、千问、文心一言、……到底用哪个?2026年主流AI工具深度横评

📑 目录 1. 引言:大模型"战国时代",我们该如何选择?2. 使用场景对比:你的需求是哪一种? 2.1 知识问答与信息检索2.2 长文写作与内容创作2.3 编程与开发辅助2.4 办公效率与 PPT / 报告生成2.5 场…

2026/8/1 13:06:36阅读更多 →
XL2417D无线透传模组,让用户快速接入多种物联网与智能控制应用

XL2417D无线透传模组,让用户快速接入多种物联网与智能控制应用

在物联网和智能设备快速发展的今天,2.4GHz无线通信已经成为连接万物的核心技术之一。然而,对于许多产品开发者而言,深入掌握2.4G复杂的射频协议栈、调制解调机制和射频硬件设计,始终是一道不低的技术门槛。XL2417D透传模组&#x…

2026/8/1 13:06:35阅读更多 →
树莓派CM4 PCIe NVMe存储扩展实战:从硬件设计到系统调优

树莓派CM4 PCIe NVMe存储扩展实战:从硬件设计到系统调优

1. 项目概述:为树莓派扩展高速存储的利器最近在折腾一个树莓派上的边缘计算项目,需要处理大量从摄像头采集的原始视频流数据。数据量一大,树莓派板载的MicroSD卡读写速度就成了最大的瓶颈,频繁的I/O等待让整个处理流程卡顿不堪。相…

2026/8/1 13:04:35阅读更多 →
深度解析:League Akari 1.5.0的Electron模块化架构演进与性能优化实践

深度解析:League Akari 1.5.0的Electron模块化架构演进与性能优化实践

深度解析:League Akari 1.5.0的Electron模块化架构演进与性能优化实践 【免费下载链接】League-Toolkit An all-in-one toolkit for LeagueClient. Gathering power 🚀. 项目地址: https://gitcode.com/gh_mirrors/le/League-Toolkit League Akar…

2026/8/1 14:29:17阅读更多 →
gdb断点调试python代码

gdb断点调试python代码

最近在解程序cordump的问题,代码是C/C++与python混合部署的,gdb的bt命令只能看到C/C++的调用栈,看不到python的调用栈。踩了一些坑,这里记录下最终的结果。 下面都是在Python-3.11.12版本上实现的。 python调用栈打印 网上搜到的一些教程,是让下载对应python版本的libp…

2026/8/1 14:29:17阅读更多 →
Unity历史版本下载终极指南:告别官方链接失效烦恼

Unity历史版本下载终极指南:告别官方链接失效烦恼

Unity历史版本下载终极指南:告别官方链接失效烦恼 【免费下载链接】download.unity.com Unity国际版下载,解决国内打不开网站和被重定向的问题 项目地址: https://gitcode.com/gh_mirrors/do/download.unity.com 还在为Unity官方下载链接失效而烦…

2026/8/1 14:29:17阅读更多 →
InfluxDB 1.x 部署指南:兼容性考量与Web界面配置实践

InfluxDB 1.x 部署指南:兼容性考量与Web界面配置实践

1. 项目概述:为什么选择这两个特定版本?最近在整理一个老项目的监控数据迁移,发现历史数据存储用的还是InfluxDB 1.x的版本。为了复现当时的部署环境,我不得不重新搭建一套InfluxDB 1.1.0和1.8.0的测试实例,并且需要开…

2026/8/1 14:29:17阅读更多 →
深入解析HashMap:从哈希函数到红黑树,揭秘Java核心数据结构

深入解析HashMap:从哈希函数到红黑树,揭秘Java核心数据结构

1. 从“键值对”到“数组链表/红黑树”:HashMap的设计哲学 如果你写过Java,或者用过任何现代编程语言,那么HashMap对你来说一定不陌生。它就像一个超级高效的“字典”或“电话本”,给你一个名字(Key)&#…

2026/8/1 14:29:16阅读更多 →
大模型API自动化测试流水线——用TokenStar一个Key做多模型A/B评测

大模型API自动化测试流水线——用TokenStar一个Key做多模型A/B评测

200条业务数据、零人工参与、10分钟跑完全部评测。含完整的评测流水线代码模型评测最烦的是什么——每个月模型一更新就得重新测一遍。200 条测试数据、人工看至少两小时。我们后来搞了一套自动化评测流水线——让 AI 当裁判去评 AI——现在 10 分钟跑完全部。核心思路——用AI…

2026/8/1 14:27:16阅读更多 →
覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

覆盖国产 + 海外 + 开源模型,OpenClaw 2.7.9 Windows/Mac 双端部署详解

🔹 工具基础介绍 OpenClaw 是开源生态中一款实用性较强的本地智能工具,凭借本地离线运行、可视化图形操作和任务自动化三大核心特性,赢得了众多用户的青睐。与普通在线对话AI工具不同,它属于能够直接操控本机软硬件的智能数字员工…

2026/7/31 20:44:05阅读更多 →
伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

伺服阀焊完微漏毁整机?精密激光焊接三关锁住高压

所谓液压伺服阀体的精密激光焊接,是用激光束对阀座壳体(通常为不锈钢或铝合金)进行密封焊接,使阀体在21-35MPa的高压液压油或压缩气体中长期运行而不发生介质泄漏。液压伺服阀是高端液压系统的"大脑"。从航空航天飞行控…

2026/7/31 17:41:43阅读更多 →
D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南

D2DX:三步实现《暗黑破坏神2》高清宽屏体验的终极指南 【免费下载链接】d2dx D2DX is a complete solution to make Diablo II run well on modern PCs, with high fps and better resolutions. 项目地址: https://gitcode.com/gh_mirrors/d2/d2dx 你是否还在…

2026/7/31 20:44:05阅读更多 →
无损视频剪辑终极指南:如何实现快速高效的多媒体处理

无损视频剪辑终极指南:如何实现快速高效的多媒体处理

无损视频剪辑终极指南:如何实现快速高效的多媒体处理 【免费下载链接】lossless-cut The swiss army knife of lossless video/audio editing 项目地址: https://gitcode.com/gh_mirrors/lo/lossless-cut 在数字媒体创作领域,视频编辑处理的质量损…

2026/8/1 0:00:10阅读更多 →
AI辅助本科论文写作:8大工具评测与高效使用指南

AI辅助本科论文写作:8大工具评测与高效使用指南

1. 本科生论文写作的AI辅助现状本科毕业论文是每个大学生必须跨越的一道坎。记得我当年写论文时,光是文献检索就花了整整两周时间,打印的参考文献堆满了半个书桌。如今AI技术的发展为学术写作带来了革命性变化,合理使用这些工具可以节省80%以…

2026/8/1 0:00:10阅读更多 →
如何快速配置大麦自动抢票系统:从零开始搭建Python抢票助手

如何快速配置大麦自动抢票系统:从零开始搭建Python抢票助手

如何快速配置大麦自动抢票系统:从零开始搭建Python抢票助手 【免费下载链接】ticket-purchase 大麦自动抢票,支持人员、城市、日期场次、价格选择 项目地址: https://gitcode.com/GitHub_Trending/ti/ticket-purchase 还在为抢不到热门演唱会门票…

2026/8/1 0:00:10阅读更多 →
无损视频剪辑终极指南:如何实现快速高效的多媒体处理

无损视频剪辑终极指南:如何实现快速高效的多媒体处理

无损视频剪辑终极指南:如何实现快速高效的多媒体处理 【免费下载链接】lossless-cut The swiss army knife of lossless video/audio editing 项目地址: https://gitcode.com/gh_mirrors/lo/lossless-cut 在数字媒体创作领域,视频编辑处理的质量损…

2026/8/1 0:00:10阅读更多 →
AI辅助本科论文写作:8大工具评测与高效使用指南

AI辅助本科论文写作:8大工具评测与高效使用指南

1. 本科生论文写作的AI辅助现状本科毕业论文是每个大学生必须跨越的一道坎。记得我当年写论文时,光是文献检索就花了整整两周时间,打印的参考文献堆满了半个书桌。如今AI技术的发展为学术写作带来了革命性变化,合理使用这些工具可以节省80%以…

2026/8/1 0:00:10阅读更多 →
如何快速配置大麦自动抢票系统:从零开始搭建Python抢票助手

如何快速配置大麦自动抢票系统:从零开始搭建Python抢票助手

如何快速配置大麦自动抢票系统:从零开始搭建Python抢票助手 【免费下载链接】ticket-purchase 大麦自动抢票,支持人员、城市、日期场次、价格选择 项目地址: https://gitcode.com/GitHub_Trending/ti/ticket-purchase 还在为抢不到热门演唱会门票…

2026/8/1 0:00:10阅读更多 →