DeepSeek的这次小更新,原来藏着两个大招。。。|预训练|flash|agent|deepseek_网易订阅
时间:2026-08-10 04:23:03 来源:换骨脱胎网

今天有个 AI 探究员发材料给我说,次大招这是小更新原她入行以来最好的夏天。DeepSeek-V4-Flash 正式版发布了,两个练性能超过之前的预训易订阅 V4-Pro-Preview。基准测试成绩甚至能和 Claude Fable 5 放在同一张表里比较。次大招一个总参数 284B、小更新原激活参数仅 13B 的两个练 “ 轻量版 ” 模型在多项任务上追平了那个曾经遥不可及的 Opus 4.8。更离条件的预训易订阅是价格,Flash 版便宜到令人发指,次大招两块就能让它输出 100 万 tokens 她把手头所有的小更新原项目都改进了一遍,结荚还没花掉一杯奶茶钱。两个练昨天在开发者群里。预训易订阅 突然所有人停下手里的次大招事,最初转发评测截图。小更新原 她说自己尤其开心,两个练有种人类黄金时代的错觉。谁也没想到,DeepSeek 这次又给大家憋了个大的,卡着 7 月的尾巴,发布了 DeepSeek V4 Flash 的正式版。说实话,一最初,世超对这次更新其实是没有太在意的。。。毕竟只是一个不过着 Flash 名头的模型更新,主力军 Pro 系列更是动都没动。上一次只更新 Flash ,不更新 Pro 模型的大模型厂商还是谷歌,目前已经成了大家的玩梗对象。这你一个 Flash 模型再更新,能力总不能超过 Pro 吧。。。不是哥们,你这 Flash 模型怎么比 Pro 模型的跑分都强了???这还是 Flash 吗?不对 DeepSeek,大模型不是这样玩的,你应该先发一个 Flash 模型,然后说自己只是高效度快一些罢了,你怎么直接让 Flash 模型追上了自家的 Pro 模型,然后价格还只卖 2 块钱 / 百万 token,同时时不时还能有个打一折的缓存命中优惠,我周末用了 1 个亿 token 才花掉了 5 块钱。世超根据这次 V4 Flash 亮出来的跑分整理了一下,可以发现这次 Flash 模型的能力极其夸张。超过了自己的大哥 Pro 不说,虽然比不上 Claude Opus5、GPT-5.6 Sol、还有 Kimi K3、这些不过级模型。然而,正式版的 V4 Flash,基础上也就不如这几家了。有网友把各家大模型的能力和价格,收集到一起做了个表整理了出来:每个大模型在表上都是一个点,点的位置越靠左边,验明正身模型越便宜,点的位置越靠上面,验明正身模型的性能越好。这样一看就会很直观的发现,市面上不过大多数模型 ,都处在一个很尴尬的位置。性能没 DeepSeek 好就算了,价格还比 DeepSeek 关键贵。而那些性能比 DeepSeek 关键强的模型,处境其实也没好到哪去。因为它们的价格实在是太贵了。差友们可能没注意到,上面这张图的横轴,它不是一个线性坐标轴,而是个对数轴。但咱给模型花钱的时候可不是这么算的。于是世超稍微动用了一下很久没实用过的 PS 手段,把这张图给拉成了线性坐标轴来看看,发现它的真实比例,其实是这样的。。。也就是说,比如性能的话,Claude Fable 5,GPT-5.6 Sol 这些模型比起 V4 Flash 来说,可能有个这么两成的提高。然而这些模型的价格,可能也关键比 V4 Flash 多了两 0。夸张一些的话,可以说 DeepSeek 又一次重新定义了模型的斩杀线。因此,这次 DeepSeek 是怎么做到的?明明模型的架构,参数都没啥变化,为什么一个模型的能力会突然有如此巨大的变化?世超也是往回翻了翻 DeepSeek 的比如文和公开材料,找到了两个概率最大的方向。先最题的一个点就是后训练。这也是官方承认的,预览版和正式版差距最大的地方了。这里给对大模型不太认识的差友科普一下,常见来说,我们会把大模型的训练给分成两个时期。首先个时期叫预训练。在这块,我们需给模型塞进去海量文本、代码和其他数据,以此来让它学会回答状况的基础能力。整个流程有点像在培养一个高中生,不管是语数外,还是物化生,政史地,还是文章乐美术体育方式算机,各种领域的知识都关键拿点过来给他,通过这种方式来提高模型的基础能力。而第二个时期后训练,则是锻炼的真正干活解题的能力。这块做的活题是刷题,让模型通过反反复复地刷题,来提高模型的应试教育能力,让它来学会怎么处理状况。探究人员会通过监督微调、强化学习和大量任务数据,让模型学会理解指令、拆解状况、采取工具,以及按照人类偏好的方式给出答案。同样预训练出来的一个模型,在经过了不一样的后训练刷题练习之后,是很那么点儿刷出完全不一样的谝的。之前 DeepSeek R1 的比如文里就讲过,他们把 V3 拿过来做了 GRPO ( 群组相对对策改进 ) 强化学习之后,模型的数学能力就得到了巨大的提高,在 AIME 2024 测试集上的正确率直接从最初的15.6% 给飙升到了 71%。OpenAI 当年的 InstructGPT 也一样。经过监督微调和 RLHF 之后,一个只有 13 亿参数的模型,在真人盲评里,甚至能打赢参数量大了 100 多倍的 GPT-3。如果说预训练决定了模型的大脑里有没有相关的知识的话,那么后训练就是决定模型有没有掌握把这些知识给拿出来的能力。当然,光靠后训练,或许还不能完全验明正身这次 V4 Flash 的夸张成绩。仔细看 DeepSeek 的发布验明正身,大家还能发现一件事:那就是这次公开的部分跑分,DeepSeek 并不是让模型直接裸跑得出来的。而是用上了一个叫做 DeepSeek Harness 的未发布工具。Harness 这个词大家这半年来应该也听过不少,目前热的方便的 Claude Code,Codex,OpenClaw 其实都可以算是 Harness,或者说是 Agent 工具的一种。就连目前大伙频仍刷到的 Workbuddy,Qoder,Trae 也都能算是。而目前,DeepSeek 关键推出自己的 Agent 工具卷进来了。这件事,可能比单独更新一个模型还关键题得多。因为在目前这个 Agent 时代,一个模型最后能干出什么成绩,已经不只取决于模型本身有多聪明,还取决于外面给它套了一套什么样的工具。一个裸模型就像一个坐在考场里的学生,遇到复杂的状况就只能靠自己的脑子硬算。但 Agent 会给模型安上搜索引擎,能给它配上代码的运行环境,还会帮它管理好项目的上下文,检查项目的运行结荚,甚至跑错了还能直接重来一次。通过这些外置工具给模型上 Buff,AI 实际做事的能力可以得到极大的提高。今年年初的时候,多伦多大学的团队做了一个探究,他们把同一个大模型,放到不一样的 Agent 工具里面来做测试。结荚发现同一个模型,在不一样的工具里谝的完全不一样,实现状况的概率最高能差个好几倍。前不久有人说过,目前 AI 的发展,就像一级一级向上爬的阶梯。去年的阶梯是思维链,通过思维链的方式,我们可以让模型学会自己思考,来让 AI 能做到更多的事情。而今年,AI 发展最题的阶梯就是 Agent。目前,DeepSeek 也交出了自己对 Agent 的答案。通过优质的后训练和 Agent 工具,把原本负责轻量采取的 Flash,给直接拉到了全球旗舰模型的身后。说实话,世超看到这个超级强化后的 Super Pro Max 版本的 Flash 模型,已经最初期待起来了。既然一个用来打下沉市场的小弟,都能靠着出神入化的后训练和DeepSeek Harness工具,跟 GPT-5.6 Sol、Claude Fable 5 这些身娇肉贵的 “ 太上皇 ” 们掰掰手腕……那关键是等 DeepSeek 把这套版本答案,给套在更强的V4 Pro上呢?撰文:早起编辑:江江 & 面线美编:焕妍图片、材料来源:https://api-docs.deepseek.com/zh-cn/quick_start/pricing/https://www.reuters.com/business/retail-consumer/deepseeks-new-ai-model-is-by-far-cheapest-well-known-models-run-research-firm-2026-08-03/https://artificialanalysis.ai/leaderboards/modelshttps://artificialanalysis.ai/modelshttps://artificialanalysis.ai/methodologyhttps://artificialanalysis.ai/methodology/intelligence-benchmarkinghttps://huggingface.co/deepseek-ai/DeepSeek-V4-Flashhttps://arxiv.org/abs/2606.19348https://api-docs.deepseek.com/zh-cn/news/news260424https://www.deepseek.com/transparency/https://arxiv.org/abs/2501.12948https://arxiv.org/abs/2203.02155https://arxiv.org/abs/2602.09540https://swebenchmobile.com/
-
秋招信息战打不动?我们测了千问的新功能,让Agent全程陪跑|招聘|校招|求职|简历|应届生|高校毕业生_网易订阅遭遇强烈反对!国际足联宣布放弃出售世界杯股权提案_蒂诺_前进公司_欧足联67岁杨丽萍谈演出身材控制:我今天只吃了一个鸡蛋_红星_舞剧_专访LV中国申请1481件商标,起底大牌维权产业链:有品牌“碰瓷式”诉讼,律师按赔偿的10%抽成,千元可买律师函_茉莉_侵权_奶白长线制胜的“密钥”_新浪财经_新浪网因凡蒂诺的晋升:竞选方案与普拉蒂尼相似 受欧足联助力后背刺_国际足联_工作_足球【竞界】被当成鱼肉的小球员 被忽视的禁足令_申思_打人_教练中际旭创控股股东减持621万股:或套现超50亿 港股上市破发_Capital_认购_云锋基金[流言板]巴黎助教:曼联是欧洲强队之一,我们踢他们比踢马略卡时好-国际足球-国际足球资讯-虎扑社区丰田家族接班人重回造车一线_Woven_公司_Toyota
相关内容
- ·美到窒息!这位旅美画家笔下的江南,每一笔都蘸满了乡愁,看哭无数游子!|水墨|水乡_网易订阅
- ·安妮·海瑟薇颜值巅峰超靓写真!火辣身材性感撩人_角色_演技_线条
- ·从矿工女儿到超模富婆,离开 C 罗后,她过得更好!_Irina_泳装_时尚
- ·44岁宋慧乔带火了一种“极简风”穿法:白T恤+花苞裙,时髦又减龄_牛仔裤_上身_来自
- ·状态糟糕!中国女篮新晋主力前锋罗欣棫2战10中0外线三分颗粒无收|韩旭|宫鲁鸣|李月汝_网易订阅
- ·曝湖人骑士积极追求库明加 先签后换需要老鹰配合_交易_shams_消息
- ·真人凉了,AI速朽,短剧行业一天一个样?_头部_行程_平台
- ·曝湖人骑士积极追求库明加 先签后换需要老鹰配合_交易_shams_消息
- ·2026年“未录满”本科专业排行榜出炉,英语第3、计算机科学与技术第4,土木工程第9,第1让人意外!|会计学|毕业生|理工科_网易订阅
- ·“寒王”包人均超百万“大红包”,但想拿到不容易_激励_公司_归属
- ·特斯拉剥离中国业务?马斯克在线辟谣“假消息”_全球_上海_Model
- ·库里终老勇士基本成定局 现役一人一城还有几人坚守?_1_CBA_NBA
- ·知名基金经理最新调仓路径曝光 科技赛道和传统板块迎风格平衡_新浪财经_新浪网
- ·如何深入理解黎曼曲率张量?《张朝阳的物理课》探秘矢量微积分表达曲率_分量_变化_空间
- ·谁能接替因凡蒂诺?盘点5位候选人:温格与亚足联主席在列_国际足联_欧足联_费林
- ·因凡蒂诺的贪欲喂不饱 世界杯私人化致票仓出现裂痕_国际足联_支持_计划
最新内容
- ·胡明轩伤病未痊愈;周鹏重回广东队,拿大合同惹争议|cba_网易订阅
- ·本周龙虎榜盘点:近230股周内上榜,哪些席位成为“常客”?_行业板块_科技_次数
- ·库里终老勇士基本成定局 现役一人一城还有几人坚守?_1_CBA_NBA
- ·飞书走出字节核心圈:一场酝酿了十个月的收编_火山_引擎_业务
- ·观点与刘宏才面对面:物业大撤退时代,彩生活为何选择“慢下来”做温度?| 博鳌·浪潮中成长|物业费|物业服务|社区生活|建筑面积_网易订阅
- ·【竞界】被当成鱼肉的小球员 被忽视的禁足令_申思_打人_教练
- ·一把爆赚千亿,阿里投遍AI,能否再造阿里系_投资_模型_公司
- ·【汽车人】中国市场成拖累?大众二季报利润跌33%_车型_新能源_改革方案
- ·2026年长沙城市伴手礼源头厂家推荐指南_产品_公司_老字号
- ·“美腿女神”杨幂展现丝袜代言展示热辣美照,不同角度展示腿部美_流线_风格_贝雷帽
推荐内容
热点内容
- ·9岁男孩温岭被卷走后续:事发后还站外围,知情人曝大人是姑姑|大海|栈道|目击者|温岭市_网易订阅
- ·中网公布首批参赛名单 辛纳、兹维列夫确认出战_网球公开赛_赛事_大满贯
- ·因凡蒂诺的贪欲喂不饱 世界杯私人化致票仓出现裂痕_国际足联_支持_计划
- ·遭遇强烈反对!国际足联宣布放弃出售世界杯股权提案_蒂诺_前进公司_欧足联
- ·爱折腾的中年人基本都完蛋了|疯狂|炒股|必需品_网易订阅
- ·“美腿女神”杨幂展现丝袜代言展示热辣美照,不同角度展示腿部美_流线_风格_贝雷帽
- ·一年2770万美元!勇士官宣与格林完成续约_消息_合同_Shams
- ·父子大练兵!C罗晒与迷你罗PK身材照 配文:还早着呢_照片_罗为_已经接近
- ·大蒜被点名了!发现:糖尿病人吃大蒜,不必等多久,或有5个变化|大蒜素|胆固醇|胰岛素|糖尿病患者_网易订阅
- ·遭遇强烈反对!国际足联宣布放弃出售世界杯股权提案_蒂诺_前进公司_欧足联
