ARTICLE DETAIL

资讯详情

深耕网站SEO优化与搜索引擎排名提升的一线实战洞察。

面试官冷笑:“什么是 Scaling Law?大模型的「涌现能力」是怎么回事?”

面试官冷笑:“什么是 Scaling Law?大模型的「涌现能力」是怎么回事?” 面试官来讲讲什么是 Scaling Law大模型的「涌现能力」是怎么回事♂️我Scaling Law 就是模型越大越好嘛参数越多效果越强。涌现能力就是大模型突然变强了。面试官……「越大越好」是错的。Chinchilla 论文你看过吗为什么 GPT-3 175B 后来被一个 70B 的小模型超过「越大越好」忽略了什么变量♂️我哦哦可能还要看数据量面试官对了一半。那具体的最优配比是什么为什么是这个比例再说「涌现」具体是指什么是不是越涌现越好为什么有人说涌现可能是「测量假象」♂️我呃……测量假象我没听过。面试官2023 年斯坦福一篇论文 Are Emergent Abilities of Large Language Models a Mirage 提出了挑战认为很多涌现现象只是评估指标设置带来的错觉换个连续指标曲线就平滑了。这种学术争议都不知道去面试就是被怼。回去补一下。这几下追问其实在敲两件事Scaling Law 不是一句「越大越好」涌现也不是「玄学闪现」。背后有具体的数学规律Chinchilla 1:20 配比和工程含义什么时候该堆算力、什么时候该补数据得逐条拎清楚。 简要回答我理解 Scaling Law缩放定律讲的是大模型的损失值如何随模型规模、训练数据量、训练算力这三个量变化的可预测关系。OpenAI 在 2020 年提出DeepMind 在 2022 年的 Chinchilla 论文里精修。核心发现是三个。第一损失值随这三个量按幂律下降loss ∝ N^-αN 是规模。意思是规模翻倍损失值按可预测的比例下降没有「饱和点」。第二参数和数据要按一定比例配。Chinchilla 给的最优比例是1:20每个参数配 20 tokens。GPT-3 175B 用 300B tokens 是「严重欠训」比例只有 1:1.7DeepMind 训了一个 70B 模型配 1.4T tokens1:20反而超过了 GPT-3 和自家更大的 280B Gopher。第三Llama 3 这类后续模型用了远高于 1:20 的训练 token效果继续提升。更准确地说Chinchilla 的 1:20 是「固定训练算力下的 compute-optimal 配比」不是「数据再多就一定没用」的上限。后来的小模型大量喂数据很多时候是在用更多训练计算换更低的推理成本。涌现能力Emergent Abilities是 Scaling Law 的一个特殊副产物。当模型规模超过某个临界值典型是 50B-100B 参数某些能力会从「完全不能」突变到「能做」多步推理、上下文学习、跨语言迁移、代码理解等。但要注意 2023 年斯坦福的 Mirage 论文挑战了「涌现」的定义。他们认为很多涌现现象只是「评估指标的不连续性」造成的测量假象换成连续指标后曲线就平滑了。学术争议还在继续但工程层面模型规模带来的能力跃迁是客观存在的。对工程选型的启发是不是越大越好要看「参数 × 数据 × 算力」三者的最优搭配数据规模可能比参数规模更值得加大Llama 3 8B 用 15T tokens 跑赢 GPT-3 175B 就是例证同样算力下按 Chinchilla 比例训出来的小模型可能比胡乱堆参数的大模型还强。 详细解析Scaling Law 是什么为什么它震撼了整个业界要理解 Scaling Law 的重要性得先回到 2018-2020 年那个语境。那时候的深度学习圈子里对「模型加大有没有用」是有分歧的。一派人觉得「模型再大也有上限参数加多了就饱和了」另一派人觉得「先把模型加大试试再说」。但谁都没有量化证据全凭经验和直觉。2020 年 OpenAI 的 Kaplan 等人做了一项震撼业界的研究他们系统训练了一系列从几万参数到几十亿参数的语言模型发现一个惊人的规律。模型的损失值loss随模型参数 N、训练数据量 D、训练算力 C 这三个量按幂律下降。数学上写出来是这样的loss(N) ≈ (N_c / N)^α_N其中 N_c 是某个常数α_N 是幂律指数。直观理解就是模型规模翻倍损失值按一个固定比例下降而且这个比例可以提前算出来。这个发现震撼业界的关键有三点第一它是可预测的。不是「试试看运气」而是「我现在有 X 算力按 Scaling Law 算一下最终能达到什么 loss」。这给了大公司投资大模型的底气因为可以预测投入产出比。第二它没有看到饱和点。论文里把规模一直加大到当时能训的极限loss 还在按幂律下降没有「再加就不动了」的拐点。这给业界传递了一个信号继续加大规模就还能继续提升。第三算力、数据、参数都可以独立做幂律分析。也就是说可以分别问「我加倍参数能下降多少 loss」「我加倍数据能下降多少 loss」「我加倍算力能下降多少 loss」。这为后来的 Chinchilla 把这三个变量联立起来打下了基础。但 OpenAI 这版 Scaling Law 有一个隐含的问题它没回答「参数和数据应该按什么比例配」。当时业界的普遍做法是「能加多少参数加多少数据用差不多就行」。结果训出了一批「严重欠训」的大模型最典型的就是 GPT-3。Chinchilla 2022参数和数据要按 1:20 的比例配2022 年 DeepMind 发了一篇论文 Training Compute-Optimal Large Language Models里面提出了著名的Chinchilla 缩放定律把 OpenAI 的 Scaling Law 精修了一步。DeepMind 做了一个相当壕的实验训了 400 个不同规模的 Transformer 模型参数从 70M 到 16B数据量从 5B tokens 到 500B tokens全部跑完拟合损失曲面。实验结果很清晰给定固定的训练算力 C参数和数据要按接近 1:20 的比例配最终损失更低。换句话说参数 N 每加倍数据 D 也要按比例加倍经验上大约是「每个参数配 20 个 token」。这个 1:20 不是自然常数而是 Chinchilla 实验条件下拟合出来的 compute-optimal 经验点但它把业界从「只堆参数」拉回了「参数和数据要均衡」。为了验证这个发现DeepMind 训了一个对照实验模型参数数据训练算力最终效果GopherDeepMind 自家旧版280B300B tokensX基线GPT-3175B300B tokens0.7X比 Gopher 略弱Chinchilla按 1:20 配比70B1.4T tokensX明显超过 Gopher 和 GPT-3注意Chinchilla 的训练算力和 Gopher 接近FLOPs 总量相同量级但参数砍到 1/4数据加到 4.7 倍。结果是用更小的模型 更多的数据明显超过了 4 倍参数的 Gopher。这个对照让业界恍然大悟当时所有人训的大模型都严重欠训。具体看 GPT-3 的比例GPT-3: 175B 参数 / 300B tokens 1 : 1.7 最优比例: 1 : 20 GPT-3 数据缺口: 12 倍GPT-3 应该配 3.5T tokens 才是 Chinchilla 最优但实际只用了 300B差了一个数量级。如果当时 OpenAI 知道这个结论可能就不会训那么大的 GPT-3而是训一个更小但配足数据的模型。Chinchilla 改变了整个大模型行业。2022 年之后训的所有主流模型配比都比之前激进得多。比如 LLaMA 1 的 7B 模型用了 1T tokens比例 1:140LLaMA 2 的 7B 用了 2T tokens1:285都远超 Chinchilla 推荐的 1:20。越来越多模型主动「过量」喂数据因为 Chinchilla 让大家意识到参数加得没那么疯也行数据要喂够才是关键。但故事到这里还没结束。Chinchilla 这个 1:20 的配比真的是终极答案吗2024 年的 Llama 3 给了一个让所有人都没想到的答案。Llama 3 时代Chinchilla 不是数据上限2024 年 Meta 训 Llama 3 时做了一件激进的事把数据量推到 1:1875 的极端配比。具体数据Llama 3 8B: 8B 参数 / 15T tokens 1 : 1875 Chinchilla 推荐: 1 : 20数据规模是 Chinchilla 推荐的94 倍。按当时的常识应该早就过拟合或者收益递减了。但 Meta 实测发现模型在数据量从 1T 推到 15T 的过程中loss 一直在稳定下降效果一直在提升。最后训出来的 Llama 3 8B 在多项基准测试上超过了 GPT-3 175B。一个 8B 的小模型打赢了 22 倍参数的大模型靠的就是数据规模。这件事重新定义了业界对 Scaling Law 的理解。原来的 Chinchilla 1:20 配比不是「数据上限」而是「给定训练算力时参数和数据怎么分配更划算」的经验答案。如果你愿意投入更多训练计算继续喂更多高质量 tokenloss 仍然可能下降只是边际收益会变小。所以更准确的说法是Chinchilla 告诉我们「别只堆参数数据也要跟上」Llama 3 之后的趋势告诉我们「为了降低推理成本可以训练一个较小参数、更多 token 的模型」。这两句话不矛盾只是在优化不同目标一个偏训练算力最优一个偏部署成本最优。Qwen3-0.6B 把这个趋势推到了更极端用 36T tokens 训一个 0.6B 的小模型比例 1:60000远超 Llama 3 的 1:1875。这说明在追求「推理时性能 / 部署成本」最优的方向上「小参数 海量数据」已经是当前最热门的路径。为什么会出现这个趋势背后有两个很现实的工程原因。第一是推理成本参数越多推理时显存和延迟越高。一个 8B 模型部署一台消费级 GPU 就够175B 模型要好几台 H100成本天差地别。如果 8B 大数据能达到同等效果何乐不为第二是数据相对便宜算力是真金白银的硬件投入一张 H100 三万美元集群上千万数据虽然也要花钱清洗但相比 GPU 集群仍然便宜得多。在算力受限的环境下把算力多花在「跑过更多数据」而不是「跑过更多参数」更划算。涌现能力量变到质变的临界点Scaling Law 还有一个让所有人都没想到的副产物叫涌现能力Emergent Abilities。涌现的精确定义是「某项能力在小模型上完全看不到规模超过某个临界点之后突然出现」。它不是平滑上升而是一条「先趴在地上、到某个点垂直冲天」的折线。学术界总结了几类典型的涌现能力每一类都有具体的数据点支撑1. 多步算术推理Google PaLM 论文里测试 5 步算术应用题。准确率随规模变化8B - ~0% 62B - ~5% 540B - ~60%中间没有任何渐进过程从「完全不会」直接到「会一大半」。这种跳变只能用「涌现」来解释。2. In-Context Learning上下文学习GPT-3 175B 出现之前业界共识是「想让模型学新任务必须微调」。GPT-3 出来之后OpenAI 发现只要在 Prompt 里给几个例子模型就能学会新任务。这个能力在 1.5B 的 GPT-2 上完全看不到在 175B 的 GPT-3 上突然就有了临界点在 100B 左右。3. 跨语言泛化GPT-3 训练数据 92% 是英文但训完之后能直接处理中文、阿拉伯语、甚至冰岛语。模型从来没被显式教过「中文怎么说」它通过大规模混合语料的预训练自己学会了不同语言间的对应关系。这种能力也是规模到了 100B 左右才稳定出现。涌现的临界规模通常出现在 50B-100B 这个区间。这个区间到底是什么物理意义业界还没有定论。一个流行的解释是模型大到一定程度注意力头数、隐藏维度等达到了「能编码复杂推理结构」的最低门槛。再小就编码不了再大就开始展示这些能力。Mirage 挑战涌现可能是测量假象正当涌现能力被业界广泛接受时2023 年斯坦福的一篇论文炸了锅Are Emergent Abilities of Large Language Models a Mirage?论文作者 Schaeffer 等人观察到一个奇怪现象很多「涌现」能力只在某些评估指标下才出现换个指标就消失了。举个具体例子。多步算术任务常规评估指标是「最终答案是否完全正确」exact match答错任何一步最终答案就错得 0 分答对所有步骤得 1 分这是一个离散的二元指标要么 0 要么 1。在这个指标下看到的就是「小模型一直 0 分大模型突然跳到 60%」的涌现曲线。但如果换成「部分正确率」比如答对了前 4 步算 0.8 分同样的实验数据能力提升曲线就变成了平滑的对数曲线没有任何突变。论文的核心论点是「涌现」可能不是模型本身的非线性特性而是评估指标的不连续性放大了一个本来连续的能力提升过程。这个挑战引发了广泛讨论。后续也有论文反驳认为某些涌现现象在多种连续指标下都能观察到不能完全用「指标假象」解释。学术争议还在继续目前的中立结论是能力跃迁是客观存在的从工程效果看模型规模到了 100B 之后确实能做小模型完全做不了的事但「涌现」这个概念可能被过度神化了很多所谓的「突变」其实是连续提升 指标放大效应不存在「魔法的涌现规模」不同任务的临界点不同有的早有的晚没有统一的「100B 之后必然涌现」这个争议对面试来说很有用。如果你能在面试里指出 Mirage 论文的存在并把双方观点都讲清楚会显得你真的看过论文不是只在背技术博客。对工程选型的启发理解了 Scaling Law 和涌现的内核对实际工程选型有几个直接启发1. 不是越大越好要看 Chinchilla 比例参数和数据要匹配至少不能出现「参数很大但数据很少」的欠训状态。1:20 可以作为理解 Chinchilla 的标尺但不是所有模型都必须卡死在这个比例。选型时更应该问这个模型是不是训练充分数据质量怎么样它是为训练算力最优设计还是为推理成本最优设计2. 数据规模可能比参数规模更值得加大如果你有限的算力是 X与其训一个 7B 100B tokens 的模型不如训 3B 250B tokens。同样的算力开销后者效果通常更好推理还便宜。Llama 3 和 Qwen3 都验证了这个直觉。3. 推理成本和参数规模强相关部署一个 175B 模型要好几台 H100部署 8B 模型一张消费级 GPU 就够。在效果差不多的前提下「小参数 海量数据」的模型在推理成本上有天然优势。这也是为什么 2024 年之后开源社区疯狂做小模型大数据。4. 涌现能力对模型选型的影响如果你的任务依赖「涌现能力」多步推理、ICL、跨语言迁移最低门槛是 30B-70B 这个量级再往下就不行。如果是简单分类、抽取、摘要任务7B-13B 完全够用没必要硬上大模型。Scaling Law 的天花板与未来最后简单提一下 Scaling Law 的尽头作为面试加分项。虽然到目前为止还没看到饱和点但业界已经开始担心两个潜在天花板。第一数据见底。互联网上高质量公开文本的总量是有限的估计在 10T-50T tokens 这个量级。Llama 3 已经用了 15TQwen3 用了 36T再过几年就会把人类历史上所有公开文本都用完。这就是「数据墙Data Wall」问题。应对方向有三个合成数据用强模型生成训练数据训弱模型DeepSeek-Math、Qwen2.5-Math 都用了大量合成数据多模态数据扩展到图像、视频、音频把人类所有形式的信号都纳入训练强化学习数据用环境交互生成数据DeepSeek R1 的 RL 训练就属于这一类第二算力增长放缓。摩尔定律已经接近物理极限GPU 算力的增长速度在放缓。能买得起 10 万张 H100 的玩家就那么几个进一步堆参数的边际成本越来越高。这些挑战是 2026 年大模型领域最热的话题之一。能在面试里聊到这些说明你不只是知道现在还在思考未来。 面试总结回到开头那段对话问到 Scaling Law 和涌现能力最重要的是把 Scaling Law 的本质讲清楚。它讲的是 loss 和参数 N、数据 D、算力 C 的幂律关系loss ∝ N^-α。OpenAI 2020 年提出给业界传递了「规模可预测地带来效果」这个革命性结论是后面所有大模型烧钱投入的理论基础。讲完本质之后自然引出 Chinchilla 配比的故事。DeepMind 2022 年训 400 个模型实验发现固定训练算力下参数和数据接近 1:20 更划算。GPT-3 175B 配 300B tokens 是严重欠训70B 的 Chinchilla 配 1.4T tokens 反而明显超过 175B 级别的旧模型。这个发现改变了整个行业2022 年之后大家不再盲目堆参数而是更重视训练 token 和数据质量。接下来讲 Llama 3 时代的进一步变化。Meta 把数据推到 1:1875 的极端配比用 8B 15T tokens 训出超过 GPT-3 175B 的效果说明 Chinchilla 不是「数据上限」。当目标变成「推理便宜、部署容易」时小参数 大数据会非常有吸引力这是 2024 年之后的重要趋势。最关键的是讲清涌现能力 Mirage 挑战。涌现是某项能力从「完全不会」突变到「能做」临界规模 50B-100B。但 2023 年斯坦福 Mirage 论文挑战认为很多涌现是「评估指标不连续」造成的假象换连续指标曲线就平滑了。学术争议在继续但能力跃迁客观存在。能在面试里提出这个学术争议会显示你真的看过论文不是只在背技术博客。如果还想再加分提一句 Scaling Law 的天花板数据墙 算力墙和应对方向合成数据、多模态、强化学习让面试官知道你对未来趋势有思考。能讲到这一层已经是面试里很难追问的水平了。学习资源推荐如果你想更深入地学习大模型以下是一些非常有价值的学习资源这些资源将帮助你从不同角度学习大模型提升你的实践能力。一、全套AGI大模型学习路线AI大模型时代的学习之旅从基础到前沿掌握人工智能的核心技能​因篇幅有限仅展示部分资料需要点击文章最下方名片即可前往获取二、640套AI大模型报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示​因篇幅有限仅展示部分资料需要点击文章最下方名片即可前往获取三、AI大模型经典PDF籍随着人工智能技术的飞速发展AI大模型已经成为了当今科技领域的一大热点。这些大型预训练模型如GPT-3、BERT、XLNet等以其强大的语言理解和生成能力正在改变我们对人工智能的认识。 那以下这些PDF籍就是非常不错的学习资源。因篇幅有限仅展示部分资料需要点击文章最下方名片即可前往获取四、AI大模型商业化落地方案作为普通人入局大模型时代需要持续学习和实践不断提高自己的技能和认知水平同时也需要有责任感和伦理意识为人工智能的健康发展贡献力量。
返回列表