智谱創始人唐杰:大模型Scaling不只是堆參數,未來競爭核心轉向後訓練與推理能力
Odaily星球日報訊 智譜創始人唐杰在 X 平台發布關於大模型 Scaling Law 的思考文章表示,當前人工智能行業對模型能力提升的理解正在從「擴大參數規模」轉向多維度擴展,參數量並非衡量模型能力的唯一指標,還需要結合數據規模、計算資源分配方式以及模型實際運行場景綜合評估。
唐杰指出,早期研究曾推動行業快速擴大模型參數規模。Kaplan 等人在 2020 年的研究認為,模型參數增長速度應高於數據增長速度,推動了 GPT-3、Gopher、MT-NLG 等超大規模模型的發展。但 Hoffmann 等人在 2022 年通過分析數百個模型發現,計算最優方案更接近「每個參數對應約 20 個訓練 Token」,模型參數和數據規模應保持同步增長,過去追求萬億參數模型的路線實際上是行業共同經歷的一次「偏航」。隨著模型應用場景變化,推理成本逐漸成為生命週期成本的重要組成部分,優化目標也從單純降低訓練成本轉向提升長期運行效率,因此「小模型+更充分訓練」的路線開始受到關注。
唐杰表示,稀疏混合專家(MoE)架構進一步改變了 Scaling 邏輯。在 MoE 模型中,總參數量決定模型能夠存儲多少知識,而激活參數和有效深度更影響模型完成複雜推理任務的能力。對於漏洞發現等需要長鏈條推理的任務而言,能力並不來自簡單記憶更多信息,而是需要模型保持多步推理過程的連貫性。近期研究顯示,最優「Token/參數比例」並不存在統一答案:偏向記憶型任務需要更多參數,而偏向推理型任務則更依賴更多數據和計算深度。在固定訓練數據規模下,盲目增加總參數甚至可能削弱推理能力,而增加激活專家數量則更有助於提升模型表現。
圍繞智譜最新模型進展,唐杰透露,GLM-5.3 是一次針對 Scaling 方向的實驗。該模型與 GLM-5.2 採用相同基礎模型、架構以及總參數和激活參數規模,但通過一個月的大規模長週期環境訓練和強化學習(RL)進行後訓練優化,性能提升並非來自參數增加,而是來自後訓練階段的擴展。他總結稱,大模型競爭已經從單純比拼參數規模,進入探索「多維 Scaling」的階段,未來模型能力提升將更多依賴訓練策略、推理深度以及後訓練能力的持續優化。
