8月22日,智谱创始人唐杰在X平台发布长文《Thoughts About Scaling Law》,质疑“参数越多模型越强”的行业共识。他提出,参数量只是知识的仓库,真正决定智能的是FLOPs,数据规模、算力分配和推理部署条件缺一不可。
唐杰援引2021年Google Brain团队的Switch Transformer研究为例。该模型虽拥有1.6万亿总参数,但通过稀疏激活每次仅调用极小比例参数,预训练速度比T5-XXL快4倍。在下游任务中,其知识类任务得分领先,但在需要多步推理的ARC Challenge上反而落后2.7分,显示出参数膨胀带来的是“记住更多”,而非“想得更深”。
唐杰认为,行业评价标尺正从“数参数”切换到“算算力”,总参数、激活参数与FLOPs需被明确区分。
