近期,月之暗面Kimi K3在Terminal-Bench 2.1评估中得分达到85.0%,超过Claude Fable 5的84.6%。该测试主要用于评估修复Bug、管理文件等实际软件任务。
测试结果显示,GPT-5.6 Sol与Claude Opus 5依然位居前列,但K3的表现已使其位列全球模型第一梯队,与阿里Qwen 3.7、智谱GLM 5.2等国内模型共同展现了赶超势头。
在另一项名为Brewberg的真实世界测试中,要求模型从零构建一个虚构咖啡电商网站。多数前沿模型功能准确率均达100%,但成本差异巨大:Claude Fable 5完成该任务耗费近49美元,而国内部分顶尖模型只需不到2美元。
性能趋同与成本差距正在改变企业客户的选择逻辑,价格成为决定市场份额的关键因素。
