深耕实体创业,拒绝短期投机;聚焦可落地商业模式,与实干者共建长期事业。
商务合作关于我们联系我们投稿合作
创场创业创场创业让创业有方法、起步有赛道
创场创业
创场创业让创业有方法、起步有赛道
首页创业干货创业头条创业经验工商财税运营获客项目赛道轻资产线上项目小成本实体生意副业转型创业避雷项目盘点工具资料AI排行榜
快讯

Kimi K3在Terminal-Bench 2.1测试中超越Claude Fable 5

2026-08-23 13:27:34

近期,在Terminal-Bench 2.1评估中,月之暗面Kimi K3得分达85.0%,超过Claude Fable 5的84.6%。测试显示前沿模型性能趋同,但成本差异显著,K3等国内模型在成本上远低于海外旗舰。

近期,月之暗面Kimi K3在Terminal-Bench 2.1评估中得分达到85.0%,超过Claude Fable 5的84.6%。该测试主要用于评估修复Bug、管理文件等实际软件任务。

测试结果显示,GPT-5.6 Sol与Claude Opus 5依然位居前列,但K3的表现已使其位列全球模型第一梯队,与阿里Qwen 3.7、智谱GLM 5.2等国内模型共同展现了赶超势头。

在另一项名为Brewberg的真实世界测试中,要求模型从零构建一个虚构咖啡电商网站。多数前沿模型功能准确率均达100%,但成本差异巨大:Claude Fable 5完成该任务耗费近49美元,而国内部分顶尖模型只需不到2美元。

性能趋同与成本差距正在改变企业客户的选择逻辑,价格成为决定市场份额的关键因素。