主流模型快速迭代下,我们如何评估模型真实写码能力
TrakToken 首页编码指标从 Coding Index 切换为 Terminal-Bench 4.0。用统一的自主跑分框架替代综合指数,解决新模型跑分大面积缺失问题。
TrakToken 首页的三项核心指标里,编码维度已正式从历史的综合 Coding Index 切换为 Terminal-Bench 4.0(简称 TB4)。
这项调整源于评测生态的变化。随着底层模型从“单函数代码补全”走向“终端自主排错与项目重构”,旧有指标不仅出现了严重的评分水分,更在上游覆盖上陷入断层。切换之后,我们采用统一的脚手架采集纯基座模型的真实代码表现。
为什么旧指标难以为继
长期以来,主流代码评测走过了三个阶段:从早期的单函数单元测试生成(HumanEval、MBPP),到算法竞技编程(LiveCodeBench),再到基于 GitHub Issue 的补丁生成(SWE-bench)。
此前使用的 Coding Index 是一个复合指数,其底层成分包含老旧的 Terminal-Bench 2.1 等。它面临两个现实问题:
- 基准老化与刷榜失真:早期题目的测试约束相对宽松,不少模型针对特定任务提示词做了定向优化,导致跑分无法体现真实工程能力。
- 新模型覆盖断崖:在最近一个月上线的 18 个前沿配置中,旧 Coding Index 仅覆盖了 2 个,缺失率高达 88.9%。包括 Opus 5.5、Sonnet 5.5、GPT-6 Astra 在内的主力模型在旧榜上均未获得更新。
对选型而言,一个长期缺席最新一代主力模型的指标,无法再提供决策参考。
Terminal-Bench 4.0 的评测哲学与核心机制
TB4 的设计目标是检验模型在真实计算机环境中的自主工程解决能力。它放弃了给一段文本让模型补全的静态模式,转为端到端的动态系统交互:
- 动态隔离沙箱:测试直接在独立的 Docker 容器内运行,为模型提供完整的 Linux Bash 终端权限。
- 66 个精选题集:覆盖真实多文件软件工程、Linux 系统运维诊断(SysAdmin)、机器学习流水线配置、数据分析以及底层环境依赖排错。
- 状态验证机制(State-based Verifier):评测完全不看模型中间写了多少漂亮的分析文本,只看最终系统状态。评分脚本会检查目标文件是否被正确修改、编译与构建是否通过、指定进程与服务是否正常拉起,以及验证测试的退出码。
相比 2.1 版本,TB4 重构了指令描述,修复了宽松验证器漏洞,并重新校准了计算与时间上限。这导致很多在旧版拿到 80 分以上的模型,在 TB4 上分数大幅回落,重新拉开了梯队差距。
统一测试脚手架:控制变量看基座
如果直接查阅 TB4 官方榜单,会发现不同排名混杂了不同的客户端产品:有的跑在 Claude Code 上,有的跑在 Codex 体系下,还各自配备了不同的推理算力预算(effort 或 reasoning tokens)。这种分数体现的是“模型加特定商业外挂”的系统总分,不是底层模型本身的分数。
在 TrakToken 收录的数据中,我们采用 Artificial Analysis 的标准化测试实现:
- 统一 Harness(mini-swe-agent):使用极简、开源且模型中立的 mini-swe-agent 作为基础交互脚手架。所有模型在相同的 Prompt 约束、相同的 Bash 交互协议下运行,剔除厂商定制工程的影响。
- 3 次重复取 pass@1:每个任务独立运行 3 次,统计单次通过率,原始 0 到 1 的比率线性换算为 0 到 100%。
- 时效覆盖完整:在 2026 年 9 月之后发布的 69 个最新模型配置中,TB4 实现了 100% 的数据覆盖。
优势与局限性拆解
引入 TB4 能解决核心问题,但它同样有边界和局限。
优势方面:
- 端到端贴近现场:它能准确测出模型面对报错日志时的自我纠错能力、多轮定位问题的耐力,以及在复杂依赖环境下的行动力。
- 防刷榜力度更高:严密的沙箱验证脚本杜绝了投机取巧的模式匹配。
- 基座可比性更强:统一的轻量级 Harness 还原了各家 API 模型的真实原始能力。
局限与权衡:
- 样本规模相对较小(66 题):为了支持深度沙箱交互与严格验证,TB4 保持了精简的题集规模。每道题对应约 1.5% 的分值,偶发的超时或网络抖动对最终百分比具有可观察的影响。
- 场景偏向终端智能体:TB4 评估的是作为 Agent 的自主行动。如果你只需要模型在 IDE 内完成单行 Tab 补全或回答简单的 API 用法,TB4 的排名与你的日常体验可能会存在偏差。
- 评测成本高昂导致历史回溯慢:端到端运行真实沙箱非常耗时且昂贵,大量历史长尾模型没有补跑 TB4。
在 TrakToken 中如何配合使用各项指标
我们不倾向于将多种特性的测试简单加权合成一个总分。当前站内的三项核心指标各自负责明确的场景分工:
- 综合推理与通用理解:参考 Intelligence Index,关注文本与数理常识基线。
- 复杂工程与终端排错:参考 Terminal-Bench 4.0,关注长链路自主解决问题的可靠性。
- 日常代码问答与对话偏好:参考 Arena Text Coding Elo,基于大量人类工程师的盲测盲选,衡量代码解释的易读性。
对于未被 TB4 覆盖的历史模型,我们直接保留空值,不再使用老旧指数插值伪造;对于在标准评测中确未解决任何任务的模型,真实记录 0 分。清晰暴露数据边界,比提供虚假的完整更重要。