为什么单独审计这些数字

“193.6 倍快、444.6 倍便宜”极易被读成对所有模型、所有任务的统一提升。TypeSafe 自己说明,这些最高倍数来自其 workflow eval,并承认它们处于真实收益的高端。以下数字截至 2026-09-20 只属于厂商评测,不是本地复现。官方发布文评测站

原始声明

公开表格中,Jev 在四类 production-style workflow 上的平均得分约为 67.8%,单 case 成本约 $0.0004,端到端时间约 0.4 秒。首页传播的峰值是 193.6× faster444.6× cheaper。这些是厂商声明,尚未由本专题独立跑通。

同一表格里,得分接近的 GPT-5.6 Terra 约为 67.9%$0.0304/case10.1 秒/case。这里保留模型名和版本口径,是为了避免把结果错误推广到任意 GPT、DeepSeek 或未来版本。

计算口径

最高速度倍数与最高成本倍数使用了不同的对照中各自最有利的值,因此不能理解为“相对于某一个模型同时快 193.6 倍并便宜 444.6 倍”。必须回到每行模型、同一 workflow 和同一聚合规则计算。

若只用上面的近分 Terra 行做朴素算术:0.0304 / 0.0004 ≈ 7610.1 / 0.4 ≈ 25.25。所以在厂商数据内部,这组更容易理解的比较约是 76 倍成本差25 倍延迟差。它仍不是我们的测量,也没有包含接入、重试、网络区域和人工复核成本。

67.8% 也不是通常意义上的人工标注 accuracy。官方说明参考概率由 GPT-6 Astra 与 Claude Fable 5.1(高思考配置)的预测平均构成,而不是人工真值。评测衡量模型与参考模型在预设 compute graph 中的接近程度;参考本身可能出错并带有模型族偏差,因此“67.8%”不是人工真值准确率

production-style 不是 production traffic

这些 workflow 模拟了代码中的完整判断图,比单条演示更接近业务逻辑;但它们由 TypeSafe 模型能力团队成员制作,固定 harness,没有覆盖你的真实数据分布、峰值并发、超时重试、区域网络、长期漂移和错误损失。称为 production-style workflow simulation 是合适的,称为已经在真实生产流量验证则不合适。

官方还说明,评测通常从美国西海岸的笔记本运行,服务也位于该区域附近。中国或其他区域的端到端延迟不能直接照搬 0.4 秒。

当前判断

当前可以支持的结论是:在 TypeSafe 设计并公开的四类结构化工作流中,Jev 展示了有竞争力的参考得分和显著的成本、延迟优势,值得用真实任务进一步验证。

当前不能支持的结论包括:Jev 普遍比所有 LLM 快 193.6 倍且便宜 444.6 倍;67.8% 等于人类认可的业务准确率;类型安全等于不会产生语义错误;一次厂商评测足以证明长期概率校准;模拟工作流等于生产运行。

本专题后续会固定数据集、代码 commit、模型版本、请求区域和计费快照,分别报告 P50/P95、准确率、校准与拒答后 coverage。在这些实验完成前,本文所有推导都明确标记为“对厂商数据的算术与方法审计”。