实验尚未开始

本章是一份可执行协议,不是结果报告。当前没有本地 Jev 测量,也没有证据证明它在我们的任务上优于规则或 DeepSeek。先公开方法,是为了防止看到结果后临时修改指标、样本或比较对象。

第一项任务:Agent 路由

答案空间固定为 searchcodedatabasehuman_review。样本覆盖清晰请求、跨域请求、信息不足、高风险动作和对抗性措辞。每条样本由人工给出主标签与可接受备选,并记录分歧;不能达成一致的样本进入争议集,不混入主 accuracy。

我们比较三条基线:确定性关键词与风险规则;DeepSeek 的严格结构化输出;Jev Choice 与概率。三者接收语义等价的输入和相同标签定义,但允许使用各自最自然的接口。规则是必须被击败的成本底线,DeepSeek 是现有生成式方案,Jev 是待验证方案。

固定数据记录

每条记录至少包含 sample_id、脱敏输入、人工标签、可接受标签、各方案输出、候选概率或置信度、端到端延迟、估算成本、是否转人工、错误类型和业务影响等级。私有原文与凭据不进入公开仓库;公开报告只保留脱敏样本和聚合指标。

数据在第一次调参前划分为开发/校准集与不可触碰的保留测试集。来自同一会话、模板、用户或轻微改写的相关样本必须放在同一分区,避免近重复信息跨分区泄漏。规则、提示、问题拆分和拒答阈值只允许在开发/校准集上迭代;最终评分前完成配置冻结,再对保留测试集运行一次。日常版本回归结果与最终 held-out evaluation 分开报告,不能把前者当成泛化成绩。

代码、数据集分区、模型版本、阈值与计费日期必须固定到版本。若某个 provider 不返回可比较概率,应明确写成缺失,不能用随手生成的“置信度”补齐。

评估什么

主指标包括 accuracy、confusion matrix、各类 precision / recall。概率质量用 Brier Score 与 calibration curve;运行性质报告 P50 / P95 延迟、单样本成本与错误率。加入低置信拒答后,还要同时报告 coverage 与剩余样本准确率,防止用“全部转人工”制造高准确率。

不同错误不能只按数量相加。把普通搜索错交给代码与把数据库删除错判为可自动执行,业务影响完全不同。报告会单列高风险 false approval、漏掉的 human_review 和服务失败时的默认行为。

三个阶段

第一阶段是离线固定数据集:只在开发/校准集上反复运行、定位分歧和选择阈值,配置冻结后才使用保留测试集评估,并建立独立的版本回归。第二阶段是 Shadow Mode:在真实请求旁路记录建议,但不改变现有决策。第三阶段才允许高置信、低风险分支自动执行,而且必须保留审计日志、熔断和人工接管。

任何阶段出现服务超时都回退现有流程;置信不足进入 human_review;模型版本变化或数据分布漂移时停止沿用旧阈值并重跑完整评测。支付、删除、交易与权限变更不由 Jev 单独批准。

网站与实验台分开

本站保存研究文章、协议、脱敏摘要和可追溯版本链接。未来 Python 实验台独立存放 providers/datasets/runner/metrics/reports/ 与测试,不成为网站构建依赖。API Key、私有数据和原始请求只存在于受控实验环境。

完成标准不是“API 返回了一个答案”,而是三条基线可以在同一数据集运行,失败案例可复现,概率和阈值可审计,并能回答:在哪些任务上,Jev 的速度与成本优势足以覆盖新增供应商、校准和回退成本。实验完成前,所有结果位置都保持空白并标记为待执行。