结果与限制

报告实际结果,
保留失败与分歧。

核心比较覆盖两个已暴露的合成家族,每套任务各一个,共60个执行单元;另有20个四状态干预单元。配置与任务相关,不能据此推断普遍收益。查看完整结果、失败案例与复算记录。

如何阅读结果

分别观察文风与过程任务、自然输出与受控样本、通用与个人配置。表中区分登记、已记录和完成单元;运行失败进入已记录单元的端到端分母,尚未运行的单元单独保留。成功响应条件下的结果另外报告。

比较按 source_group_id 做配对统计。变体、重复采样和多裁判意见不能当作独立样本。小规模结果不支持普遍质量或人类偏好声明。

没有人工标注、人工打分或人类偏好采集。动态模型别名未锁定供应商权重;Codex客户端比较包含宿主差异。未运行单元不填模拟分数。