Judge / 评判模型与最新评测方法¶
说明:用户提到的“jav判断模型”本页按“judge/评判模型”理解。研究快照:2026-09-26。
Judge 不是一个模型名称¶
Judge 有三种不同东西:
- LLM-as-a-Judge:用一个模型按 rubric 给另一个模型评分。
- Grader 系统:字符串、代码、schema、模型评分器和 multigrader 的组合。
- Judge benchmark/framework:研究 judge 偏差、排序一致性、可复现性和人类相关性的评测框架。
OpenAI 的 Graders 文档明确列出 string check、text similarity、score model grader、Python code execution 和 multigrader;GDPval/PaperBench 也强调自动 judge 必须用人类专家偏好或独立 judge benchmark 校准。
当前值得跟踪的对象¶
| 对象 | 类型 | 公开状态 | 适合什么 |
|---|---|---|---|
| GPT-5 系列 / OpenAI score model grader | 托管 judge + grader API | 官方文档和评测工具 | 结构化 rubric、企业 eval pipeline |
| Claude / Gemini 等 frontier model | 托管 LLM judge | 模型本身不是专门 judge | 长文本、风格、复杂交付物的辅助评分 |
| DeepSeek-R1/V3 系列 | 开放/可调用模型候选 | 权重或 API 依据具体版本 | 本地 judge、中文和推理 rubric |
| Qwen3-235B-A22B-Thinking-2507 | 开放 judge 候选 | 论文/评测中作为开放 judge | 替代专有 judge 的研究基线 |
| Jev / System One | 类型化决策模型,不是传统 LLM judge | Choice/Score/Noul + 概率/置信度;early access | 高频路由、守门、评分与“是否升级人工”,必须校准 |
| JudgeLM | 专门训练的开源 judge | GitHub + ICLR 论文 | 可复现实验和多模态 judge 研究 |
| JudgeArena | judge 评测框架 | 2026 论文/开源方向 | 比较 benchmark、prompt、judge、backend 的影响 |
Judge 的真实风险¶
- 位置偏差:pairwise 比较中更偏好第一个或第二个答案。
- 长度偏差:长答案看起来更完整,实际可能有更多错误。
- 风格偏差:把自己熟悉的表达当作事实正确。
- 模型同源偏差:执行模型与 judge 使用相近训练分布,容易共享盲点。
- rubric 漏项:judge 只按显眼的格式评分,忽略权限、引用和隐藏约束。
- 评分不可校准:一个 0.82 不是跨任务、跨 judge 可比的绝对质量。
本 Wiki 推荐的评测栈¶
确定性门禁
-> schema / regex / code test / permission / numeric checks
检索门禁
-> evidence recall / context inclusion / citation correctness
Judge
-> rubric score + pairwise preference + reason code
人工校准
-> high-risk sample / disagreement / periodic audit
业务结果
-> task success / rework / adoption / cost per successful task
Judge 只能覆盖主观或开放式部分,不能替代确定性检查。高风险样本必须保留人工审核或业务专家签字。
Jev 是一个有用的补充:它更适合把“是否通过、属于哪类、风险多少、是否需要人工”做成窄而快的 typed judge。它不应独自评价长文风格、代码正确性或复杂推理;这些仍需要规则、执行环境、强模型和人审组合。
评判模型选择规则¶
| 场景 | Judge 选择 | 条件 |
|---|---|---|
| JSON/代码/工具参数 | 不优先用 LLM | 先执行 parser、单测、schema 和模拟工具 |
| 长报告 | 强模型 + rubric | 分段评分后再汇总,校准长度和引用偏差 |
| 中文知识回答 | 中文强模型 + 人工集 | 检查术语、引用、拒答和政策偏差 |
| Agent trajectory | judge 看轨迹,不只看最终答案 | 评分无效步骤、工具参数、越权和恢复 |
| 模型发布回归 | pairwise + 绝对门禁 | randomize 顺序,保留严重错误硬门槛 |
| 本地/隐私环境 | Qwen/DeepSeek/JudgeLM 等开放候选 | 与人工集校准,不按开源标签推断质量 |
最小 Judge Rubric¶
task_success:
weight: 0.40
evidence: [required_facts, required_actions]
factuality:
weight: 0.20
evidence: [source_citations, contradiction_check]
tool_safety:
weight: 0.20
evidence: [permissions, idempotency, approval]
usability:
weight: 0.10
evidence: [format, next_action, clarity]
cost_latency:
weight: 0.10
evidence: [ttft, e2e, tokens, retries]
hard_fail:
- unauthorized_action
- sensitive_data_leak
- fabricated_source
验证 judge 是否可信¶
- 建立至少 50 条人工标注集,覆盖通过、边界和严重错误。
- 随机化 pairwise 答案顺序,测 position bias。
- 让 judge 重复评分,测方差和不稳定样本。
- 比较不同 judge 的分歧,不把单一 judge 的胜负当事实。
- 检查 judge 是否能发现“格式正确但权限越界”的答案。
- 每次升级 judge 或 rubric 都重跑历史回归。
FDE 结论¶
最稳妥的 judge 不是“选一个最强模型”,而是把确定性验证、多个 judge、人工校准和业务指标组合成门禁。GDPval 的价值在于把真实工作交付物和专家偏好带入评测;JudgeArena 的价值在于提醒我们 benchmark、prompt、backend 和 judge 的组合会改变结论。
让 Judge 结果可以被相信¶
三种输出不要混为一谈¶
| 输出 | 解释 | 适合做什么 |
|---|---|---|
label |
通过、拒绝、类别等离散结果 | 路由和硬门禁,需看混淆矩阵 |
score |
rubric 下的相对分数 | 排序和回归,需看标注者一致性 |
confidence |
对 label/score 的不确定性 | 选择性自动化,需校准后使用 |
Jev 的 typed decision、普通 LLM 的 JSON mode 和传统 judge 都可以输出结构化字段,但“结构合法”不代表“判断正确”。评测时分别记录 schema error、事实错误、权限错误和业务失败。
最小校准实验¶
至少做四个对照:
- 同一答案随机交换 A/B 顺序,检查 position bias。
- 同一答案重复评分,检查温度、采样和上下文顺序造成的方差。
- 用执行模型之外的 judge 或人工评审高风险样本,避免同源偏差。
- 把“格式正确但事实错误”和“事实正确但越权”分别放入 hard negative。
适用条件:judge 结果会触发自动发布、路由、人工升级或拒绝。 代价:需要人工标注、holdout、重复运行和多 judge 预算。 验证方式:报告混淆矩阵、人工一致率、ECE/Brier、选择性风险曲线和误判成本,而不是只报平均分。