跳转至

Judge / 评判模型与最新评测方法

说明:用户提到的“jav判断模型”本页按“judge/评判模型”理解。研究快照:2026-09-26。

Judge 不是一个模型名称

Judge 有三种不同东西:

  1. LLM-as-a-Judge:用一个模型按 rubric 给另一个模型评分。
  2. Grader 系统:字符串、代码、schema、模型评分器和 multigrader 的组合。
  3. Judge benchmark/framework:研究 judge 偏差、排序一致性、可复现性和人类相关性的评测框架。

OpenAI 的 Graders 文档明确列出 string check、text similarity、score model grader、Python code execution 和 multigrader;GDPval/PaperBench 也强调自动 judge 必须用人类专家偏好或独立 judge benchmark 校准。

当前值得跟踪的对象

对象 类型 公开状态 适合什么
GPT-5 系列 / OpenAI score model grader 托管 judge + grader API 官方文档和评测工具 结构化 rubric、企业 eval pipeline
Claude / Gemini 等 frontier model 托管 LLM judge 模型本身不是专门 judge 长文本、风格、复杂交付物的辅助评分
DeepSeek-R1/V3 系列 开放/可调用模型候选 权重或 API 依据具体版本 本地 judge、中文和推理 rubric
Qwen3-235B-A22B-Thinking-2507 开放 judge 候选 论文/评测中作为开放 judge 替代专有 judge 的研究基线
Jev / System One 类型化决策模型,不是传统 LLM judge Choice/Score/Noul + 概率/置信度;early access 高频路由、守门、评分与“是否升级人工”,必须校准
JudgeLM 专门训练的开源 judge GitHub + ICLR 论文 可复现实验和多模态 judge 研究
JudgeArena judge 评测框架 2026 论文/开源方向 比较 benchmark、prompt、judge、backend 的影响

Judge 的真实风险

  • 位置偏差:pairwise 比较中更偏好第一个或第二个答案。
  • 长度偏差:长答案看起来更完整,实际可能有更多错误。
  • 风格偏差:把自己熟悉的表达当作事实正确。
  • 模型同源偏差:执行模型与 judge 使用相近训练分布,容易共享盲点。
  • rubric 漏项:judge 只按显眼的格式评分,忽略权限、引用和隐藏约束。
  • 评分不可校准:一个 0.82 不是跨任务、跨 judge 可比的绝对质量。

本 Wiki 推荐的评测栈

确定性门禁
  -> schema / regex / code test / permission / numeric checks
检索门禁
  -> evidence recall / context inclusion / citation correctness
Judge
  -> rubric score + pairwise preference + reason code
人工校准
  -> high-risk sample / disagreement / periodic audit
业务结果
  -> task success / rework / adoption / cost per successful task

Judge 只能覆盖主观或开放式部分,不能替代确定性检查。高风险样本必须保留人工审核或业务专家签字。

Jev 是一个有用的补充:它更适合把“是否通过、属于哪类、风险多少、是否需要人工”做成窄而快的 typed judge。它不应独自评价长文风格、代码正确性或复杂推理;这些仍需要规则、执行环境、强模型和人审组合。

评判模型选择规则

场景 Judge 选择 条件
JSON/代码/工具参数 不优先用 LLM 先执行 parser、单测、schema 和模拟工具
长报告 强模型 + rubric 分段评分后再汇总,校准长度和引用偏差
中文知识回答 中文强模型 + 人工集 检查术语、引用、拒答和政策偏差
Agent trajectory judge 看轨迹,不只看最终答案 评分无效步骤、工具参数、越权和恢复
模型发布回归 pairwise + 绝对门禁 randomize 顺序,保留严重错误硬门槛
本地/隐私环境 Qwen/DeepSeek/JudgeLM 等开放候选 与人工集校准,不按开源标签推断质量

最小 Judge Rubric

task_success:
  weight: 0.40
  evidence: [required_facts, required_actions]
factuality:
  weight: 0.20
  evidence: [source_citations, contradiction_check]
tool_safety:
  weight: 0.20
  evidence: [permissions, idempotency, approval]
usability:
  weight: 0.10
  evidence: [format, next_action, clarity]
cost_latency:
  weight: 0.10
  evidence: [ttft, e2e, tokens, retries]
hard_fail:
  - unauthorized_action
  - sensitive_data_leak
  - fabricated_source

验证 judge 是否可信

  1. 建立至少 50 条人工标注集,覆盖通过、边界和严重错误。
  2. 随机化 pairwise 答案顺序,测 position bias。
  3. 让 judge 重复评分,测方差和不稳定样本。
  4. 比较不同 judge 的分歧,不把单一 judge 的胜负当事实。
  5. 检查 judge 是否能发现“格式正确但权限越界”的答案。
  6. 每次升级 judge 或 rubric 都重跑历史回归。

FDE 结论

最稳妥的 judge 不是“选一个最强模型”,而是把确定性验证、多个 judge、人工校准和业务指标组合成门禁。GDPval 的价值在于把真实工作交付物和专家偏好带入评测;JudgeArena 的价值在于提醒我们 benchmark、prompt、backend 和 judge 的组合会改变结论。

让 Judge 结果可以被相信

三种输出不要混为一谈

输出 解释 适合做什么
label 通过、拒绝、类别等离散结果 路由和硬门禁,需看混淆矩阵
score rubric 下的相对分数 排序和回归,需看标注者一致性
confidence 对 label/score 的不确定性 选择性自动化,需校准后使用

Jev 的 typed decision、普通 LLM 的 JSON mode 和传统 judge 都可以输出结构化字段,但“结构合法”不代表“判断正确”。评测时分别记录 schema error、事实错误、权限错误和业务失败。

最小校准实验

人工标注集  -> 训练/调阈值集  -> 只读 holdout
                         -> reliability diagram
                         -> ECE / Brier / selective risk

至少做四个对照:

  1. 同一答案随机交换 A/B 顺序,检查 position bias。
  2. 同一答案重复评分,检查温度、采样和上下文顺序造成的方差。
  3. 用执行模型之外的 judge 或人工评审高风险样本,避免同源偏差。
  4. 把“格式正确但事实错误”和“事实正确但越权”分别放入 hard negative。

适用条件:judge 结果会触发自动发布、路由、人工升级或拒绝。 代价:需要人工标注、holdout、重复运行和多 judge 预算。 验证方式:报告混淆矩阵、人工一致率、ECE/Brier、选择性风险曲线和误判成本,而不是只报平均分。

官方和论文入口