Jev 置信度与兜底策略实战

更新于 适用版本 Jev 1.13

Jev 的每个响应都带 confidence 分数——这一个字段,把模型从”尝鲜”变成”生产组件”。分数告诉你模型哪里有把握、哪里在猜,你就可以自动化有把握的、分流剩下的。这篇讲阈值怎么定、三条兜底路径怎么设计、整个回路怎么监控才不会悄悄烂掉。

TL;DR: 阈值从 0.8 起步:以上自动化,以下分流。低置信度条目三选一——换更锋利的问法重试、升级人工、或给通用 LLM 做一次完整判断。持续盯 confidence 分布:整体往低漂移,是输入或问题措辞变化最早的警报。

confidence 在响应里是什么

每种题型的 Jev 答案都带同一形态。打分题示例——示例数据(example fixture),正式字段名以官方文档为准:

{
  "answer": 8,
  "scale": [1, 10],
  "confidence": 0.86,
  "rationale": "The answer addresses the core question but omits the setup step."
}

把它当路由信号读,不要当真理。有用的心智模型:confidence 把条目按”能否安全自动化”排序。分布的顶部给自动化,底部给人审,具体的切线由你的错误代价决定。

阈值怎么定:0.8 起步,用数据调

场景建议起步阈值理由
垃圾信息 / 审核标记0.80误伤惹恼用户;复核队列很便宜
工单分流0.85分错要花人工交接时间
简历 / 线索筛选0.85–0.90风险高;只自动化清晰段
发票审批闸口0.90+财务错误代价大;几乎不自动化
内部排序 / 重排0.70错误便宜、量大

这些数字是起点,不是法律。真正要紧的调参回路:

  1. 先跑一周,把每个答案连同 confidence 记日志,暂不对低置信度做动作。
  2. 人工标注低置信度样本的一部分。
  3. 算出错误实际从哪里开始——安全切线经常比 0.8 高或低。
  4. 把阈值定在那里,每季度回看。

三条兜底路径

confidence 低于阈值时,应该发生且只发生以下三件事之一:

import json, os, requests

def judge_with_fallback(prompt: str, threshold: float = 0.8) -> dict:
    # Confirm the exact model slug on the OpenRouter model page
    resp = requests.post(
        "https://openrouter.ai/api/v1/chat/completions",
        headers={"Authorization": f"Bearer {os.environ['OPENROUTER_API_KEY']}"},
        json={
            "model": "typesafe/jev-1.13",
            "messages": [{"role": "user", "content": prompt}],
        },
        timeout=30,
    )
    result = json.loads(resp.json()["choices"][0]["message"]["content"])

    if result["confidence"] >= threshold:
        return result  # 自动化
    if result["answer"] == "unclear" or result["confidence"] < threshold / 2:
        return {"route": "human"}  # 深度不确定:绝不重试循环
    return {"route": "llm_review", "jev": result}  # 中间段:完整 LLM 判断

封装函数在置信时返回 fixture 形态的答案,否则返回路由决策;这里展示的形态都是示例数据(example fixture),正式字段名以官方文档为准。三条路按顺序:

监控回路

三个指标能在用户之前抓住大多数故障:

指标能发现什么告警条件
平均 confidence问题或输入漂移连续数天下滑
升级率阈值失配或流量变难没有发版却突然跳升
兜底路径占比形成重试循环重试占比逐周上升

发票审批闸口的 case 是保守阈值的典型样本——几乎全审、几乎不自动化;工单分流场景则是高流量下相反的平衡。当”报错”其实是响应形态读错了而不是置信度低,《Jev 常见报错排查》有对应的修复。

本文适用版本 Jev 1.13。

常见问题

Jev 的 confidence 阈值定多少合适?

从 0.8 起步:高于阈值自动执行,低于阈值转复核,再根据自己业务的分布调整——正确的阈值取决于错误自动决策的代价。

低置信度的答案该怎么处理?

三条兜底路里选一条:换更锋利的问法重试一次、升级人工、或交给通用 LLM 做完整判断。按流量和风险等级选。

confidence 能当概率直接信吗?

把它当用于分流的排序信号,而不是校准过的概率;在自动化高风险决策之前,先用自己的标注数据验证。

继续阅读