Jev 的“零幻觉”需要被重新定义:RLCD、类型安全与概率校准
“Jev 不会幻觉”听起来很厉害,但它更像一道填空题的承诺:答案只能落在给定选项里,不代表一定填对。真正值得关注的是它如何让概率变得可信。
一、把“零幻觉”拆开看
| 说法 | 更准确的解释 |
|---|---|
| “Jev 不会幻觉” | 营销化表达,重新定义了“幻觉” |
| 实际能力 | 不会输出预定义选项之外的内容,但选项之内仍可能选错 |
一个只能在 A/B/C 里选答案的人不会选 D,但他仍可能把 C 选成 B。Jev 的可靠性来自三个维度:
- 类型安全:输出结构不可能跑到定义的 schema 之外。
- 概率校准:说“90% 概率”的答案,实际正确率也应该接近 90%。
- 一致性:相同输入给出稳定判断,方差小。
二、传统 LLM 为什么“不可信”
传统大模型做判断有三个典型问题。
不懂装懂。 LLM 的训练目标往往是生成“让人满意的回答”,而不是“诚实地表达不确定”。RLHF 奖励人类爱看的答案,结果模型学会了怎么说才像对的,而不是怎么说才是对的。
概率不可信。 模型说“90% 把握”,可能只是拍脑袋。工程上想按置信度分流,如果 0.9 的实际正确率只有 60%,安全阈值形同虚设。
输出不稳定。 同样的问题,换个问法、换个时间,答案可能漂移。Agent 一次任务要做几十次判断,每个环节一点不稳定,累积起来就是系统不可靠。
三、底层原理一:RLCD 替代 RLHF
Jev 的训练目标不是“答对”,而是“输出与真实结果相符的概率”。这套方法被称为 RLCD:Reinforcement Learning from Calibrated Decisions,校准决策强化学习。
| 训练方法 | 优化目标 | 典型问题 |
|---|---|---|
| RLHF | 生成让人满意的回答 | 不懂装懂、过度自信 |
| RLVR | 答对可验证的题 | 推理链长,又慢又贵 |
| RLCD | 输出校准的概率 | 需要大量标注数据 |
RLHF 像老师改作文,夸“写得真好”;RLCD 像老师改选择题,做对就是对、做错就是错,还要学生自己说“这题我有几成把握”。
校准的意义可以这样理解:一个预言家做了 1000 次预测,每次都说“80% 概率发生”。如果确实有 800 次发生,它就是校准的。工程代码要依赖这个数字做决策,这个数字就必须可信:
if decision.confidence > 0.88:
auto_execute()
else:
route_to_human()
四、底层原理二:三种原语的结构保证
Noul:是非判断
在隐空间直接计算“为真的可能性”,返回 0~1 概率,不需要先组织语言再翻译回判断。
result = jev.ask(
state="用户消息:你们服务真垃圾,再也不用了",
questions=[
{"type": "noul", "question": "用户是否在投诉?"},
{"type": "noul", "question": "用户是否提到退款?"},
],
)
# {"用户是否在投诉?": {"probability": 0.97}, ...}
Choice:多选一
直接在预定义选项集合上输出概率分布,最多支持 255 个选项。
result = jev.ask(
state=customer_message,
questions=[
{"type": "choice", "question": "该分给哪个部门?",
"options": ["售前", "售后", "技术", "账务"]},
],
)
# {"choice": "账务", "probabilities": {"售前":0.02,"售后":0.03,"技术":0.01,"账务":0.94}}
Score:打分
把连续打分离散化到预设等级,输出各等级概率再加权。
result = jev.ask(
state=ticket_content,
questions=[
{"type": "score", "question": "客户愤怒程度?",
"scale": [1, 2, 3, 4, 5, 6, 7, 8, 9, 10]},
],
)
# {"score": 8.2, "probabilities": {7:0.15, 8:0.45, 9:0.30, 10:0.10}}
所以“没有幻觉”的本质是:输出空间被限制在预定义选项内,这是结构保证。但结构正确不等于判断正确。
五、底层原理三:为什么概率校准有工程价值
校准过的概率让你敢写阈值。0.9 可以自动执行,0.6 转人工,0.5 以下拒绝——前提是模型说的 0.9 真的对应约 90% 的正确率。
传统 LLM 的置信度不可迁移:它嘴里的“90%”不可信,阈值只能靠反复试错。RLCD 的训练目标,正是把概率本身变成可依赖的工程信号。
六、第三方实测与边界
数据表现
- 苹果年报召回判定:准确率与 DeepSeek V4.1 Flash 打平(92.2%),决策一致率 94.7%。
- LangChain Jev-as-a-Judge:500 次评测全对,质量评分方差比 LLM 裁判低一两个数量级。
- 工具调用安全分类:60 个案例总一致率 91.7%;界限清晰案例全部答对;伪装陷阱答对 11/12;本身含糊的案例答对约 71%。
规律很明显:边界越清晰越准,越含糊越容易错。
官方自己承认的失灵场景
| 场景 | 表现 |
|---|---|
| 数数 / 算术 | 不可靠 |
| 日期时间比较 | 不可靠 |
| 双重否定、间接引用 | 准确率下降 |
| 臃肿的 state | 上下文腐化,准确率下降 |
| 提示词注入 | 会被操纵性文本带偏 |
| Score 不是测量仪 | 1.4 分不能解读为“40% 的愤怒” |
七、结论:准,但不等于更聪明
Jev 的准来自三个约束:用 RLCD 训练出校准概率,把输出限制在结构安全范围内,把判断做成专门任务。
它不是来取代大模型的,而是来当大模型的“裁判”:大模型负责理解和生成,Jev 负责判断和打分。它的核心竞争力不是“更聪明”,而是“更快、更便宜、够用,并且给你一个敢用的置信度”。

303

被折叠的 条评论
为什么被折叠?



