Jev03:零幻觉需要被重新定义

Jev 的“零幻觉”需要被重新定义:RLCD、类型安全与概率校准

“Jev 不会幻觉”听起来很厉害,但它更像一道填空题的承诺:答案只能落在给定选项里,不代表一定填对。真正值得关注的是它如何让概率变得可信。

一、把“零幻觉”拆开看

说法更准确的解释
“Jev 不会幻觉”营销化表达,重新定义了“幻觉”
实际能力不会输出预定义选项之外的内容,但选项之内仍可能选错

一个只能在 A/B/C 里选答案的人不会选 D,但他仍可能把 C 选成 B。Jev 的可靠性来自三个维度:

  1. 类型安全:输出结构不可能跑到定义的 schema 之外。
  2. 概率校准:说“90% 概率”的答案,实际正确率也应该接近 90%。
  3. 一致性:相同输入给出稳定判断,方差小。

二、传统 LLM 为什么“不可信”

传统大模型做判断有三个典型问题。

不懂装懂。 LLM 的训练目标往往是生成“让人满意的回答”,而不是“诚实地表达不确定”。RLHF 奖励人类爱看的答案,结果模型学会了怎么说才像对的,而不是怎么说才是对的。

概率不可信。 模型说“90% 把握”,可能只是拍脑袋。工程上想按置信度分流,如果 0.9 的实际正确率只有 60%,安全阈值形同虚设。

输出不稳定。 同样的问题,换个问法、换个时间,答案可能漂移。Agent 一次任务要做几十次判断,每个环节一点不稳定,累积起来就是系统不可靠。

三、底层原理一:RLCD 替代 RLHF

Jev 的训练目标不是“答对”,而是“输出与真实结果相符的概率”。这套方法被称为 RLCD:Reinforcement Learning from Calibrated Decisions,校准决策强化学习。

训练方法优化目标典型问题
RLHF生成让人满意的回答不懂装懂、过度自信
RLVR答对可验证的题推理链长,又慢又贵
RLCD输出校准的概率需要大量标注数据

RLHF 像老师改作文,夸“写得真好”;RLCD 像老师改选择题,做对就是对、做错就是错,还要学生自己说“这题我有几成把握”。

校准的意义可以这样理解:一个预言家做了 1000 次预测,每次都说“80% 概率发生”。如果确实有 800 次发生,它就是校准的。工程代码要依赖这个数字做决策,这个数字就必须可信:

if decision.confidence > 0.88:
    auto_execute()
else:
    route_to_human()

四、底层原理二:三种原语的结构保证

Noul:是非判断

在隐空间直接计算“为真的可能性”,返回 0~1 概率,不需要先组织语言再翻译回判断。

result = jev.ask(
    state="用户消息:你们服务真垃圾,再也不用了",
    questions=[
        {"type": "noul", "question": "用户是否在投诉?"},
        {"type": "noul", "question": "用户是否提到退款?"},
    ],
)
# {"用户是否在投诉?": {"probability": 0.97}, ...}

Choice:多选一

直接在预定义选项集合上输出概率分布,最多支持 255 个选项。

result = jev.ask(
    state=customer_message,
    questions=[
        {"type": "choice", "question": "该分给哪个部门?",
         "options": ["售前", "售后", "技术", "账务"]},
    ],
)
# {"choice": "账务", "probabilities": {"售前":0.02,"售后":0.03,"技术":0.01,"账务":0.94}}

Score:打分

把连续打分离散化到预设等级,输出各等级概率再加权。

result = jev.ask(
    state=ticket_content,
    questions=[
        {"type": "score", "question": "客户愤怒程度?",
         "scale": [1, 2, 3, 4, 5, 6, 7, 8, 9, 10]},
    ],
)
# {"score": 8.2, "probabilities": {7:0.15, 8:0.45, 9:0.30, 10:0.10}}

所以“没有幻觉”的本质是:输出空间被限制在预定义选项内,这是结构保证。但结构正确不等于判断正确。

五、底层原理三:为什么概率校准有工程价值

校准过的概率让你敢写阈值。0.9 可以自动执行,0.6 转人工,0.5 以下拒绝——前提是模型说的 0.9 真的对应约 90% 的正确率。

传统 LLM 的置信度不可迁移:它嘴里的“90%”不可信,阈值只能靠反复试错。RLCD 的训练目标,正是把概率本身变成可依赖的工程信号。

六、第三方实测与边界

数据表现

  • 苹果年报召回判定:准确率与 DeepSeek V4.1 Flash 打平(92.2%),决策一致率 94.7%。
  • LangChain Jev-as-a-Judge:500 次评测全对,质量评分方差比 LLM 裁判低一两个数量级。
  • 工具调用安全分类:60 个案例总一致率 91.7%;界限清晰案例全部答对;伪装陷阱答对 11/12;本身含糊的案例答对约 71%。

规律很明显:边界越清晰越准,越含糊越容易错。

官方自己承认的失灵场景

场景表现
数数 / 算术不可靠
日期时间比较不可靠
双重否定、间接引用准确率下降
臃肿的 state上下文腐化,准确率下降
提示词注入会被操纵性文本带偏
Score 不是测量仪1.4 分不能解读为“40% 的愤怒”

七、结论:准,但不等于更聪明

Jev 的准来自三个约束:用 RLCD 训练出校准概率,把输出限制在结构安全范围内,把判断做成专门任务。

它不是来取代大模型的,而是来当大模型的“裁判”:大模型负责理解和生成,Jev 负责判断和打分。它的核心竞争力不是“更聪明”,而是“更快、更便宜、够用,并且给你一个敢用的置信度”。

数据集可视化效果可参见下方展示。 【数据集概况】 · 检测类别(中文):[反恐精英(ct), 反恐精英头部(ct head), 恐怖分子(t), 恐怖分子头部(t head)] · 训练集:2019 张 · 验证集:60 张 · 测试集:31 张 · 总计:2110 张 该数据集专注于游戏内城市战斗场景,通过高精度捕捉反恐精英与恐怖分子角色的动态特征,为虚拟环境中的目标检测提供了关键支持,显著提升了游戏AI系统的识别效率和决策能力。该数据集的训练集、验证集和测试集分布合理,训练集规模充足确保模型充分学习,验证集和测试集比例科学,有效保障了模型评估的准确性和可靠性。该数据集的标注质量卓越,所有目标边界框精准无误,类别标注规范统一,数据一致性高,为模型训练提供了高质量... 【训练曲线与评估图】 【模型训练配置】 参数 | 值 模型 | yolo26n 训练轮数 | 100 epochs 输入尺寸 | 640x640 批次大小 | 24 优化器 | auto 初始学习率 | 0.01 训练设备 【关键指标汇总】 训练了 43 个 epoch,最终轮指标: 指标 | 数值 mAP50 | **0.9380** mAP50-95 | 0.6258 Precision | 0.9515 Recall | 0.8803 train/box_loss | 1.0813 train/cls_loss | 0.4930 val/box_loss | 1.2288 val/cls_loss | 0.4671 【训练过程分析】 43 轮训练后 mAP50 达到 0.9380,模型收敛良好。Loss 曲线前段快速下降,后段趋于平稳,val_loss 无反弹,没有明显过拟合。但 mAP50-95 为 0.6258,和 mAP50 差距 0.31,定位精度仍有优化空间。 【模型性能评估】 Pre...
内容概要:本文档针对2026年华为杯研究生数学建模竞赛C题“服务于脑机接口与精神性疾病诊断的脑电图计算模型”,系统性地提供了从解题思路、算法实现到论文撰写的全流程支持资源。内容聚焦脑电信号(EEG)的数据预处理、特征提取、分类建模与结果分析,融合机器学习与深度学习技术(如SVM、CNN、LSTM、Transformer等),构建高精度的脑电识别模型,服务于抑郁症、癫痫等精神疾病的智能辅助诊断及脑机接口的信息解析。文档还整合了MATLAB与Python代码资源、模型实现案例及多领域科研技术支持体系,涵盖智能优化、信号处理、路径规划、通信优化等方向,并提供网盘资料下载与在线目录导航,强化理论与实践的深度融合; 适合人群:参加全国研究生数学建模竞赛的硕士、博士研究生,从事脑电信号处理、智能医学、生物信息学研究的科研人员,以及具备一定编程与数据分析基础、致力于人工智能在医疗健康领域应用的高校学生与青年学者; 使用场景及目标:① 快速掌握华为杯C题的技术路线与建模范式,高效完成竞赛备赛;② 构建面向临床辅助诊断的脑电计算模型,推动脑机接口与精神疾病识别的算法创新;③ 借助提供的开源代码与建模框架,开展科研复现、算法优化与学术论文写作; 阅读建议:建议结合文档提供的在线资源目录与百度网盘资料系统学习,优先精读脑电信号去噪、特征工程构建与深度学习模型选型部分,动手运行并调试代码,通过对比不同模型性能深化对算法适用性与工程实现细节的理解,同时关注跨学科方法的融合应用。
源码直接下载地址: https://pan.quark.cn/s/b2e30c4b4277 依据所提供的文件资料,可以总结出以下核心内容: 1. 华硕玩家国度x79 R4G主板属于高端级别的主板,归类于华硕玩家国度系列中的RAMPAGE IV GENE型号。该主板主要面向高端用户及游戏爱好者,具有卓越性能的特点。 2. 华硕玩家国度x79 R4G主板的使用指南采用简体中文版本,并以PDF格式发布。用户手册全面地阐述了该主板的操作方法和各项功能。 3. 版权声明明确指出,本手册包含的所有内容均受到著作权法的保护。未经华硕电脑股份有限公司(简称“华硕”)的许可,禁止进行任何形式的复制、剽窃、翻译或分发。 4. 免责声明具体说明,华硕提供的用户手册依照其发布时的状态呈现,不提供任何明示或暗示的保证。用户使用手册所面临的风险需自行承担,且华硕不对使用手册后的任何结果或信息的精确性或可靠性提供保证。 5. 用户手册中强调,使用本手册后可能引发的风险和损失,涵盖但不限于利益损失、业务中断、数据遗失或其他经济上的损失,华硕及其授权人员、雇员等均不承担相应责任。 6. 华硕拥有随时更新用户手册的权力。当产品规格或驱动程序发生变化时,用户手册将进行相应的修订。用户可以通过华硕的客户服务网站或直接联络华硕电脑客户关怀中心以获取最新版本的信息。 7. 第三方产品名称或内容的所有权和知识产权归属于各自的所有者,并受到相关法律法规的保护。 8. 在华硕的保修政策中,若产品经历过未经华硕授权的维修、规格调整、部件更换或其他未授权操作,或者产品序列号模糊不清或遗失,产品将不再享受华硕的保修和服务。 9. 华硕供应的主板及显卡产品在中国大陆地区(不包括港澳台地区)实施三年免费保修服务及全国联保服务...
代码下载链接: https://pan.quark.cn/s/a4b39357ea24 I2C(Inter-Integrated Circuit)总线是一种在电子设备中广泛应用的串行通信协议,该协议由Philips半导体(现名为NXP半导体)于上世纪80年代提出。I2C总线借助两条线路(时钟线SCL和数据线SDA)完成设备间的控制指令与数据信息的交换,因此它具备多主机与多从机的串行总线特性。在软件层面模拟I2C主从机交互时,常规的IO端口被用于再现I2C主机及从机的通信过程。 I2C总线引脚功能说明: 1. SCL(Serial Clock):时钟线,其时钟信号由主机掌控。 2. SDA(Serial Data):数据线,主要用于承载数据传输。 总线时序规范: - 非活动状态:当总线处于非通信阶段,SDA线保持高电平。 - 总线的线与操作:若多个设备同时接入总线,通过线与逻辑确保任一设备输出低电平,则总线整体呈现低电平状态。 - 数据位稳定性要求:数据位必须在SCL为高电平期间维持稳定状态,而只有在SCL为低电平期间方可发生改变。 - 起始与终止信号的定义:起始信号表现为在SCL高电平期间SDA从高电平转为低电平,终止信号则是在SCL高电平期间SDA从低电平转为高电平。起始信号标志着总线使用周期的起始,终止信号则表示总线使用周期的结束。 - 从机数据处理延时的处理机制:当从机需要额外时间处理数据时,能够将SCL线拉至低电平,促使主机进入等待状态。 - 字节传输与应答机制:一个字节由8位数据加上1位应答位构成。若从机无法应答或已无数据接收需求,将释放SDA线,主机随后产生终止信号。 - 数据帧结构:数据帧以从机地址作为起始,接着是数据传输方向指示位,最后是实际传输...
评论
成就一亿技术人!
拼手气红包6.0元
还能输入1000个字符
 
 条评论被折叠 查看
添加红包

请填写红包祝福语或标题

个

红包个数最小为10个

元

红包金额最低5元

当前余额3.43元 前往充值 >
需支付:10.00元
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付元
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值