Online Safety Monitoring for LLMs
LLMs的在线安全监控
专题命中 推理与问题求解 :LLM(summary_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 研究通过阈值化外部模型的验证信号并利用风险控制校准阈值,实现LLM输出的实时安全监控,在数学推理和红队测试中与高级方法性能相当。
Comments ICML 2026 Hypothesis Testing Workshop
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
LLMs的在线安全监控
专题命中 推理与问题求解 :LLM(summary_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 研究通过阈值化外部模型的验证信号并利用风险控制校准阈值,实现LLM输出的实时安全监控,在数学推理和红队测试中与高级方法性能相当。
Comments ICML 2026 Hypothesis Testing Workshop
教视觉-语言-动作模型看什么和看哪里
机构 * School of Electronic Information Engineering, Beihang University(北京航空航天大学电子信息工程学院) ; National College for Excellent Engineers, Beihang University(北京航空航天大学卓越工程师学院) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) ; DiDi(滴滴出行) ; State Key Laboratory of Media Convergence and Communication, Communication University of China(中国传媒大学媒体融合与传播国家重点实验室) ; School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) ; School of Cyber Science and Technology, Beihang University(北京航空航天大学网络安全科学与技术学院) ; School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)
专题命中 推理与问题求解 :SFT(abstract,abstract_cn);pretraining(abstract)
AI总结 提出DriveTeach-VLA框架,通过驾驶感知视觉蒸馏和2D轨迹引导提示,教VLA模型关注驾驶相关区域,实现端到端自动驾驶轨迹预测,在NAVSIM和nuScenes上达到最优性能。
Comments The paper has been accepted by ECCV 2026
迈向更好的Linux内核故障定位:利用对比推理和层次上下文分析
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);prompting(abstract)
AI总结 提出CoHiKer方法,通过对比推理分析测试用例行为差异,结合层次上下文分析从文件到方法逐级缩小定位范围,在Linux内核故障定位中Top-1准确率提升高达26.07%(文件级)和56.85%(方法级)。
CascadeOcc: 用级联VQ表示重新思考3D占用世界模型
机构 * Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract)
AI总结 提出CascadeOcc,一种通过级联向量量化机制在自回归框架中利用占用表示内在结构层次,实现从粗到细的3D场景预测和运动规划,在4D占用预测和运动规划基准上取得优越性能。
Comments Accepted to IEEE Signal Processing Letters (SPL), 2026
PointVG-R: 通过视觉思维链在多模态大语言模型中内化几何推理以实现精确指向定位
机构 * Tsinghua University(清华大学) ; Dalian University of Technology(大连理工大学) ; Northwestern Polytechnical University(西北工业大学) ; Wuhan University(武汉大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract)
AI总结 提出PointVG-R,通过强化学习和冷启动数据内化几何推理,结合视觉思维链数据集EgoPoint-CoT,在指向性视觉定位任务中实现mIoU提升15.86个点的SOTA性能。
有毒剧本:揭秘知识投毒对AI安全代理的影响
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);prompting(abstract)
AI总结 研究揭示通过RAG注入单条有毒安全知识可系统性改变AI安全代理行为,提出验证边界(VB)分类法,并评估验证提示与多源检索的防御效果。
VeriEvol:通过可验证的进化指令扩展多模态数学推理
机构 * Tsinghua University(清华大学) ; Tencent Hunyuan(腾讯混元)
专题命中 推理与问题求解 :SFT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 提出VeriEvol框架,通过类型感知进化模块生成更难的问题,并利用HTV-Agent验证器确保答案可靠性,从而在强化学习中扩展多模态数学推理数据,提升模型性能。
基于数字孪生表示的强化学习训练LLMs用于推理密集型手术视频问答
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract)
AI总结 提出强化学习框架,通过手术基础模型构建数字孪生表示,解耦视觉感知与推理,并引入分层表示与新型奖励,在三个基准上取得最优性能。
评估 Lean 4 中证明自动形式化的鲁棒性
机构 * University of California, Irvine(加州大学洛杉矶分校) ; University of California, Riverside(加州大学河滨分校)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 研究证明自动形式化模型在全局和局部扰动下的鲁棒性,发现现有模型对全局扰动敏感且多数无法忠实反映局部扰动。
Comments Preprint
SuperThoughts: 叠加中的推理令牌
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Microsoft Research(微软研究院) ; Independent(独立机构) ; Princeton University(普林斯顿大学) ; Rice University(莱斯大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 提出SuperThoughts方法,通过将连续CoT令牌对压缩为单一潜在表示并利用多令牌预测模块解码,在保持训练监督的同时将推理吞吐量翻倍,实现约20-30%的CoT长度缩减且精度损失极小。
面向物联网的语义多智能体入侵检测:零日与对抗威胁的风险感知推理
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)
AI总结 提出一种结合语义嵌入与多阶段概率决策融合的语义多智能体入侵检测系统,通过四个智能体协作实现零日攻击和对抗攻击的高效检测,在多个真实物联网数据集上达到95.9%检测准确率。
SocraticPO: 通过交互式指导进行策略优化
机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) ; iFLYTEK AI Research (Central China), iFLYTEK Co., Ltd(iFLYTEK中央中国AI研究院,iFLYTEK公司)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出SocraticPO框架,在强化学习中使用自然语言指导辅助推理,并通过奖励衰减防止模型依赖教师帮助,提升科学推理任务性能。
再思考:通过候选发现与比较推理进行分割
机构 * The Chinese University of Hong Kong(香港中文大学) ; Nanjing University(南京大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract)
AI总结 提出两阶段框架Rea2Seg,先基于注意力图生成候选掩码,再用多模态大语言模型推理评分,将分割转化为候选发现与判别选择,并引入新基准ReasonSeg-SGDR全面评估感知、定位与推理能力。
Comments Project page: https://snowball521.github.io/Rea2Seg-Project/
应变连贯性:编码代理执行轨迹中的故障前信号
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 提出“应变连贯性”模式,即编码代理识别到问题但仍按原计划行动,通过构建Claude Sonnet 4.6检测器在44条轨迹上实现94%故障预测精度,优于基线方法。
为什么将残差流限制在层而不是令牌?用于连续潜在推理的持久记忆
机构 * University of Cambridge(剑桥大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对CoCoNuT在潜在空间推理中因中间隐藏状态被覆盖导致概念瓶颈的问题,提出AGCLR模型,通过门控概念流持久记忆机制,在GSM8K、HotpotQA和ProsQA上取得一致提升。
中间DPAgent:针对AI诱导欺骗模式的代理防御与修复
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract)
AI总结 针对网络界面中的隐私欺骗模式,提出DPAgent框架,通过四个专门代理结合潜在空间净化与防御性提示,主动检测并修复欺骗性界面,检测率达90.98%,修复率77%。
Intern-S2-Mobius:知识与推理解耦的基础模型
机构 * Shanghai AI Laboratory(上海人工智能实验室)
专题命中 推理与问题求解 :foundation model(title);分类 cs.AI
AI总结 该研究提出知识与推理解耦的Mobius-v0架构,基于此构建的7B模型和Intern-S2-Mobius模型,分别在减少训练数据和提升推理速度的同时保持了相近的下游任务性能。
学习幅度而非方向:面向多轮多步骤大语言模型智能体的验证器约束信用分配
专题命中 推理与问题求解 :LLM(title);分类 cs.AI
AI总结 该研究提出CrEST分层信用分配框架,保留RL的验证器约束上限并结合自我教师的密集token级信号,在BFCL V3和WildToolBench上优于基线,可简化教师在策略优化中的作用。
从原始人到专家分析师:可变大语言模型任务的能耗
专题命中 推理与问题求解 :LLM(title);分类 cs.AI
AI总结 该研究测试四类高可塑性用户行为评估AI能耗减排潜力,发现非推理模型能耗仅为推理模型的二十分之一,简单提示修改可进一步降65%能耗,最佳实践可减4%-35%电力需求。
部分契约就足够了:可靠的、由大语言模型推断的回归验证
机构 * The University of Manchester(曼彻斯特大学)
专题命中 推理与问题求解 :LLM(title);分类 cs.AI
AI总结 研究软件回归验证难题,提出基于契约的工具,探讨部分契约的充分性,通过强化契约、自动推断等方法,实现可靠验证,在多方面取得良好效果,证明安全保留条件等价性。
Comments 12 pages
你构建框架:概念表征如何塑造大语言模型对反犹主义的检测与推理
机构 * Goethe University, Frankfurt(法兰克福歌德大学) ; HTW Berlin(柏林工业大学)
专题命中 推理与问题求解 :LLM(title);分类 cs.CL
AI总结 研究不同形式概念基础对四个先进大语言模型检测反犹主义及解释行为的影响,用两个专家注释数据集比较不同表征,发现细粒度分类表征能提高召回率但降低精度,还揭示了模型解释存在的局限。
空间视觉语言模型中的双路径推理强化
机构 * The University of Hong Kong(香港大学) ; NVIDIA(英伟达) ; University of California, San Diego(加州大学圣迭戈分校)
专题命中 推理与问题求解 :language model(title);分类 cs.AI
AI总结 提出SR-REAL框架,通过强化学习融合语言推理和3D检测推理两条路径,显著提升空间VLM在复杂几何推理任务中的性能。
RLVR中的多语言验证器偏差:基准、推理诊断与跨语言选择瓶颈
机构 * School of Engineering, Institute of Science Tokyo(科学东京大学工程学院) ; College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) ; Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程学院)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 研究发现多语言RLVR中存在验证器偏差,引入审计协议定位到最终答案接口的机制,提出跨语言选择瓶颈,rule-GRPO可提升可信准确率。
Comments 16 pages, 2 figures, 5 tables
超越模仿:通过推理进度过滤在线策略蒸馏
专题命中 推理与问题求解 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG
AI总结 针对在线策略蒸馏中教师奖励与真实推理进度不匹配的问题,提出R2-OPD方法,通过过滤冲突奖励提升推理性能,实现对标准OPD的改进。
评分需要评分标准,而非智能
机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)
专题命中 推理与问题求解 :language model(abstract);small language model(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出any-to-bench设计原则,证实小型语言模型依据明确评分标准评分的可靠性与高成本模型相当,评分标准中的官方答案是关键,可将评分与评分者智能解耦。
BEAR-Bench:面向多模态模型的双语企业与学术推理基准
机构 * Yandex Applied AI Institute(Yandex应用人工智能研究院)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文针对多模态大语言模型在文本密集专业文档推理能力评估的不足,推出英俄双语的BEAR-Bench基准,评估16个多模态大语言模型并对比幻觉检测方法,发现最强模型仍有明显性能提升空间。
更好的分解,自由聚合:面向多语言多跳问答的合成器折叠框架
机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) ; Kunming University of Science and Technology(昆明理工大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 针对多语言多跳问答中现有方法的翻译噪声与错误放大问题,提出Syfer框架,通过推迟翻译、格式受限分解与质量检查实现性能与成本的良好平衡。
Comments Accepted by NLPCC 2026
从原子证据到逻辑组合:针对复合答案选项的结构化组合推理
机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对大型语言模型处理复合逻辑答案选项时的失败问题,提出了一种分解原子判断并结合整数线性规划的框架,在LOGICAL-COMMONSENSEQA和LOGICAL-SATA基准上显著提升了宏F1指标。
Comments 21 pages, 6 figures, 10 tables
FaithformBench:数学链式思维自动形式化的忠实性基准测试
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文提出新基准FaithformBench,通过自动生成扰动推理步骤评估AF系统的忠实性,发现多数AF存在“悄悄修正”无效输入的谄媚现象,当前AF在有效性与无效性保留间存在张力。
通过非局部性测量SAE特征的语义抽象性
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 该研究提出特征非局部性(FNL)指标,可区分SAE特征的抽象层级,用于审计越狱缓解特征及引导DeepSeek-R1模型特征提升数学推理准确率。
Comments 18 pages, 9 figures