The Knowing-Saying Gap: When Probes See Errors that Confidence Misses
知-言差距:当探测模型发现错误而置信度未察觉时
专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究发现线性探测模型能精准检测语言模型的上下文破坏,但无法可靠预测最终答案正确性,推翻了相关假设,表明基于探测模型的监控需结合模型与错误类型的路由策略。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
知-言差距:当探测模型发现错误而置信度未察觉时
专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究发现线性探测模型能精准检测语言模型的上下文破坏,但无法可靠预测最终答案正确性,推翻了相关假设,表明基于探测模型的监控需结合模型与错误类型的路由策略。
如何构建马库斯的代数思维:从明斯基的情感机器视角出发
专题命中 推理与问题求解 :large language model(abstract);language model(abstract)
AI总结 本文从明斯基的《情感机器》视角解读VaCoAl架构,探讨如何构建马库斯的代数思维。通过精确可逆性实现内省,将思考分三层,还承载泛类比和信用分配观点,有助于提升到内省层次并找到交叉点,为构建代数思维提供新视角。
Comments 19 pages
可解码但不忠实:将自然语言理由与程序化验证器耦合
机构 * AI4Math
专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出验证器耦合推理框架,通过一致性训练使验证器信息可从理由表示中解码,但发现可解码性不保证忠实生成,在多个任务中验证了该差距。
Comments Accepted to the ICML 2026 AI4Math Workshop as a poster
REMAC:用于长时程机器人操作的自反思与自进化多智能体协作框架
专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出REMAC自适应多智能体规划框架,通过自反思与自进化实现多机器人长时程任务规划,在RoboCasa基准测试中使任务平均成功率提升40%、执行效率提升52.7%。
Comments 24 pages, 8 figures
激活探针:挖掘模型输出遗漏的表面代码安全信号
专题命中 推理与问题求解 :prompting(abstract);分类 cs.LG
AI总结 本研究提出用线性探针分析开源审查器模型的激活值,发现其携带了仅通过模型提示无法获取的代码安全信号,可有效区分有漏洞与修复后的函数。
Comments 6 pages, 1 figure. Accepted at the TAIGR workshop, ICML 2026
全带宽Transformer
机构 * Johns Hopkins University(约翰斯·霍普金斯大学) ; Princeton University(普林斯顿大学) ; Microsoft(微软公司)
专题命中 推理与问题求解 :pretraining(abstract);分类 cs.AI
AI总结 该研究提出全带宽Transformer,通过潜在反馈拓宽解码步骤间的垂直反馈通道,经训练验证其在多项任务上性能提升,且解码开销可忽略。
面向工具增强空间推理的自演化神经符号技能
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI
AI总结 该研究针对视觉-语言模型在细粒度空间任务上的不可靠问题,提出神经符号框架NeSy-Spatial,通过自演化空间技能提升工具利用精度与空间推理准确率。
Comments 25 pages, 9 figures, 10 tables; includes supplementary material
广泛推理,而非深度推理:将推理溢价分摊到提炼技能中
机构 * Microsoft(微软公司)
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI
AI总结 该研究提出将推理模式的重复分摊为跨任务提炼的技能,在四个智能体基准上大幅降低代币量的同时恢复多数推理性能,部分场景下优于推理模式。
Comments COLM 2026 Efficient Reasoning Workshop
QuantumMind:面向量子计算加速分析的基于约束的智能体推理框架
专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI
AI总结 QuantumMind是用于量子加速分析的可审计智能体工作流,经582个任务评估,其ODS等指标优于基线,可有效提升量子加速假设筛选的准确性与效率。
协作多智能体脚本生成以增强谋杀谜游戏中的不完全信息推理
机构 * Sun Yat-sen University(中山大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI
AI总结 本文提出协作多智能体框架,通过生成丰富多模态上下文提升VLMs在叙事推理和欺骗鲁棒性中的表现,解决多玩家游戏中不完全信息下的复杂推理问题。
Comments 9 pages, 5 figures, Findings of ACL 2026
SciTaRC:基于科学表格数据的问答基准测试,需语言推理与复杂计算
机构 * Center for Language and Speech Processing(语言与语音处理中心) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 推理与问题求解 :language model(abstract);分类 cs.CL
AI总结 SciTaRC是一个针对科学表格数据的问答基准测试,揭示了现有AI模型在语言推理和复杂计算任务上的不足。
Comments COLM 2026 (Conference on Language Modeling). Camera-ready version
专题命中 推理与问题求解 :language model(abstract);分类 cs.AI
Journal ref Pattern Recognition 172 (2026) 112348
用工具思考,而非用像素思考:工具调用作为视觉推理的文本支架
机构 * Hong Kong University of Science and Technology(香港科技大学) ; The Chinese University of Hong Kong(香港中文大学) ; Ant Group(蚂蚁集团) ; Zhejiang University(浙江大学)
专题命中 推理与问题求解 :language model(abstract)
AI总结 该研究提出工具调用支架假设,引入TextCall方法验证返回图像冗余,仅用结构化文本支架即可实现视觉推理,降低延迟并消除工具API调用,结论适用于现有相关基准。
DH-VLM:面向自动驾驶的双时域协同隐层推理框架
机构 * Tsinghua University(清华大学)
专题命中 推理与问题求解 :language model(abstract)
AI总结 本文提出DH-VLM双时域协同隐层推理框架,结合基础设施与自车实现非对称语义协同,构建协同QA数据集支撑推理,在规划性能、通信成本等指标上优于现有方法,为协同自动驾驶提供实用鲁棒范式。
PhysX-CoT:从单张图像生成可用于仿真的3D资产的结构化物理推理
机构 * Space Engineering University(航天工程大学)
专题命中 推理与问题求解 :language model(abstract)
AI总结 PhysX-CoT将单张图像生成仿真3D资产视为显式结构化物理推理过程,通过分解部件级状态轨迹优化相关指标,在多方面优于基线,生成资产在Unreal Engine 5中表现良好。
BRUCE:面向科学视觉-语言推理的污染升级下鲁棒性基准测试
机构 * New York University Abu Dhabi(纽约大学阿布扎比分校)
专题命中 推理与问题求解 :language model(abstract)
AI总结 该研究提出BRUCE基准测试框架,通过RCI与T-RCI指标分析VLMs在科学视觉-语言推理任务中随污染升级的鲁棒性退化,实现可解释的失败分析。
利用年际一致的历史预测作为免费输入模态的多年地理空间推理
机构 * VITO Remote Sensing(VITO遥感公司)
专题命中 推理与问题求解 :foundation model(abstract)
AI总结 该研究将过往预测和BVL掩码纳入模型,提出CTY嵌入编码器,在540万像素的泛欧数据集上使作物F1提升,纠正召回偏差,为地理空间模型提供低成本方案。
Comments 17 pages, 7 figures Updated abstract to match with arxiv submission
RoboAtlas:上下文感知主动SLAM
机构 * Mitsubishi Electric Research Laboratories(三菱电机研究实验室) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 推理与问题求解 :foundation model(abstract)
AI总结 提出RoboAtlas框架,通过上下文感知的多臂赌博机平衡几何探索与语义推理,结合3D语义地图OpenRoboVox,在真实环境中实现100%任务成功率,并在GOAT-Bench上以90.6%成功率达到SOTA。
Comments Alexander Schperberg and Shivam K. Panda made equal contribution
用于3D手部重建的可负担性引导扩散先验
专题命中 推理与问题求解 :language model(abstract)
AI总结 研究在手部大量被遮挡时3D手部姿势重建问题;核心方法是用基于扩散的生成模型,由视觉语言模型推断的可负担性描述引导;主要贡献是显著提升手部姿势估计准确性,优于现有方法。
Comments Accepted to ECCV 2026. Project page: https://narusuzuki.github.io/projects/26-affhandgen/
大型语言模型如何评判社交吸引力?来自跨多个LLM与人类的基于理论的人格特质评分的证据
专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 本文探究LLMs能否评估社交吸引力,经三项研究发现,34个LLM评分稳定且与人类排序一致,但LLMs对吸引力与无吸引力档案的评分偏差更大,且两者均无性别呈现的显著整体效应。
Comments 9 pages, 2 figures, 2 tables. Includes technical supplement
如何向AI提问:大型语言模型提示工程的用户视角调查
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract,abstract_cn)
AI总结 该研究从用户视角开展大型语言模型提示工程调查,提出提示有效性评估策略、应用工作流并维护开源项目,为用户制定适配场景的有效提示提供可操作指南。
Comments Accepted to TAI
WuYuEval:面向固体废物管理的大语言模型多级基准测试
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);foundation model(abstract)
AI总结 WuYuEval是面向固体废物管理的多级基准测试,含基础与专家模块,评估33个LLM的SWM能力,发现其在专业任务表现差,为开发专用基础模型提供依据。
FinTrace: LLM工具调用在长周期金融任务中的轨迹级综合评估
机构 * Stevens Institute of Technology(斯蒂文斯理工学院) ; Independent Researcher(独立研究者) ; The FinAI(FinAI) ; Duke University(杜克大学)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 本文提出FinTrace基准,通过800个专家标注的轨迹评估LLM工具调用,揭示模型在信息利用和最终答案质量上的不足,并通过FinTrace-Training数据集提升中间推理能力,但最终答案质量仍受限。
从价值到基准:评估用于荷兰政府场景的大型语言模型
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究推出面向荷兰政府场景的“Grip on LLMs”评估框架,确定六大评估维度,发现模型在质量、成本、能耗等维度存在权衡,发布模型概览供政府LLM选择使用。
Comments Accepted at AIES 2026
CORDA:面向大语言模型的以伤害为核心的分层道德推理基准
机构 * University of the Witwatersrand(威特沃特斯兰德大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 研究提出CORDA基准,评估大语言模型的以伤害为核心的分层道德推理,发现多数模型优先避免直接个人伤害,部分模型无法遵循指定优先级,该基准填补了LLM道德评估的核心空白。
Comments 8 pages, 6 figures. Accepted at the Fourth International Workshop on Value Engineering in AI (VALE 2026), affiliated with IJCAI-ECAI 2026
验证驱动的闭环多智能体大语言模型框架:面向符合代码规范的结构设计
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 本研究提出验证驱动的闭环多智能体LLM框架,通过耦合有限元验证系统与双节点结构提升结构设计的代码合规性,开源基准与脚本,性能提升显著且具可复现性。
Comments 20 pages, 21 figures
一种智能体AI框架克服了大型语言模型在眼底照相青光眼检测中的基本局限
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 该研究开发的智能体AI框架整合LLM与专用深度学习工具,提升了眼底照相青光眼检测的准确率、一致性,纠正了仅用LLM的缺陷,具有通用性,或推动医学AI向多智能体系统转变。
准确集成,脆弱叙事:多尺度堆叠与LLM生成信用风险解释的保真度审计
专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);prompting(abstract);分类 cs.CL、cs.LG
AI总结 本研究构建多尺度堆叠集成预测模型并测试LLM生成信用风险解释的保真度,发现预测性能提升有限,LLM生成的解释存在事实错误,需对生成解释进行验证。
Comments 13 pages, 9 figures, 5 tables
基于任务感知多阶段大语言模型(LLM)模拟来访者的动机访谈咨询师评估
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文针对动机访谈的关键唤起任务,提出Evoke-Sim任务感知多阶段LLM模拟来访者框架,用于戒烟场景下MI咨询师评估,其评估效果优于现有模拟来访者,为相关评估设定了更高标准。
Comments 53 pages
自动化欺骗:可扩展的多轮LLM欺骗攻击
机构 * California Institute of Technology(加州理工学院) ; Evergreen Valley College(埃弗格林谷学院)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出自动化生成多轮LLM欺骗数据集的方法,揭示GPT家族模型在对话历史中的脆弱性,而Gemini 2.5 Flash则表现出极强的抗性。