UniCode: Augmenting Evaluation for Code Reasoning
UniCode: 增强代码推理的评估
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 UniCode通过多维增强和自动化测试生成框架,揭示了大语言模型在代码推理中的性能下降问题,强调模型对捷径的依赖而非真正的推理能力。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
UniCode: 增强代码推理的评估
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 UniCode通过多维增强和自动化测试生成框架,揭示了大语言模型在代码推理中的性能下降问题,强调模型对捷径的依赖而非真正的推理能力。
空间思考者:通过密集奖励强化场景图基础的空间推理
机构 * University of Oxford(牛津大学) ; University of California, Santa Cruz(加州大学圣克鲁兹分校)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对多模态大语言模型空间推理难题,提出SpatialThinker,通过在线强化学习统一场景图生成与视觉推理,构建心理场景图并借助密集奖励推理,贡献包括基于SGG推理、高质量训练数据集及密集奖励设计。
Comments Preprint. Accepted at NeurIPS 2025 Workshops on SPACE in Vision, Language, and Embodied AI (SpaVLE) as Oral, Embodied World Models for Decision Making (EWM), Aligning Reinforcement Learning Experimentalists and Theorists (ARLET), and Scaling Environments for Agents (SEA)
OmniTQA:一种面向半结构化数据的混合查询处理成本感知系统
专题命中 推理与问题求解 :LLM(summary_cn,abstract)
AI总结 OmniTQA通过整合LLM语义操作与传统关系运算符,提出了一种成本感知的混合查询处理框架,有效处理结构化与半结构化数据,提升复杂查询和大规模表的准确性和效率。
Wiki-R1: 通过数据和采样课程激励基于知识的多模态推理用于VQA
机构 * ShanghaiTech University(上海科技大学) ; Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程研究中心) ; Lingang Laboratory(临港实验室)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);pretraining(abstract);post-training(abstract)
AI总结 提出Wiki-R1框架,通过可控课程数据生成和课程采样策略,结合强化学习激励MLLMs在KB-VQA中的推理能力,在Encyclopedic VQA和InfoSeek上取得新SOTA。
Comments Accepted by ICLR 26, code and weights are publicly available
TopBench:表格问答中隐式预测推理的基准
机构 * School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学,中国) ; National Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国)
专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出TopBench基准,包含779个样本和四个子任务,评估大语言模型在表格问答中识别隐式预测意图并进行可靠推理的能力,发现当前模型在意图识别上存在困难。
EngTrace:工程推理可验证过程监督的符号基准
机构 * Namal University(纳马尔大学) ; MBZUAI(马克斯·普朗克智能人工智能研究所) ; The University of Tokyo(东京大学)
专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出EngTrace符号基准,包含1350个参数化测试用例,通过两阶段可验证评估框架(分层协议+AI仲裁)检验中间推理轨迹与最终答案,揭示数值精度与轨迹保真度的权衡。
Comments 33 pages, includes figures and tables; introduces the EngTrace benchmark
超越分块与图:基于三元组驱动的检索增强生成
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出T$^2$RAG框架,利用三元组知识库和迭代检索,在六数据集上平均性能提升11%,检索成本降低45%。
Comments ACL 2026 Findings
通过分步置信度归因诊断黑盒大语言模型的多步推理失败
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出了一种基于分步置信度归因(SCA)的方法,用于诊断黑盒大语言模型在多步推理中的失败,通过信息瓶颈原理对生成的推理轨迹进行置信度评估,并通过实验验证该方法在数学推理和多跳问答任务中的有效性。
Comments Accepted by ICML 2026
延迟、平台期或崩溃:评估系统性验证错误对RLVR的影响
专题命中 推理与问题求解 :LLM(abstract_cn,comments);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本研究探究系统性验证错误对RLVR的影响,发现系统性误报会引发次优平台期或性能崩溃,验证器质量需结合错误模式而非仅样本级错误率评估。
Comments COLM 2026. Code: https://github.com/eth-sri/llm-verifier-noise
面向大语言模型生成的GPU内核的契约级验证器,以及门控线性循环(GDN)族的原生Blackward反向传播算法
机构 * E3A Healthcare(E3A医疗公司)
专题命中 推理与问题求解 :LLM(title);language model(abstract);分类 cs.LG
AI总结 本文提出契约级GPU内核验证器,发现公开系统接受的2638个机器生成内核中39.5%存在无法修复的错误,还构建了GDN族的原生Blackwell反向传播算法,指出现有内核生成正确性信号被高估。
Comments 20 pages, 3 figures. Also archived at doi:10.5281/zenodo.21563213
面向机器人操作的视觉提示:采用带标注引导的拾取与放置方法,基于ACT算法
机构 * Embodied AI Research Team(具身人工智能研究团队) ; National Institute of AIST(国家信息与系统技术研究所)
专题命中 推理与问题求解 :prompting(title,abstract);分类 cs.AI
AI总结 针对便利店机器人拾取放置任务的挑战,提出带标注引导视觉提示的感知-行动流水线,采用ACT算法实现自适应操作,提升了零售环境下的抓取精度与适应性。
想象感知标记增强多模态语言模型的空间推理能力
机构 * University of Washington(华盛顿大学) ; Allen Institute for AI(Allen人工智能研究所) ; Microsoft(微软) ; OpenAI(开放人工智能研究院)
专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI
AI总结 提出想象感知标记(IPT)作为中间感知表征,通过监督学习提升多模态语言模型在不可见视角推理、遮挡路径追踪等空间推理任务上的性能,在三个新构建的数据集上优于文本思维链训练。
视觉语言模型(VLMs)无法规划,但它们能进行形式化吗?
机构 * Drexel University(德雷塞尔大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL
AI总结 本研究提出5种VLM作为形式化器的流水线,评估后发现其表现优于端到端规划生成,较弱VLMs的瓶颈为物体关系视觉grounding,较强模型已克服该限制。
理解并缓解过早自信以提升大语言模型推理能力
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Tsinghua University(清华大学)
专题命中 推理与问题求解 :LLM(title);language model(abstract);分类 cs.AI
AI总结 针对大语言模型长思维链中逻辑跳跃和过早自信问题,提出渐进式自信塑造强化学习目标,无需外部标签或奖励模型,通过奖励逐步自信增长并惩罚过早承诺,显著提升推理准确性和质量。
智能基础模型:一种新视角来实现通用人工智能
机构 * Hangzhou International Innovation Institute, Beihang University, China(北京航空航天大学杭州国际创新研究院) ; Victoria University, Melbourne, Australia(墨尔本维多利亚大学)
专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.AI
AI总结 本文提出智能基础模型,通过模拟生物神经系统的动态过程和神经元输出预测,为实现通用人工智能提供新的视角和方法。
BOW:训练语言模型对合理的下一个单词进行推理
机构 * Arizona State University(亚利桑那州立大学)
专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL
AI总结 BOW是一种RL框架,通过训练语言模型生成合理下一个单词空间的全面描述,在10个推理基准上表现优于部分基线,BOW-Reg还能提升SharedRef正确率并降低单义崩溃。
MVHOI: 通过3D基础模型桥接多视角条件与复杂人-物体交互视频重现
专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.AI
AI总结 本文提出MVHOI框架,通过3D基础模型结合多视角参考条件,生成复杂人-物体交互视频,提升了长时视频生成的性能。
Comments Project page: https://mvhoi.hirotong.fun
步级视觉 grounding 信念预测长视界视觉语言模型的分布外泛化
机构 * The KOW Company(KOW公司) ; University of Dhaka(达卡大学) ; American International University - Bangladesh (AIUB)(孟加拉国美国国际大学)
专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI
AI总结 研究发现长视界视觉语言模型中,步级视觉接地信念预测分布外泛化能力,揭示了模型中间推理与视觉状态的一致性对鲁棒性的影响。
Comments Following the initial submission, we conducted additional experiments that materially changed our understanding of the problem. These new results do not support the central claim of the current manuscript. To avoid disseminating conclusions that we no longer consider adequately supported, we are withdrawing this version while we reassess the findings and prepare a substantially revised manuscript
基于最大可满足性的反馈在数独中引导视觉语言模型
机构 * Artificial Intelligence Research Institute (IIIA), Consejo Superior de Investigaciones Científicas (CSIC)(人工智能研究所(IIIA),西班牙科学研究高级理事会(CSIC)) ; Institut de Robòtica i Informàtica Industrial (IRI-CSIC-UPC)(工业机器人与信息学研究所(IRI-CSIC-UPC))
专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI
AI总结 研究在数独中引导视觉语言模型的问题,提出通过MaxSAT预言机将形式约束推理集成到VLM求解过程的神经符号方法,经实验验证该方法能提高逻辑一致性和解决实例数量,增强视觉语言推理可靠性。
Comments Accepted at the 25th EPIA Conference on Artificial Intelligence, EPIA 2026. 16 pages, 1 figure, and 1 table
ABot-N1:迈向通用视觉语言导航基础模型
专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.AI
AI总结 研究旨在构建通用视觉语言导航基础模型,针对当前方法问题,提出ABot-N1,通过慢-快架构解耦认知与控制,利用双视觉语言信号,实现跨场景稳健、可推广且可解释的导航,在城市规模导航等任务中表现出色并开源新基准。
超越反应性:衡量大语言模型智能体中的主动解决问题能力
专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI
AI总结 研究旨在衡量大语言模型智能体的主动解决问题能力。提出PROBE方法,将主动性分解为三个核心能力。应用该方法评估领先模型和框架,发现即使最先进的模型表现也不佳,GPT-5和Claude Opus-4.1最佳端到端性能为40%,突出局限并揭示未来研究方向。
LWDrive: 基于逐层世界模型的视觉-语言模型自动驾驶规划
机构 * Chongqing University(重庆大学)
专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI
AI总结 提出LWDrive框架,通过逐层世界模型引导,将VLM输出的粗轨迹逐步细化为几何精确、多视角感知的规划轨迹,在NAVSIM基准上取得92.0分。
视觉-语言模型缺少什么?探究它们在因果顺序推理中的困难
机构 * University of Southern California(南加州大学) ; University of California, Santa Barbara(加州大学圣芭芭拉分校) ; Texas A&M University(德克萨斯A&M大学)
专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL
AI总结 针对VLM在因果推理中的不足,提出VQA-Causal和VCR-Causal基准,发现模型在因果任务上仅略优于随机猜测,归因于训练数据缺乏因果表达,并通过难负例微调改善。
Comments 13 pages
缓解多图像理解中大型视觉语言模型的跨图像信息泄露
机构 * Sogang University(ソガン大学) ; Princeton University(普林斯顿大学) ; NAVER AI Lab(NAVER AI实验室)
专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI
AI总结 针对大型视觉语言模型在多图像输入时性能下降的问题,提出无需训练且架构无关的FOCUS方法,通过随机噪声掩码和噪声参考输入抑制跨图像信息泄露,显著提升多图像和视频理解性能。
Comments Source code is available at https://github.com/yejipark-m/FOCUS
GEASS: 基于证据适应的门控选择性描述信任机制用于视觉-语言模型
机构 * University of International Relations(国际关系大学)
专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI
AI总结 本文提出GEASS,一种无需训练的模块,通过门控、加权和证据标准来决定模型在每个查询中消耗多少描述信息,从而提升视觉-语言模型的准确性。
Comments 18 pages, 12 figures
GeoWorld-VLM:从世界模型中获取几何结构用于视觉-语言模型
机构 * Harvard AI and Robotics Lab(哈佛人工智能与机器人实验室) ; Kempner Institute for the Study of Natural and Artificial Intelligence(凯普纳自然与人工智能研究 institute) ; Harvard University(哈佛大学)
专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI
AI总结 GeoWorld-VLM通过将冻结的摄像机条件视频世界模型的几何结构转移到视觉-语言模型中,提升空间关系推理能力,实验显示在两个不同架构上均提升了约4%的性能。
正确预测,误导性解释:关于视觉-语言模型解释的脆弱性
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 推理与问题求解 :language model(title,abstract);分类 cs.LG
AI总结 研究探讨了视觉-语言模型中解释热图在对抗条件下是否忠实反映推理过程,提出X-Shift攻击揭示解释与预测行为的脱节,验证了解释机制的脆弱性。
Comments Accepted at the ICML 2026 Workshop on Trustworthy AI for Good (AI4GOOD), Seoul, South Korea
AgentPLM:具有推理增强解码的智能体蛋白质语言模型用于蛋白质序列设计
机构 * Sahil Rahman ; Maxx Richard Rahman
专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI
AI总结 提出AgentPLM,通过推理增强解码和对比智能体策略优化,使预训练蛋白质语言模型能够利用外部生物物理反馈进行在线纠错,在多项蛋白质设计任务上取得最优结果。
Journal ref Workshop on Generative and Agentic AI for Biology, 43rd International Conference on Machine Learning (ICML 2026)
不确定性作为规划信号:面向目标导向对话的多轮决策
机构 * The Ohio State University(俄亥俄州立大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出CUP框架,通过结合语言模型与结构化规划,解决目标导向对话中不确定性与信息获取之间的平衡问题,提升对话成功率并减少交互轮次。
Comments COLM 2026
欧几里得-MCP:一个通过Prolog进行确定性逻辑推理的模型上下文协议服务器
专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究针对大型语言模型多步逻辑推理不可靠问题,提出开源的欧几里得-MCP服务器,通过引入欧几里得-IR及支持特定循环的工具接口实现确定性逻辑推理,经评估在处理大问题时效果优于LLMs,可作稳定推理基础。