arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-06 至 2026-02-06 共收录 82 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 20 篇

2510.25634 2026-02-06 cs.RO cs.AI 57%

Learning to Plan & Schedule with Reinforcement-Learned Bimanual Robot Skills

学习计划与调度的强化学习双臂机器人技能

Weikang Wan, Fabio Ramos, Xuning Yang, Caelan Garrett

机构 * NVIDIA University of California San Diego(加州大学圣地亚哥分校)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出了一种基于强化学习的双臂机器人技能计划与调度框架,通过分层结构提升复杂任务的执行效率与协调性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05240 2026-02-06 cs.AI 57%

Explainable AI: A Combined XAI Framework for Explaining Brain Tumour Detection Models

可解释AI:一种结合XAI框架用于解释脑肿瘤检测模型

Patrick McGonagle, William Farrelly, Kevin Curran

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种结合GRAD-CAM、LRP和SHAP的XAI框架,用于提升脑肿瘤检测模型的可解释性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05105 2026-02-06 cs.AI cs.RO cs.SE 57%

GAMMS: Graph based Adversarial Multiagent Modeling Simulator

基于图的对抗多智能体建模模拟器

Rohan Patil, Jai Malegaonkar, Xiao Jiang, Andre Dion, Gaurav S. Sukhatme, Henrik I. Christensen

机构 * University of Southern California(美国南加州大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 GAMMS是一款轻量级多智能体仿真框架,支持图结构环境下的快速开发与评估,提供可视化反馈和现实基础,适用于复杂领域如交通和通信系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05446 2026-02-06 cs.HC 50%

DiLLS: Interactive Diagnosis of LLM-based Multi-agent Systems via Layered Summary of Agent Behaviors

通过代理行为分层总结实现基于大语言模型的多代理系统交互诊断:DiLLS

Rui Sheng, Yukun Yang, Chuhan Shi, Yanna Lin, Zixin Chen, Huamin Qu, Furui Cheng

专题命中 规划推理 :planning(abstract)

AI总结 DiLLS通过多层行为总结,帮助开发者更高效地诊断和理解基于LLM的多代理系统故障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04992 2026-02-06 cs.HC cs.RO 50%

Applying Ground Robot Fleets in Urban Search: Understanding Professionals' Operational Challenges and Design Opportunities

在城市搜索中应用地面机器人队伍:理解专业人员的操作挑战与设计机会

Puqi Zhou, Charles R. Twardy, Cynthia Lum, Myeong Lee, David J. Porfirio, Michael R. Hieb, Chris Thomas, Xuesu Xiao, Sungsoo Ray Hong

机构 * George Mason University(乔治·马歇尔大学) Virginia Tech(弗吉尼亚理工学院)

专题命中 规划推理 :planning(abstract)

AI总结 本文探讨了在城市搜索中应用地面机器人队伍对公共安全专业人员操作挑战的影响,提出了减轻认知和体力负担的设计机会。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04972 2026-02-06 cs.CY 50%

Learning Context Matters: Measuring and Diagnosing Personalization Gaps in LLM-Based Instructional Design

学习上下文很重要:在基于LLM的教学设计中测量和诊断个性化差距

Johaun Hatchett, Debshila Basu Mallick, Brittany C. Bradford, Richard G. Baraniuk

专题命中 规划推理 :planning(abstract)

AI总结 本文提出了一种框架,用于测量和诊断学习上下文对基于LLM教学系统的影响,发现提供学习上下文能改善LLM的教学策略,但尚未实现可靠的个性化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02648 2026-02-06 eess.SY cs.CY cs.GT cs.MA cs.SI cs.SY 50%

Steering the Herd: A Framework for LLM-based Control of Social Learning

引导 herd:一种基于 LLM 的社会学习控制框架

Raghu Arghal, Kevin He, Shirin Saeedi Bidokhti, Saswati Sarkar

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出了一种基于 LLM 的社会学习控制框架,研究信息中介如何通过动态规划和贝叶斯更新影响社会福利和群体行为。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 4 篇

2602.05789 2026-02-06 cs.CV cs.AI 79%

Allocentric Perceiver: Disentangling Allocentric Reasoning from Egocentric Visual Priors via Frame Instantiation

非自体参照感知器:通过帧实例化解耦非自体参照推理与自体参照视觉先验

Hengyi Wang, Ruiqiang Zhang, Chang Liu, Guanjie Wang, Zehua Ma, Han Fang, Weiming Zhang

机构 * Anhui Province Key Laboratory of Digital Security, University of Science(安徽数字安全重点实验室,科学大学) National University of Singapore(新加坡国立大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 非自体参照感知器通过帧实例化解耦非自体参照推理与自体参照视觉先验,提升空间推理任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05382 2026-02-06 cs.CV cs.LG 79%

VRIQ: Benchmarking and Analyzing Visual-Reasoning IQ of VLMs

VRIQ:评估和分析视觉推理IQ的VLMs基准测试

Tina Khezresmaeilzadeh, Jike Zhong, Konstantinos Psounis

机构 * University of Southern California, Los Angeles, USA(美国南加州大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.LG

AI总结 VRIQ基准测试评估了VLMs的视觉推理能力,发现其在抽象推理任务中表现薄弱,主要源于感知限制,提出细粒度诊断方法以改进多模态系统中的视觉推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08194 2026-02-06 cs.CV 78%

GIQ: Benchmarking 3D Geometric Reasoning of Vision Foundation Models with Simulated and Real Polyhedra

GIQ:基于模拟和真实多面体的3D几何推理视觉基础模型基准测试

Mateusz Michalkiewicz, Anekha Sokhal, Tadeusz Michalkiewicz, Piotr Pawlikowski, Mahsa Baktashmotlagh, Varun Jampani, Guha Balakrishnan

机构 * Rice University(里士大学) The University of Queensland(昆士兰大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 GIQ通过模拟和真实多面体评估视觉基础模型的3D几何推理能力,揭示了现有模型在几何理解上的不足。

Comments Accepted to ICLR 2026. Camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22936 2026-02-06 cs.CV 50%

PPE: Positional Preservation Embedding for Token Compression in Multimodal Large Language Models

PPE:用于多模态大语言模型中token压缩的位置保持嵌入

Mouxiao Huang, Borui Jiang, Dehua Zheng, Hailin Hu, Kai Han, Xinghao Chen

机构 * Huawei Technologies(华为技术有限公司)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 PPE通过保持位置信息提升多模态大语言模型的token压缩效率和性能

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 6 篇

2602.05805 2026-02-06 cs.AI 83%

NEX: Neuron Explore-Exploit Scoring for Label-Free Chain-of-Thought Selection and Model Ranking

NEX: 无标签的神经元探索-利用评分用于无标签的思维链选择和模型排名

Kang Chen, Zhuoka Feng, Sihan Zhao, Kai Xiong, Junjie Nian, Yaoning Wang, Changyi Xiao, Yixin Cao

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 测试时计算 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 NEX通过神经元活动信号实现无标签的思维链选择和模型排名,通过探索与利用的交替阶段提升预测准确性。

Comments 21 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05539 2026-02-06 cs.LG cs.AI cs.CL 82%

Steering Large Reasoning Models towards Concise Reasoning via Flow Matching

通过流匹配引导大型推理模型实现紧凑推理

Yawei Li, Benjamin Bergner, Yinghan Zhao, Vihang Prakash Patil, Bei Chen, Cheng Wang

机构 * LMU Munich(慕尼黑莱茵河大学) Amazon(亚马逊)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过流匹配引导大型推理模型实现紧凑推理,提出非线性引导方法提升推理效率和任务性能。

Comments This paper has been accepted to Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13342 2026-02-06 cs.AI cs.CL cs.LG 75%

Verifying the Verifiers: Unveiling Pitfalls and Potentials in Fact Verifiers

验证验证者:揭示事实验证器中的陷阱与潜力

Wooseok Seo, Seungju Han, Jaehun Jung, Benjamin Newman, Seungwon Lim, Seungbeen Lee, Ximing Lu, Yejin Choi, Youngjae Yu

机构 * Yonsei University(延世大学) Stanford University(斯坦福大学) University of Washington(华盛顿大学) Seoul National University(首尔国立大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究评估了多种大语言模型和事实验证器,揭示了数据标注问题、前沿模型性能及小型验证器的改进潜力。

Comments Accepted to COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05570 2026-02-06 cs.AI 70%

TangramSR: Can Vision-Language Models Reason in Continuous Geometric Space?

TangramSR: 视觉-语言模型能否在连续几何空间中推理?

Yikun Zong, Cheston Tan

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 TangramSR通过测试时自我改进框架,结合上下文学习和奖励循环,提升视觉-语言模型在连续几何空间中的推理能力。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20295 2026-02-06 cs.CL cs.AI cs.LG stat.ML 67%

SelfReflect: Can LLMs Communicate Their Internal Answer Distribution?

SelfReflect: LLMs能否传达其内部答案分布?

Michael Kirchhof, Luca Füger, Adam Goliński, Eeshan Gunesh Dhekane, Arno Blaas, Seong Joon Oh, Sinead Williamson

机构 * Apple(苹果公司) Independent Researcher(独立研究者) Tübingen AI Center(图宾根人工智能中心)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SelfReflect通过评估LLM内部信念分布与总结之间的信息论距离,发现现代LLM无法有效传达其不确定性,但通过多输出采样可生成忠实的不确定性总结。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22129 2026-02-06 cs.SE cs.AI cs.LG 62%

SWE-Replay: Efficient Test-Time Scaling for Software Engineering Agents

SWE-Replay:面向软件工程代理的高效测试时间扩展

Yifeng Ding, Lingming Zhang

机构 * Siebel School of Computing(计算科学系) Data Science, University of Illinois Urbana-Champaign, USA(数据科学,伊利诺伊大学厄巴纳-香槟分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 SWE-Replay通过重用历史轨迹和动态选择探索或利用策略,实现了高效且可推广的软件工程代理测试时间扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 5 篇

2602.05728 2026-02-06 cs.CL cs.AI 62%

CompactRAG: Reducing LLM Calls and Token Overhead in Multi-Hop Question Answering

CompactRAG: 减少多跳问答中的LLM调用和令牌开销

Hao Yang, Zhiyu Yang, Xupeng Zhang, Wei Wei, Yunjie Zhang, Lin Yang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Erik Jonsson School of Engineering and Computer Science, University of Texas at Dallas(埃里克·乔纳森工程与计算机科学学院,德克萨斯大学达拉斯分校) Isoftstone Information Technology (Group) Co.,Ltd.(伊软石信息技术(集团)有限公司) College of Electronic and Information Engineering, Tongji University(电子信息工程学院,同济大学) School of Electronic Information, Central South University(电子信息学院,中南大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 CompactRAG通过解耦离线语料重组与在线推理,减少多跳问答中的LLM调用和令牌消耗,提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05004 2026-02-06 cs.CL cs.AI 62%

CoWork-X: Experience-Optimized Co-Evolution for Multi-Agent Collaboration System

CoWork-X:面向多智能体协作系统的经验优化共进化

Zexin Lin, Jiachen Yu, Haoyang Zhang, Yuzhao Li, Zhonghang Li, Yujiu Yang, Junjie Wang, Xiaoqiang Ji

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)科学与工程学院) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院) Tsinghua University(清华大学) AutoGame Research(AutoGame研究) Shenzhen Institute of Artificial Intelligence and Robotics for Society(深圳人工智能与机器人研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 CoWork-X通过主动共进化框架,优化多智能体协作系统的实时协调与多轮适应,实现稳定性能提升和降低延迟与令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11007 2026-02-06 cs.CV cs.AI cs.LG 62%

VisMem: Latent Vision Memory Unlocks Potential of Vision-Language Models

VisMem: 通过潜在视觉记忆解锁视觉-语言模型的潜力

Xinlei Yu, Chengming Xu, Guibin Zhang, Zhangquan Chen, Yudong Zhang, Yongbo He, Peng-Tao Jiang, Jiangning Zhang, Xiaobin Hu, Shuicheng Yan

机构 * National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) vivo

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 VisMem通过引入动态潜在视觉记忆模块,提升视觉-语言模型在复杂视觉任务中的性能,实现感知准确性和语义一致性之间的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05810 2026-02-06 cs.LG 57%

Bifrost: Steering Strategic Trajectories to Bridge Contextual Gaps for Self-Improving Agents

Bifrost: 通过引导战略轨迹填补上下文差距以实现自我改进智能体

Quan M. Tran, Zhuo Huang, Wenbin Zhang, Bo Han, Koji Yatani, Masashi Sugiyama, Tongliang Liu

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 Bifrost通过引导轨迹适应填补上下文差距,提升智能体在上下文转换中的自我改进能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05665 2026-02-06 cs.AI 57%

Graph-based Agent Memory: Taxonomy, Techniques, and Applications

基于图的智能体记忆:分类、技术与应用

Chang Yang, Chuang Zhou, Yilin Xiao, Su Dong, Luyao Zhuang, Yujing Zhang, Zhu Wang, Zijin Hong, Zheng Yuan, Zhishang Xiang, Shengyuan Chen, Huachi Zhou, Qinggang Zhang, Ninghao Liu, Jinsong Su, Xinrun Wang, Yi Chang, Xiao Huang

机构 * The Hong Kong Polytechnic University(香港理工大学) School of Information(信息学院) Xiamen University(厦门大学) School of Computing and Information Systems(计算与信息学院) Singapore Management University(新加坡国立管理学院) School of Artificial Intelligence(人工智能学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文系统综述了基于图的智能体记忆,涵盖分类、关键技术、应用及挑战,旨在推动更高效可靠的图基智能体记忆系统发展。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理评测 14 篇

2602.05496 2026-02-06 cs.MM cs.AI cs.CV 79%

XEmoGPT: An Explainable Multimodal Emotion Recognition Framework with Cue-Level Perception and Reasoning

XEmoGPT:一种具有线索级感知与推理的可解释多模态情感识别框架

Hanwen Zhang, Yao Liu, Peiyuan Jiang, Lang Junjie, Xie Jun, Yihui He, Yajiao Deng, Siyu Du, Qiao Liu

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) th Research Institute, China Electronics Technology Group Corporation(中国电子科技集团第五十四研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 XEmoGPT通过专门模块和大规模数据集提升多模态情感识别的可解释性和线索级推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16048 2026-02-06 cs.AI 79%

SPhyR: Spatial-Physical Reasoning Benchmark on Material Distribution

SPhyR:基于材料分布的空间-物理推理基准

Philipp D. Siedler

机构 * Aleph Alpha Research(Aleph Alpha研究机构)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SPhyR数据集通过拓扑优化任务评估LLM在空间和物理推理方面的能力,无需模拟工具即可推断最优材料分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05120 2026-02-06 cs.CC cs.LG 79%

Certifiable Boolean Reasoning Is Universal

可验证的布尔推理是通用的

Wenhao Li, Anastasis Kratsios, Hrad Ghoukasian, Dennis Zvigelsky

机构 * University of Toronto(多伦多大学) McMaster University(麦基尔大学) Vector Institute(向量研究所) Scuola Normale Superiore di Pisa(比萨normal高等学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出了一种深度学习架构,能够确证性地推理并通用性地处理任何布尔任务,且在简单布尔任务中参数需求低。

Comments Submitted to COLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05392 2026-02-06 cs.CL cs.AI 73%

Beyond Length: Context-Aware Expansion and Independence as Developmentally Sensitive Evaluation in Child Utterances

超越长度:基于上下文的扩展与独立性作为儿童言语发展的敏感评估

Jiyun Chun, Eric Fosler-Lussier, Michael White, Andrew Perrault

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于上下文的评估框架,通过扩展和独立性两个维度评估儿童言语的发展性,提升对儿童对话质量的敏感度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05879 2026-02-06 cs.CL cs.AI cs.LG 67%

EuroLLM-22B: Technical Report

EuroLLM-22B:技术报告

Miguel Moura Ramos, Duarte M. Alves, Hippolyte Gisserot-Boukhlef, João Alves, Pedro Henrique Martins, Patrick Fernandes, José Pombal, Nuno M. Guerreiro, Ricardo Rei, Nicolas Boizard, Amin Farajian, Mateusz Klimaszewski, José G. C. de Souza, Barry Haddow, François Yvon, Pierre Colombo, Alexandra Birch, André F. T. Martins

机构 * Instituto Superior Técnico & Universidade de Lisboa (Lisbon ELLIS Unit)(里斯本ELLIS单位(理工学院与里斯本大学)) Instituto de Telecomunicações(电信研究院) MICS, CentraleSupélec, Université Paris-Saclay(MICS、中央圣艾尔布兰理工大学、巴黎萨克雷大学) Acolad Carnegie Mellon University(卡内基梅隆大学) University of Edinburgh(爱丁堡大学) Diabolocom Aveni OutSystems Sword Health Sorbonne Université, CNRS, ISIR(索邦大学、国家科学研究中心、ISIR) Artefact Research Center(Artefact研究机构) TransPerfect

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 EuroLLM-22B是一款覆盖24种欧盟语言及11种额外语言的大型语言模型,通过多语言基准测试展现强推理、指令遵循和翻译能力,提供基础模型、指令微调模型及预训练代码库以支持未来研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06008 2026-02-06 cs.AI cs.LG 62%

AgenticPay: A Multi-Agent LLM Negotiation System for Buyer-Seller Transactions

AgenticPay: 一种基于多智能体LLM的买方卖方交易谈判系统

Xianyang Liu, Shangding Gu, Dawn Song

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 AgenticPay是一种基于多智能体LLM的买方卖方交易谈判系统,通过自然语言驱动的多轮谈判解决市场交易问题,评估智能体在经济互动中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05874 2026-02-06 cs.CL cs.AI 62%

xList-Hate: A Checklist-Based Framework for Interpretable and Generalizable Hate Speech Detection

xList-Hate: 一个基于检查表的框架用于可解释且可推广的仇恨言论检测

Adrián Girón, Pablo Miralles, Javier Huertas-Tato, Sergio D'Antonio, David Camacho

机构 * Universidad Politécnica de Madrid(马德里理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 xList-Hate通过基于检查表的诊断框架,提升仇恨言论检测的可解释性和跨领域鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05515 2026-02-06 cs.AI cs.CL 62%

A Unified Multimodal Framework for Dataset Construction and Model-Based Diagnosis of Ameloblastoma

一种统一的多模态框架用于数据集构建和基于模型的ameloblastoma诊断

Ajo Babu George, Anna Mariam John, Athul Anoop, Balu Bhasuran

机构 * DiceMed School of Sciences (SOS), Indira Gandhi National Open University(印度甘地国家开放大学科学学院) School of Information, Florida State University(佛罗里达州立大学信息学院)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种统一的多模态框架,用于构建ameloblastoma数据集并开发基于模型的诊断方法,通过多模态深度学习模型提高分类和手术规划的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏