arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-27 至 2026-01-27 共收录 162 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 34 篇

2601.05171 2026-01-27 cs.CL 57%

Inside Out: Evolving User-Centric Core Memory Trees for Long-Term Personalized Dialogue Systems

Inside Out: 为长期个性化对话系统演化用户导向的核心内存树

Jihao Zhao, Ding Chen, Zhaoxin Fan, Kerun Xu, Mengting Hu, Bo Tang, Feiyu Xiong, Zhiyu Li

机构 * School of Information, Renmin University of China(中国人民大学信息学院) MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司) Institute for Advanced Algorithms Research, Shanghai(上海先进算法研究所) China Telecom Research Institute(中国电信研究院) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Nankai University(南开大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 Inside Out通过演化用户导向的核心内存树,提升长期个性化对话系统的内存压缩与身份一致性,采用轻量级MemListener实现动态更新与高效响应生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17002 2026-01-27 cs.CL 57%

RAM-SD: Retrieval-Augmented Multi-agent framework for Sarcasm Detection

RAM-SD:基于检索的多智能体框架用于讽刺检测

Ziyang Zhou, Ziqi Liu, Yan Wang, Yiming Lin, Yangbin Chen

机构 * Xi’an Jiaotong–Liverpool University(西安交通大学利物浦大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 RAM-SD通过多智能体框架提升讽刺检测性能,实现77.74%的宏F1值,提供透明推理轨迹。

Comments 12 pages, 4 figures, 6 tables, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14197 2026-01-27 econ.GN q-fin.EC 50%

Location-Robust Cost-Preserving Blended Pricing for Multi-Campus AI Data Centers

具有位置鲁棒性的成本保持混合定价:多校区人工智能数据中心

Qi He

专题命中 规划推理 :planning(abstract)

AI总结 本文提出了一种具有位置鲁棒性的成本保持混合定价方法,通过两个操作符解决异质位置混合导致的SKU排名反转问题,并在AI数据中心中实现了有效的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04084 2026-01-27 cs.CV 50%

When Swin Transformer Meets KANs: An Improved Transformer Architecture for Medical Image Segmentation

当Swin Transformer遇见KANs:一种改进的Transformer架构用于医学图像分割

Nishchal Sapkota, Haoyan Shi, Yejia Zhang, Xianshi Ma, Bofang Zheng, Fabian Vazquez, Pengfei Gu, Danny Z. Chen

机构 * Department of Computer Science and Engineering, University of Notre Dame(计算机科学与工程系,诺丁汉大学) Department of Computer Science, University of Texas Rio Grande Valley(计算机科学系,德克萨斯大学里奥格兰德谷分校)

专题命中 规划推理 :planning(abstract)

AI总结 UKAST结合KANs与Swin Transformer,提升医学图像分割的效率与准确性,尤其在数据稀缺情况下表现优异。

Comments This paper has been accepted for publication in the Proceedings of the IEEE International Symposium on Biomedical Imaging (ISBI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17507 2026-01-27 cs.RO 50%

MetaWorld: Skill Transfer and Composition in a Hierarchical World Model for Grounding High-Level Instructions

MetaWorld: 一个用于地面指令基础的分层世界模型中的技能迁移与组合

Yutong Shen, Hangxu Liu, Kailin Pei, Ruizhe Xia, Tongtong Feng

机构 * Beijing University of Technology(北京理工大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 规划推理 :planning(abstract)

AI总结 MetaWorld通过整合语义规划与物理控制,利用专家策略迁移提升人形机器人在定位-操作任务中的性能。

Comments 8 pages, 4 figures, Submitted to ICLR 2026 World Model Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17263 2026-01-27 cs.GT 50%

Strategic AI in Cournot Markets

Cournot市场中的战略AI

Sanyukta Deshpande, Sheldon H. Jacobson

专题命中 规划推理 :planning(abstract)

AI总结 本文研究了大型语言模型在寡头Cournot市场中的决策行为,揭示其在勾结和定价中的影响,并提出监管策略以恢复市场竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25423 2026-01-27 cs.SE 50%

What Challenges Do Developers Face in AI Agent Systems? An Empirical Study on Stack Overflow & GitHub Issues

人工智能代理系统中开发者面临哪些挑战?对Stack Overflow和GitHub问题的实证研究

Ali Asgari, Annibale Panichella, Pouria Derakhshanfar, Mitchell Olsthoorn

专题命中 规划推理 :planning(abstract)

AI总结 本研究通过分析Stack Overflow和GitHub问题,识别出人工智能代理系统开发中的五大主要挑战,包括环境管理、检索与记忆、协调控制、交互契约及运行时可靠性。

Comments v2: Adds GitHub Issues analysis; expands dataset and taxonomy; updates results and discussion. (15 pages, 5 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 5 篇

2509.16891 2026-01-27 cs.AI 83%

LLMs as Layout Designers: Enhanced Spatial Reasoning for Content-Aware Layout Generation

LLMs作为布局设计师:增强的空间推理用于内容感知布局生成

Sha Li, Stefano Petrangeli, Yu Shen, Xiang Chen, Naren Ramakrishnan

机构 * Virginia Tech(弗吉尼亚理工大学) Adobe Research(Adobe研究)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 LaySPA通过强化学习框架增强LLM的空间推理能力,实现内容感知布局生成,优于通用LLM和专用布局模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11020 2026-01-27 cs.CV cs.AI 79%

GeoVLMath: Enhancing Geometry Reasoning in Vision-Language Models via Cross-Modal Reward for Auxiliary Line Creation

GeoVLMath: 通过跨模态奖励增强视觉-语言模型中的几何推理以辅助线创建

Shasha Guo, Liang Pang, Xi Wang, Yanling Wang, Huawei Shen, Jing Zhang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Renmin University of China(中国人民大学) Zhipu AI(智谱AI)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 GeoVLMath通过跨模态奖励模型提升视觉-语言模型在复杂立体几何问题中的几何推理能力。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13968 2026-01-27 cs.CV cs.AI cs.CL 73%

RotBench: Evaluating Multimodal Large Language Models on Identifying Image Rotation

RotBench: 对多模态大语言模型识别图像旋转能力的评估

Tianyi Niu, Jaemin Cho, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学夏洛特分校) Allen Institute for Artificial Intelligence(人工智能研究院) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 RotBench评估了多模态大语言模型在识别图像旋转角度方面的性能,发现大多数模型难以区分90°和270°旋转,但能识别0°和180°图像,揭示了模型空间推理能力与人类的差距。

Comments EACL 2026 Camera-Ready. Code and data: https://github.com/tianyiniu/RotBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18492 2026-01-27 cs.RO 67%

DV-VLN: Dual Verification for Reliable LLM-Based Vision-and-Language Navigation

DV-VLN:基于可靠大语言模型的视觉-语言导航的双重验证

Zijun Li, Shijie Li, Zhenxi Zhang, Bin Li, Shoujun Zhou

机构 * Robotics Engineering Program, College of Engineering, Zhejiang Normal University(浙江师范大学工程学院机器人工程专业) Shenzhen Institutes of Advanced Technology (SIAT), Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Department of Health Technology and Informatics, The Hong Kong Polytechnic University(香港理工大学健康科技与信息技术系)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 DV-VLN通过生成-验证范式提升大语言模型在视觉-语言导航中的可靠性,通过双重验证机制提高导航决策的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17123 2026-01-27 cs.HC cs.CV cs.RO 50%

Acoustic Field Video for Multimodal Scene Understanding

用于多模态场景理解的声学场视频

Daehwa Kim, Chris Harrison

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出声学场视频作为多模态场景理解的新输入方式,通过整合空间声学数据显著提升视觉-语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 4 篇

2510.04182 2026-01-27 cs.CL cs.AI 86%

Thinking on the Fly: Test-Time Reasoning Enhancement via Latent Thought Policy Optimization

飞行中的思考:通过潜在思维策略优化提升测试时推理

Wengao Ye, Yan Liang, Lianlei Shan

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 LTPO通过在测试时优化潜在思维向量,提升LLM在复杂推理任务中的鲁棒性和准确性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17223 2026-01-27 cs.CL cs.AI 84%

Beyond Outcome Verification: Verifiable Process Reward Models for Structured Reasoning

超越结果验证:用于结构化推理的可验证过程奖励模型

Massimiliano Pronesti, Anya Belz, Yufang Hou

机构 * IBM Research Europe - Ireland(IBM欧洲研究院-爱尔兰) Dublin City University(都柏林城市大学) IT:U Interdisciplinary Transformation University Austria(IT:U跨学科转型大学奥地利)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出可验证过程奖励模型,用于提升结构化推理的连贯性和准确性,实验显示其在医学证据评估中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18730 2026-01-27 cs.CL cs.LG 81%

Reflect: Transparent Principle-Guided Reasoning for Constitutional Alignment at Scale

Reflect: 为大规模宪法对齐的透明原则引导推理

Henry Bell, Caroline Zhang, Mohammed Mobasserul Haque, Dhaval Potdar, Samia Zaman, Brandon Fain

机构 * Duke University(杜克大学) Independent Researcher(独立研究者)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 Reflect通过透明推理框架在不需训练数据的情况下提升大语言模型对多样原则的对齐能力,增强安全性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17212 2026-01-27 cs.CL 57%

DF-RAG: Query-Aware Diversity for Retrieval-Augmented Generation

DF-RAG:基于查询的多样性检索增强生成

Saadat Hasan Khan, Spencer Hong, Jingyu Wu, Kevin Lybarger, Youbing Yin, Erin Babinsky, Daben Liu

机构 * George Mason University(乔治·马歇尔大学) Capital One

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 DF-RAG通过在检索阶段引入多样性,提升复杂推理问答任务的F1性能,相比传统RAG提升了4-10个百分点,并接近Oracle上限的91.3%

Comments Accepted to Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 21 篇

2601.17420 2026-01-27 cs.CV 93%

CoT-Seg: Rethinking Segmentation with Chain-of-Thought Reasoning and Self-Correction

CoT-Seg:重新思考基于链式推理的分割

Shiu-hong Kao, Chak Ho Huang, Huaiqian Liu, Yu-Wing Tai, Chi-Keung Tang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Dartmouth College(达特茅斯学院)

专题命中 复杂问题求解 :CoT(title,abstract);reasoning(title,abstract);chain-of-thought(title,abstract);self-correction(title,abstract)

AI总结 CoT-Seg通过结合链式推理和自我纠正,提升复杂分割任务的可靠性与鲁棒性,适用于模糊或错误多发的场景。

Comments Project page: https://danielshkao.github.io/cot-seg.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16986 2026-01-27 cs.CL cs.AI cs.LG 87%

Crystal-KV: Efficient KV Cache Management for Chain-of-Thought LLMs via Answer-First Principle

Crystal-KV: 通过答案优先原则高效管理链式推理LLM的KV缓存

Zihan Wang, Cheng Tang, Lei Gong, Cheng Li, Chao Wang, teng wang, Wenqi Lou, Xuehai Zhou

机构 * School of Computer Science and Technology, University of Science and Technology of China(计算机科学与技术学院,中国科学技术大学) University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(人工智能研究所,合肥综合性国家科学中心) Suzhou Institute for Advanced Research, University of Science and Technology of China(苏州先进研究院,中国科学技术大学)

专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Crystal-KV通过答案优先原则高效管理链式推理LLM的KV缓存,提升缓存压缩和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10688 2026-01-27 cs.LG cs.AI cs.CC cs.CL 82%

Neural Algorithmic Reasoning for Hypergraphs with Looped Transformers

具有循环变换器的超图神经算法推理

Zekai Huang, Yingyu Liang, Zhenmei Shi, Zhao Song, Zhen Zhuang

机构 * Department of XXX, University of YYY, Location, Country(YYY大学XXX系) School of ZZZ, Institute of WWW, Location, Country(WWW研究所ZZZ学院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于循环变换器的超图神经算法推理方法,通过退化机制和超边感知编码方案模拟超图算法,展示其在高维数据处理中的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17982 2026-01-27 cs.CL cs.AI 81%

SD-E$^2$: Semantic Exploration for Reasoning Under Token Budgets

SD-E$^2$: 语义探索用于受限令牌预算下的推理

Kshitij Mishra, Nils Lukas, Salem Lahlou

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 SD-E$^2$通过语义多样性奖励提升小型语言模型在受限令牌预算下的推理能力,实现对复杂问题的高效探索与利用。

Comments Accepted at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17275 2026-01-27 cs.LG cs.AI 81%

Latent-Space Contrastive Reinforcement Learning for Stable and Efficient LLM Reasoning

潜在空间对比强化学习用于稳定高效的LLM推理

Lianlei Shan, Han Chen, Yixuan Wang, Zhenjie Liu, Wei Li

机构 * University of Chinese Academy of Sciences(中国科学院大学) EvolutionLeap(进化跃迁) Tsinghua University(清华大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出深度潜在推理(DLR),通过潜在空间对比强化学习提升LLM在复杂推理任务中的稳定性与效率。

Comments 12 pages,

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11233 2026-01-27 cs.AI 79%

STaR: Towards Effective and Stable Table Reasoning via Slow-Thinking Large Language Models

STaR:通过慢思考大语言模型实现有效的稳定表格推理

Huajian Zhang, Mingyue Cheng, Yucong Luo, Xiaoyu Tao

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 STaR通过慢思考机制提升表格推理的有效性和稳定性,采用两阶段训练框架和不确定性量化技术,在领域内和领域外均取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17566 2026-01-27 cs.CV 78%

Sponge Tool Attack: Stealthy Denial-of-Efficiency against Tool-Augmented Agentic Reasoning

Sponge Tool Attack:针对工具增强代理推理的隐蔽低效攻击

Qi Li, Xinchao Wang

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 Sponge Tool Attack通过重写输入提示,隐蔽地破坏工具增强代理推理的效率,验证了其在多种模型和工具上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17435 2026-01-27 cs.SE cs.AI 70%

Towards a Declarative Agentic Layer for Intelligent Agents in MCP-Based Server Ecosystems

迈向基于MCP服务器生态系统的声明性代理层

Maria Jesus Rodriguez-Sanchez, Manuel Noguera, Angel Ruiz-Zafra, Kawtar Benghazi

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出了一种声明性代理层,旨在解决基于MCP服务器生态系统中代理工作流的可靠性问题,通过明确的架构结构提升任务执行的可验证性和可重复性。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18129 2026-01-27 cs.CL cs.AI 62%

Typhoon-S: Minimal Open Post-Training for Sovereign Large Language Models

Typhoon-S: 最小化开放的训练后处理以实现主权大语言模型

Kunat Pipatanakul, Pittawat Taveekitworachai

机构 * Typhoon, SCB 10X(Typhoon,SCB 10X)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Typhoon-S通过最小化开放的训练后处理方法,实现主权大语言模型的可采用性和主权能力,无需大规模数据或复杂调优流程。

Comments 19 pages. Code is publicly available at https://github.com/scb-10x/typhoon-s . Datasets and model weights are available at https://huggingface.co/collections/typhoon-ai/typhoon-s

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17869 2026-01-27 cs.CL cs.LG 62%

On the Emergence and Test-Time Use of Structural Information in Large Language Models

关于大型语言模型中结构信息的出现及其测试时使用

Michelle Chao Chen, Moritz Miller, Bernhard Schölkopf, Siyuan Guo

机构 * ETH Zurich(苏黎世联邦理工学院) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) University of Cambridge(剑桥大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究探讨了大型语言模型如何学习和利用结构信息,发现其在复杂推理任务中表现突出,但测试时组合生成能力仍受限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14243 2026-01-27 cs.LG cs.CL 62%

Jet-RL: Enabling On-Policy FP8 Reinforcement Learning with Unified Training and Rollout Precision Flow

Jet-RL: 通过统一训练和回放精度流实现基于策略的FP8强化学习

Haocheng Xi, Charlie Ruan, Peiyuan Liao, Yujun Lin, Han Cai, Yilong Zhao, Shuo Yang, Kurt Keutzer, Song Han, Ligeng Zhu

机构 * NVIDIA MIT(麻省理工学院) UC Berkeley(加州大学伯克利分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 Jet-RL通过统一FP8精度流实现稳定高效的强化学习训练,显著提升训练和回放速度,同时保持精度稳定。

Comments 11 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15955 2026-01-27 cs.LG cs.AI 62%

How Good Are LLMs at Processing Tool Outputs?

大型语言模型在处理工具输出方面有多好?

Kiran Kate, Yara Rizk, Poulami Ghosh, Ashu Gulati, Tathagata Chakraborti, Zidane Wright, Mayank Agarwal

机构 * IBM Research(IBM研究院) Persistent Systems Grab

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了LLMs处理工具输出的能力,发现即使在前沿模型上,JSON处理仍具挑战性,不同提示策略影响性能差异达3%-50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08741 2026-01-27 cs.CL cs.AI 62%

Coordinates from Context: Using LLMs to Ground Complex Location References

基于上下文的坐标:利用大语言模型来定位复杂位置参考

Tessa Masis, Brendan O'Connor

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种利用大语言模型来处理复杂位置参考地理编码的方法,展示了其在性能上的优势。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18281 2026-01-27 cs.CL cs.SD 57%

Reflecting Twice before Speaking with Empathy: Self-Reflective Alternating Inference for Empathy-Aware End-to-End Spoken Dialogue

在富有同理心之前两次反思:用于富有同理心的端到端语音对话的自我反思交替推理

Yuhang Jia, Pei Liu, Haoqin Sun, Jiaming Zhou, Xuxin Cheng, Cao Liu, Ke Zeng, Xunliang Cai, Yong Qin

机构 * College of Computer Science, Nankai University(南开大学计算机科学学院) Meituan LongCat Interaction Team(美团LongCat交互团队)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 ReEmpathy通过自我反思交替推理机制提升语音对话的同理心表现,实现更情感智能的人机交互。

详情

展开后加载摘要…

URL PDF HTML 收藏