arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-09 至 2026-02-09 共收录 83 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 21 篇

2602.05975 2026-02-09 cs.IR cs.CL 57%

SAGE: Benchmarking and Improving Retrieval for Deep Research Agents

SAGE:深度研究代理检索的基准测试与改进

Tiansheng Hu, Yilun Zhao, Canyu Zhang, Arman Cohan, Chen Zhao

机构 * NYU Shanghai(纽约大学上海校区) Yale University(耶鲁大学) Center for Data Science, New York University(纽约大学数据科学中心)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 SAGE基准测试评估了深度研究代理的检索能力,发现BM25在推理密集型检索中表现优于大语言模型检索器,并提出基于语料库的测试时扩展框架提升检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23306 2026-02-09 cs.AI 57%

GATSim: Urban Mobility Simulation with Generative Agents

GATSim: 基于生成代理的都市交通模拟

Qi Liu, Can Li, Wanjing Ma

机构 * Key Laboratory of Road and Traffic Engineering of the Ministry of Education, College of Transportation, Tongji University(教育部交通工程重点实验室,交通学院,同济大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 GATSim通过生成代理模拟都市交通,结合认知系统与多尺度反思过程,实现对复杂出行行为的高效建模与真实交通模式的生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04430 2026-02-09 cs.DB 50%

The Stretto Execution Engine for LLM-Augmented Data Systems

用于LLM增强数据系统的Stretto执行引擎

Gabriele Sanmartino, Matthias Urban, Paolo Papotti, Carsten Binnig

专题命中 规划推理 :planning(abstract)

AI总结 Stretto通过约束优化和梯度优化器,在LLM增强数据系统中实现端到端查询保证,同时高效平衡运行时准确性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00744 2026-02-09 cs.SD 50%

ACE-Step 1.5: Pushing the Boundaries of Open-Source Music Generation

ACE-Step 1.5:推动开源音乐生成的边界

Junmin Gong, Yulin Song, Wenxiao Zhao, Sen Wang, Shengyuan Xu, Jing Guo, Xuerui Yang

机构 * ACE Studio(ACE工作室) Step Fun

专题命中 规划推理 :chain-of-thought(abstract)

AI总结 ACE-Step 1.5通过高效开源模型实现商业级音乐生成,结合内在强化学习与混合架构,支持多语言创作与风格控制。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 4 篇

2602.06166 2026-02-09 cs.CV 82%

M3: High-fidelity Text-to-Image Generation via Multi-Modal, Multi-Agent and Multi-Round Visual Reasoning

M3:通过多模态、多智能体和多轮视觉推理实现高保真的文本到图像生成

Bangji Yang, Ruihan Guo, Jiajun Fan, Chaoran Cheng, Ge Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉空间推理 :reasoning(title,abstract);verifier(abstract)

AI总结 M3通过多智能体和多轮视觉推理提升开源模型的文本到图像生成能力,超越商业系统并实现最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06041 2026-02-09 cs.CV 78%

Predicting Camera Pose from Perspective Descriptions for Spatial Reasoning

从透视描述预测相机姿态用于空间推理

Xuejun Zhang, Aditi Tiwari, Zhenhailong Wang, Heng Ji

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 CAMCUE通过姿态感知的多图像框架,从自然语言描述中准确预测相机姿态,提升多视角空间推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22894 2026-02-09 cs.CR cs.AI 57%

DECEPTICON: How Dark Patterns Manipulate Web Agents

DECEPTICON:暗模式如何操纵网络代理

Phil Cuvin, Hao Zhu, Diyi Yang

机构 * Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 DECEPTICON研究揭示暗模式通过引导代理轨迹对网络代理构成重大风险,表明需加强防御措施以应对操纵性设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17815 2026-02-09 cs.RO 50%

Less Is More: Scalable Visual Navigation from Limited Data

少即是多:从有限数据实现可扩展的视觉导航

Yves Inglin, Jonas Frey, Changan Chen, Marco Hutter

机构 * ETH Zurich(苏黎世联邦理工学院) Stanford University(斯坦福大学) UC Berkeley(伯克利加州大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出Less is More方法,通过结合有限专家示范与规划器生成的监督,实现高效视觉导航。

Comments v2: Minor text edits, reference formatting fixes, and project page link added

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 2 篇

2602.06266 2026-02-09 cs.CL 85%

Is my model "mind blurting"? Interpreting the dynamics of reasoning tokens with Recurrence Quantification Analysis (RQA)

我的模型在“思维模糊”吗?通过递归量化分析(RQA)解读推理令牌的动力学

Quoc Tuan Pham, Mehdi Jafari, Flora Salim

机构 * School of Computer Science and Engineering, University of New South Wales(计算机科学与工程学院,新南威尔士大学)

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract);test-time compute(abstract);分类 cs.CL

AI总结 通过递归量化分析(RQA)研究推理模型在测试时的令牌生成动力学,提升任务复杂度预测能力8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06375 2026-02-09 cs.AI 57%

Difficulty-Estimated Policy Optimization

难度估计策略优化

Yu Zhao, Fan Jiang, Tianle Liu, Bo Zeng, Yu Liu, Longyue Wang, Weihua Luo

机构 * Alibaba International Digital Commerce(阿里巴巴国际数字商务) School of Software Technology, Dalian University of Technology(大连理工大学软件学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 DEPO通过动态难度估计器优化推理对齐的效率和鲁棒性,减少回放成本并提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 9 篇

2506.14625 2026-02-09 cs.CL cs.AI 81%

Probabilistic Aggregation and Targeted Embedding Optimization for Collective Moral Reasoning in Large Language Models

概率聚合与定向嵌入优化用于大语言模型中的集体道德推理

Chenchen Yuan, Zheyu Zhang, Shuo Yang, Bardh Prenkaj, Gjergji Kasneci

机构 * School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学) School of Social Sciences and Technology, Technical University of Munich(社会科学与技术学院,慕尼黑技术大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种概率聚合与定向嵌入优化方法,通过融合多个大语言模型的道德判断,提升集体道德推理的一致性和准确性。

Comments Accepted to ACL 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06454 2026-02-09 cs.CL 79%

RelayGen: Intra-Generation Model Switching for Efficient Reasoning

RelayGen: 生成内代际模型切换以实现高效推理

Jiwon Song, Yoongon Kim, Jae-Joon Kim

机构 * Seoul National University(首尔国立大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 RelayGen通过段级运行时模型切换,在不增加训练成本的情况下,提升推理效率并减少延迟,同时保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03595 2026-02-09 cs.CV 78%

Refer-Agent: A Collaborative Multi-Agent System with Reasoning and Reflection for Referring Video Object Segmentation

Refer-Agent:一种具有推理和反思的协作多智能体系统用于指引用视频对象分割

Haichao Jiang, Tianming Liang, Wei-Shi Zheng, Jian-Fang Hu

机构 * Sun Yat-sen University(中山大学)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 Refer-Agent通过协作多智能体系统结合推理与反思机制,提升指引用视频对象分割的性能与灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21736 2026-02-09 cs.CV 71%

SyncAnyone: Implicit Disentanglement via Progressive Self-Correction for Lip-Syncing in the wild

SyncAnyone: 通过渐进自我校正实现隐式解耦以实现野外对口型同步

Xindi Zhang, Dechao Meng, Steven Xiao, Qi Wang, Peng Zhang, Bang Zhang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 复杂问题求解 :self-correction(title)

AI总结 SyncAnyone通过渐进自我校正实现隐式解耦,提升野外对口型同步的精度和视觉保真度。

Comments Project page: https://humanaigc.github.io/sync_anyone_demo_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06665 2026-02-09 cs.CL cs.AI 62%

Not All Layers Need Tuning: Selective Layer Restoration Recovers Diversity

并非所有层都需要调节:选择性层恢复恢复多样性

Bowen Zhang, Meiyi Wang, Harold Soh

机构 * Department of Computer Science, National University of Singapore, Singapore(新加坡国立大学计算机科学系) Smart Systems Institute, National University of Singapore, Singapore, Singapore(新加坡国立大学智能系统研究所)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 选择性层恢复通过恢复特定层到预训练权重,提升LLM输出多样性并保持高质量。

Comments 16 pages, 7 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06485 2026-02-09 cs.AI 57%

AgentCPM-Explore: Realizing Long-Horizon Deep Exploration for Edge-Scale Agents

AgentCPM-Explore: 实现长horizon深度探索以实现边缘规模智能体

Haotian Chen, Xin Cong, Shengda Fan, Yuyang Fu, Ziqin Gong, Yaxi Lu, Yishan Li, Boye Niu, Chengjun Pan, Zijun Song, Huadong Wang, Yesai Wu, Yueying Wu, Zihao Xie, Yukun Yan, Zhong Zhang, Yankai Lin, Zhiyuan Liu, Maosong Sun

机构 * AgentCPM Team(AgentCPM 团队)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 AgentCPM-Explore通过深度探索实现边缘规模智能体的高性能表现,超越大模型在多个基准上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06270 2026-02-09 cs.CL 57%

VowelPrompt: Hearing Speech Emotions from Text via Vowel-level Prosodic Augmentation

VowelPrompt:通过元音层面的语调增强从文本中听出语音情感

Yancheng Wang, Osama Hanna, Ruiming Xie, Xianfeng Rui, Maohao Shen, Xuedong Zhang, Christian Fuegen, Jilong Wu, Debjyoti Paul, Arthur Guo, Zhihong Lei, Ozlem Kalinli, Qing He, Yingzhen Yang

机构 * Meta Superintelligence Labs(Meta超智能实验室) Arizona State University(亚利桑那州立大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 VowelPrompt通过元音层面的语调增强,提升LLM在语音情感识别中的表现并生成可解释的解释。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04836 2026-02-09 cs.AI 57%

Are AI Capabilities Increasing Exponentially? A Competing Hypothesis

人工智能能力是否呈指数增长?一个竞争性假设

Haosen Ge, Hamsa Bastani, Osbert Bastani

机构 * Wharton AI \& Analytics Initiative, The Wharton School, University of Pennsylvania, USA Department of Operations, Information Decisions, The Wharton School, University of Pennsylvania, USA Department of Computer Information Science, University of Pennsylvania, USA

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文通过分析数据和提出复杂模型,质疑人工智能能力的指数增长假设,指出拐点已过去并提出未来可能的转折点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06391 2026-02-09 cs.CV 50%

POINTS-GUI-G: GUI-Grounding Journey

POINTS-GUI-G:GUI接地之旅

Zhongyin Zhao, Yuan Liu, Yikun Liu, Haicheng Wang, Le Tian, Xiao Zhou, Yangxiu You, Zilin Yu, Yang Yu, Jie Zhou

机构 * Tencent(腾讯)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 POINTS-GUI-G通过精细化数据工程、改进训练策略和强化学习提升GUI接地性能,实现多个基准测试的最优表现。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理评测 19 篇

2505.18759 2026-02-09 cs.AI cs.LG 90%

The Quest for Efficient Reasoning: A Data-Centric Benchmark to CoT Distillation

高效推理的追寻:一个数据导向的基准以评估CoT蒸馏

Ruichen Zhang, Rana Muhammad Shahroz Khan, Zhen Tan, Dawei Li, Song Wang, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Arizona State University(亚利桑那州立大学) University of Virginia(弗吉尼亚大学)

专题命中 推理评测 :reasoning(title,abstract);CoT(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DC-CoT基准,通过数据导向方法评估CoT蒸馏中的数据操作,以优化推理模型的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06319 2026-02-09 cs.AI 79%

Exposing Weaknesses of Large Reasoning Models through Graph Algorithm Problems

通过图算法问题揭示大推理模型的弱点

Qifan Zhang, Jianhao Ruan, Aochuan Chen, Kang Zeng, Nuo Chen, Jing Tang, Jia Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 GrAlgoBench通过图算法问题揭示大推理模型在长上下文推理和过度思考方面的不足,为改进推理研究提供严格测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06751 2026-02-09 cs.CR cs.SE 78%

Beyond Function-Level Analysis: Context-Aware Reasoning for Inter-Procedural Vulnerability Detection

超越函数级分析:面向跨过程的漏洞检测上下文感知推理

Yikun Li, Ting Zhang, Jieke Shi, Chengran Yang, Junda He, Xin Zhou, Jinfeng Jiang, Huihui Huang, Wen Bin Leow, Yide Yin, Eng Lieh Ouh, Lwin Khin Shar, David Lo

专题命中 推理评测 :reasoning(title,abstract)

AI总结 CPRVul通过结合上下文剖析与结构化推理,提升跨过程漏洞检测的准确性,其在多个数据集上均优于传统函数级方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06446 2026-02-09 cs.CL cs.AI cs.LG 67%

CORE: Comprehensive Ontological Relation Evaluation for Large Language Models

CORE:面向大语言模型的全面本体关系评估

Satyam Dwivedi, Sanjukta Ghosh, Shivam Dwivedi, Nishi Kumari, Anil Thakur, Anurag Purushottam, Deepak Alok, Praveen Gatla, Manjuprasad B, Bipasha Patgiri

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CORE提出一个全面评估大语言模型语义关系区分能力的数据集和基准测试,揭示其在无关性推理上的显著缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12014 2026-02-09 cs.CL cs.AI cs.LG cs.SE 67%

code_transformed: The Influence of Large Language Models on Code

code_transformed: 大型语言模型对代码的影响

Yuliang Xu, Siming Huang, Mingmeng Geng, Yao Wan, Xuanhua Shi, Dongping Chen

机构 * Huazhong University of Science and Technology(华中科技大学) École normale supérieure - Université PSL(巴黎高等师范学院-巴黎大学) Laboratoire LATTICE(LATTICE实验室) International School for Advanced Studies (SISSA)(国际先进研究学院(SISSA))

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了大型语言模型对代码风格的影响,通过分析GitHub仓库中的代码,发现命名规范、复杂性等指标的变化,揭示LLMs对现实编程实践的深远影响。

Comments EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13707 2026-02-09 cs.AI cs.CL 62%

OpenDeception: Learning Deception and Trust in Human-AI Interaction via Multi-Agent Simulation

OpenDeception: 通过多智能体模拟学习人类-人工智能交互中的欺骗与信任

Yichen Wu, Qianqian Gao, Xudong Pan, Geng Hong, Min Yang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 OpenDeception通过多智能体模拟评估人类-人工智能交互中的欺骗与信任风险,利用场景基准、意图网络和信任网络,识别高风险对话并提前预警。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08010 2026-02-09 cs.CL cs.AI 62%

ExpressivityBench: Can LLMs Communicate Implicitly?

ExpressivityBench: LLMs能否隐式沟通?

Joshua Tint, Som Sagar, Aditya Taparia, Kelly Raines, Bimsara Pathiraja, Caleb Liu, Ransalu Senanayake

机构 * Amazon(亚马逊公司) Arizona State University(亚利桑那州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ExpressivityBench通过信息理论模型评估LLM隐式沟通能力,发现其在情感表达上表现良好,但在社会语言学信号上不如人类。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06443 2026-02-09 cs.CR cs.AI 57%

TrajAD: Trajectory Anomaly Detection for Trustworthy LLM Agents

TrajAD:用于可信大语言模型代理的轨迹异常检测

Yibing Liu, Chong Zhang, Zhongyi Han, Hansong Liu, Yong Wang, Yang Yu, Xiaoyan Wang, Yilong Yin

机构 * School of Software, Shandong University(山东大学软件学院) Sonli Holding Group Co., Ltd.(山东利集团有限公司) Shandong Huazhi Talent Technology Co., Ltd.(山东华智人才科技有限公司) Information Technology Service Center of People’s Court(人民法院信息技术服务中心)

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 TrajAD通过细粒度过程监督训练的专用验证器,解决大语言模型代理轨迹异常检测问题,提升过程可靠性。

Comments 9 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06370 2026-02-09 cs.CL 57%

Cost-Aware Model Selection for Text Classification: Multi-Objective Trade-offs Between Fine-Tuned Encoders and LLM Prompting in Production

面向成本的模型选择用于文本分类:在生产环境中细调编码器与LLM提示之间的多目标权衡

Alberto Andres Valdes Gonzalez

机构 * Pontifical Catholic University of Chile(天主教智利大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出在生产环境中细调编码器与LLM提示之间的多目标权衡,发现微调编码器在成本和性能上优于LLM提示。

Comments 26 pages, 12 figures. Empirical benchmark comparing fine-tuned encoders and LLM prompting for text classification under cost and latency constraints

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05512 2026-02-09 cs.CL cs.IR 57%

A Human-in-the-Loop, LLM-Centered Architecture for Knowledge-Graph Question Answering

面向知识图谱问答的人机协同、大语言模型中心架构

Larissa Pusch, Alexandre Courtiol, Tim Conrad

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种人机协同的大语言模型中心架构,用于知识图谱问答,通过生成Cypher查询并让用户逐步优化,提升复杂数据集的可访问性并保持事实准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05424 2026-02-09 cs.AI 57%

THOR: Inductive Link Prediction over Hyper-Relational Knowledge Graphs

THOR:基于超关系知识图谱的归纳链接预测

Weijian Yu, Yuhuan Lu, Dingqi Yang

机构 * University of Macau(澳门大学) Khalifa University(哈利法大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 THOR提出了一种针对超关系知识图谱的归纳链接预测方法,通过基础图建模和Transformer解码器提升预测性能,优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏