arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-26 至 2026-02-26 共收录 91 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 5 篇

2602.21619 2026-02-26 cs.CL 85%

When More Is Less: A Systematic Analysis of Spatial and Commonsense Information for Visual Spatial Reasoning

更多未必更好:对视觉空间推理中空间与常识信息的系统分析

Muku Akasaka, Soyeon Caren Han

机构 * The University of Melbourne(墨尔本大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文通过系统分析发现,过多信息未必提升视觉空间推理性能,针对性单空间提示和精确空间定位可提高准确性。

Comments 5 pages, 6 figures, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19983 2026-02-26 cs.RO cs.AI 79%

Contextual Safety Reasoning and Grounding for Open-World Robots

面向开放世界机器人的上下文安全推理与 grounding

Zachary Ravichandran, David Snyder, Alexander Robey, Hamed Hassani, Vijay Kumar, George J. Pappas

机构 * University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 CORE框架通过视觉语言模型实现在线上下文推理与空间grounding,提供概率安全保证,在开放世界中有效执行上下文适应的安全行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21992 2026-02-26 cs.CV 50%

PanoEnv: Exploring 3D Spatial Intelligence in Panoramic Environments with Reinforcement Learning

PanoEnv:探索基于强化学习的全景环境中3D空间智能

Zekai Lin, Xu Zheng

机构 * University of Glasgow(格拉斯哥大学) HKUST(GZ)(香港科技大学(广州))

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 PanoEnv通过强化学习框架提升VLMs在全景环境中3D空间推理能力,实现更高准确率和语义评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21552 2026-02-26 cs.CV 50%

Generalizing Visual Geometry Priors to Sparse Gaussian Occupancy Prediction

将视觉几何先验泛化到稀疏高斯占用预测

Changqing Zhou, Yueru Luo, Changhao Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 GPOcc通过利用可泛化的视觉几何先验进行单目占用预测,在速度和精度上均优于现有方法。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20685 2026-02-26 cs.CV 50%

RAYNOVA: Scale-Temporal Autoregressive World Modeling in Ray Space

RAYNOVA:在射线空间中实现尺度-时间自回归世界建模

Yichen Xie, Chensheng Peng, Mazen Abdelfattah, Yihan Hu, Jiezhi Yang, Eric Higgins, Ryan Brigden, Masayoshi Tomizuka, Wei Zhan

机构 * Applied Intuition UC Berkeley(加州大学伯克利分校)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 RAYNOVA通过双因果自回归框架实现尺度-时间自回归世界建模,在驾驶场景中实现多视角视频生成,具有更高的吞吐量和可控性。

Comments Accepted by CVPR 2026; Project website: https://raynova-ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 测试时计算 9 篇

2602.21756 2026-02-26 cs.IR cs.LG 79%

Offline Reasoning for Efficient Recommendation: LLM-Empowered Persona-Profiled Item Indexing

离线推理用于高效推荐:基于LLM的个性化-属性化物品索引

Deogyong Kim, Junseong Lee, Jeongeun Lee, Changhoe Kim, Junguel Lee, Jungseok Lee, Dongha Lee

机构 * Yonsei University(延世大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 Persona4Rec通过离线推理构建物品个性化表示,实现高效且可解释的推荐系统,减少推理时间并提供直观解释。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21317 2026-02-26 cs.LG 79%

Shared Nature, Unique Nurture: PRISM for Pluralistic Reasoning via In-context Structure Modeling

共享本质,独特培养:通过上下文结构建模实现多元推理的PRISM

Guancheng Tu, Shiyang Zhang, Tianyu Zhang, Yi Zhang, Diji Yang

机构 * University of Pennsylvania(宾夕法尼亚大学) Yale University(耶鲁大学) University of California Santa Cruz(加州大学圣克鲁兹分校)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.LG

AI总结 PRISM通过上下文结构建模实现多元推理,提升创造力和科学发现能力,展现独特认知轨迹的多元AI新范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01350 2026-02-26 cs.AI 77%

Error Notebook-Guided, Training-Free Part Retrieval in 3D CAD Assemblies via Vision-Language Models

通过视觉-语言模型实现无训练的3DCAD装配体部件检索:基于错误笔记本的引导

Yunqing Liu, Nan Zhang, Zhiming Tan

机构 * Fujitsu Research & Development Center Shanghai, China(富士通研发中心上海)

专题命中 测试时计算 :reasoning(abstract);CoT(abstract);verifier(abstract);分类 cs.AI

AI总结 本研究提出一种无训练的3D CAD部件检索方法,通过结合错误笔记本与RAG技术,显著提升基于VLM的推理性能,实验显示在专有模型和开源模型上均取得显著效果。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22207 2026-02-26 cs.CL cs.AI cs.LG 67%

Recovered in Translation: Efficient Pipeline for Automated Translation of Benchmarks and Datasets

译回翻译:高效管道用于自动翻译基准和数据集

Hanna Yukhymenko, Anton Alexandrov, Martin Vechev

机构 * INSAIT, Sofia University "St. Kliment Ohridski"(INSAIT,索菲亚大学"圣克莱门特·奥赫里迪斯基") ETH Zurich(苏黎世联邦理工学院)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种高效自动化框架,用于高质量翻译多语言基准和数据集,以提升多语言AI评估的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21222 2026-02-26 cs.CL cs.AI cs.LG 67%

Task-Aware LoRA Adapter Composition via Similarity Retrieval in Vector Databases

基于向量数据库相似性检索的任务感知LoRA适配器组合

Riya Adsul, Balachandra Devarangadi Sunil, Isha Nalawade, Sudharshan Govindan

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于向量数据库相似性检索的LoRA适配器组合框架,通过动态合并适配器实现多任务学习,线性合并方法在PIQA和RTE任务上取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18292 2026-02-26 cs.LG cs.AI 62%

Decoding as Optimisation on the Probability Simplex: From Top-K to Top-P (Nucleus) to Best-of-K Samplers

解码作为概率单纯形上的优化:从Top-K到Top-P(核)到Best-of-K采样器

Xiaotong Ji, Rasul Tutunov, Matthieu Zimmer, Haitham Bou-Ammar

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于概率单纯形优化的解码框架,统一了Top-K、Top-P等采样方法,并引入Best-of-K采样器提升多样本流程性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05154 2026-02-26 cs.CL cs.AI cs.IR 62%

Resisting Contextual Interference in RAG via Parametric-Knowledge Reinforcement

通过参数知识强化来抵御RAG中的上下文干扰

Chenyu Lin, Yilin Wen, Du Su, Hexiang Tan, Fei Sun, Muhan Chen, Chenfu Bao, Zhonghou Lyu

机构 * Baidu Inc.(百度公司) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Knowledgeable-R1通过参数知识强化提升RAG在知识冲突和一般场景中的鲁棒性与推理准确性,反事实场景中表现优于现有基线。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13551 2026-02-26 cs.CL 57%

Small Reward Models via Backward Inference

通过反向推理的小奖励模型

Yike Wang, Faeze Brahman, Shangbin Feng, Teng Xiao, Hannaneh Hajishirzi, Yulia Tsvetkov

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 FLIP通过反向推理实现无需参考和评分标准的奖励建模,在多个领域中显著提升性能并增强鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13667 2026-02-26 cs.RO 50%

Adaptive Diffusion Constrained Sampling for Bimanual Robot Manipulation

自适应扩散约束采样用于双臂机器人操作

Haolei Tong, Yuezhe Zhang, Sophie Lueth, Georgia Chalvatzaki

机构 * TU Darmstadt(图宾根大学) Robotics Institute Germany(德国机器人研究所)

专题命中 测试时计算 :planning(abstract)

AI总结 本文提出自适应扩散约束采样方法,通过整合等式和不等式约束,提升双臂机器人操作的样本多样性和泛化能力。

Comments Accepted by IEEE International Conference on Robotics and Automation 2026(ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 复杂问题求解 11 篇

2506.13793 2026-02-26 cs.AI 83%

Med-REFL: Medical Reasoning Enhancement via Self-Corrected Fine-grained Reflection

Med-REFL: 通过自我校正的细粒度反思增强医疗推理

Zongxian Yang, Jiayu Qian, Zegao Peng, Haoyu Zhang, Yu-An Huang, KC Tan, Zhi-An Huang

机构 * City University of Hong Kong (Dongguan), China(香港城市大学(东莞)) Northwestern Polytechnical University, China(西北工业大学) The Hong Kong Polytechnic University, China(香港理工大学)

专题命中 复杂问题求解 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

AI总结 Med-REFL通过自我校正的细粒度反思提升医疗推理,有效解决验证瓶颈,提升模型性能并拓展至其他领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21496 2026-02-26 cs.AI 79%

Beyond Refusal: Probing the Limits of Agentic Self-Correction for Semantic Sensitive Information

超越拒绝:探求代理自我校正对语义敏感信息的极限

Umid Suleymanov, Zaur Rajabov, Emil Mirzazada, Murat Kantarcioglu

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工大学计算机科学系) School of IT and Engineering, ADA University(ADA大学信息科技与工程学院)

专题命中 复杂问题求解 :self-correction(title);reasoning(abstract);分类 cs.AI

AI总结 本文提出SemSIEdit框架,通过代理代理迭代批评和重写敏感信息,减少泄露并平衡隐私与效用,揭示规模依赖的安全分歧和推理悖论。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21087 2026-02-26 cs.CV 78%

MIRA: Multimodal Iterative Reasoning Agent for Image Editing

MIRA: 多模态迭代推理代理用于图像编辑

Ziyun Zeng, Hang Hua, Jiebo Luo

机构 * University of Rochester(罗切斯特大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 MIRA通过多模态迭代推理代理提升图像编辑的语义一致性和感知质量,结合自研数据集和训练流程,实现与专有系统相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21857 2026-02-26 cs.AI cs.CL cs.LG 75%

Distill and Align Decomposition for Enhanced Claim Verification

分解与对齐:提升声明验证的Distill和Align分解

Jabez Magomere, Elena Kochkina, Samuel Mensah, Simerjot Kaur, Fernando Acero, Arturo Oncevay, Charese H. Smiley, Xiaomo Liu, Manuela Veloso

专题命中 复杂问题求解 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种基于强化学习的分解与对齐方法,通过优化分解质量和验证器对齐,提升声明验证性能,达到71.75%的宏F1,优于现有方法。

Comments EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14697 2026-02-26 cs.AI cs.LG 62%

Evolutionary System Prompt Learning for Reinforcement Learning in LLMs

强化学习中大语言模型的进化系统提示学习

Lunjun Zhang, Ryan Chen, Bradly C. Stadie

机构 * Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Department of Statistics(统计学系) Data Science, Northwestern University(数据科学,西北大学) Bridgewater AIA Labs(布里奇沃特AIA实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 E-SPL通过结合强化学习和系统提示进化,提升大语言模型在推理和智能任务中的性能。

Comments 39 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03255 2026-02-26 cs.LG cs.AI 62%

SciTS: Scientific Time Series Understanding and Generation with LLMs

SciTS: 基于大语言模型的科学时间序列理解与生成

Wen Wu, Ziyang Zhang, Liwei Liu, Xuenan Xu, Jimin Zhuang, Ke Fan, Qitan Lv, Junlin Liu, Chen Zhang, Zheqi Yuan, Siyuan Hou, Tianyi Lin, Kai Chen, Bowen Zhou, Chao Zhang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学) University of Science and Technology of China(中国科学技术大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 SciTS提出了一种基于LLM的科学时间序列理解与生成框架,通过基准测试发现通用LLM在泛化能力上优于专门模型,并引入TimeOmni框架提升性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21611 2026-02-26 cs.SE cs.AI 57%

Structurally Aligned Subtask-Level Memory for Software Engineering Agents

结构对齐的子任务级记忆用于软件工程代理

Kangning Shen, Jingyuan Zhang, Chenxi Sun, Wencong Zeng, Yang Yue

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出结构对齐的子任务级记忆方法,通过与代理功能分解对齐来提升软件工程代理的长周期推理能力,实验表明在多种backbone上均优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21351 2026-02-26 cs.AI cs.IR cs.MA 57%

A Hierarchical Multi-Agent System for Autonomous Discovery in Geoscientific Data Archives

面向地质数据档案的分层多智能体系统

Dmitrii Pantiukhin, Ivan Kuznetsov, Boris Shapkin, Antonia Anna Jost, Thomas Jung, Nikolay Koldunov

机构 * Alfred Wegener Institute for Polar and Marine Research(阿尔弗雷德·韦格ener极地和海洋研究所)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI

AI总结 PANGAEA-GPT通过分层多智能体框架实现地质数据自动发现与分析,具备复杂工作流执行能力,减少人工干预。

Comments 20 pages, 6 figures, 7 tables, supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00024 2026-02-26 cs.SI cs.AI 57%

EpidemIQs: Prompt-to-Paper LLM Agents for Epidemic Modeling and Analysis

EpidemIQs: 用于流行病建模与分析的提示到论文LLM代理

Mohammad Hossein Samaei, Faryad Darabi Sahneh, Lee W. Cohnstaedt, Caterina Scoglio

机构 * Department of Electrical and Computer Engineering, Kansas State University(电气与计算机工程系,堪萨斯州立大学)

专题命中 复杂问题求解 :planning(abstract);分类 cs.AI

AI总结 EpidemIQs是一种多代理LLM框架,通过五个阶段实现流行病建模与分析的自动化,利用科学家代理和任务专家代理提高效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18952 2026-02-26 eess.AS 50%

MDM-ASR: Bridging Accuracy and Efficiency in ASR with Diffusion-Based Non-Autoregressive Decoding

MDM-ASR:基于扩散模型的非自回归解码在ASR中实现准确性和效率的平衡

Hao Yen, Pin-Jui Ku, Ante Jukić, Sabato Marco Siniscalchi

专题命中 复杂问题求解 :self-correction(abstract)

AI总结 MDM-ASR通过基于扩散模型的非自回归解码框架,在保持并行解码效率的同时,提升了ASR的准确性和性能。

Comments 10 pages, submitted to Interspeech 2026 Long Paper track

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.13126 2026-02-26 cs.CY 50%

Generative agents in the streets: Exploring the use of Large Language Models (LLMs) in collecting urban perceptions

街道中的生成代理:探索大型语言模型(LLMs)在收集城市感知中的应用

Deepank Verma, Olaf Mumm, Vanessa Miriam Carlow

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本研究利用生成代理探索大型语言模型在模拟城市环境中人类行为中的应用,通过街景图像交互和感知评估提升AI在城市感知中的能力。

Comments 30 Pages, 15 Figures, Submitted in a Journal for Peer review

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理评测 22 篇

2602.21786 2026-02-26 cs.CL 92%

D-COT: Disciplined Chain-of-Thought Learning for Efficient Reasoning in Small Language Models

D-COT:为小语言模型高效推理的纪律性推理学习

Shunsuke Ubukata

机构 * Shunsuke Ubukata(独立研究者)

专题命中 推理评测 :CoT(title,abstract);reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL

AI总结 D-CoT通过引入控制标签强制结构化推理,提升小语言模型在推理任务中的性能并减少计算成本。

Comments 9 pages, 3 figures. Code: https://github.com/gitpullpull/DisciplinedChainOfThought | Benchmarks: https://huggingface.co/datasets/gitpullpull/D-CoT-Benchmarks | Dataset: https://huggingface.co/datasets/gitpullpull/D-CoT-datasets

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21346 2026-02-26 cs.CL cs.AI 86%

Alignment-Weighted DPO: A principled reasoning approach to improve safety alignment

基于对齐的DPO:一种原则性的推理方法以提高安全性对齐

Mengxuan Hu, Vivek V. Datla, Anoop Kumar, Zihan Guan, Sheng Li, Alfy Samuel, Daben Liu

机构 * University of Virginia(弗吉尼亚大学) Capital One

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于对齐的DPO方法,通过引入推理意识的后训练和对齐加权机制,提升大语言模型的安全性对齐鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21226 2026-02-26 cs.CL cs.AI 81%

IslamicLegalBench: Evaluating LLMs Knowledge and Reasoning of Islamic Law Across 1,200 Years of Islamic Pluralist Legal Traditions

伊斯兰法律基准:评估LLMs在1200年伊斯兰多元法律传统中的知识和推理能力

Ezieddin Elmahjub, Junaid Qadir, Abdullah Mushtaq, Rafay Naeem, Ibrahim Ghaznavi, Waleed Iqbal

机构 * Qatar University(卡塔尔大学) Information Technology University(信息技术大学) Northeastern University(东北大学) Queen Mary University of London(伦敦女王学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 伊斯兰法律基准评估LLMs在伊斯兰法推理中的能力,揭示其在复杂任务中存在显著缺陷,强调基础知识缺失对AI性能的影响。

Comments This manuscript has been submitted for review to Artificial Intelligence \& Law

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06899 2026-02-26 cs.CL cs.AI 81%

RPTS: Tree-Structured Reasoning Process Scoring for Faithful Multimodal Evaluation

RPTS: 基于树结构的推理过程评分用于忠实多模态评估

Haofeng Wang, Yu Zhang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 RPTS提出了一种基于树结构的评分方法,用于评估多模态推理过程的忠实度,通过构建推理树和动态权重调整,揭示模型推理中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21779 2026-02-26 cs.CV cs.AI 79%

Beyond Static Artifacts: A Forensic Benchmark for Video Deepfake Reasoning in Vision Language Models

超越静态伪影:一种用于视觉语言模型中视频深度伪造推理的取证基准

Zheyuan Gu, Qingsong Zhao, Yusong Wang, Zhaohong Huang, Xinqi Li, Cheng Yuan, Jiaowei Shao, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence, China Telecom (TeleAI)(人工智能研究院,中国电信(TeleAI)) Peking University(北京大学) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出FAQ基准,通过多选任务提升视觉语言模型对视频深度伪造的时间推理能力,并通过实验验证其有效性。

Comments 16 pages, 9 figures. Submitted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏