arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-16 至 2025-12-16 共收录 94 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 17 篇

2512.12154 2025-12-16 cs.CR cs.LG 57%

Keep the Lights On, Keep the Lengths in Check: Plug-In Adversarial Detection for Time-Series LLMs in Energy Forecasting

保持灯光亮起,保持长度在控制中:用于能源预测时间序列LLM的插件对抗检测

Hua Ma, Ruoxi Sun, Minhui Xue, Xingliang Yuan, Carsten Rudolph, Surya Nepal, Ling Liu

机构 * The University of Melbourne, Australia(墨尔本大学) Monash University, Australia(莫纳什大学) Georgia Institute of Technology, United States(佐治亚理工学院)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出一种用于时间序列LLM的插件对抗检测方法,通过采样诱导的分歧检测对抗性示例,提升能源预测的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11984 2025-12-16 cs.SE cs.AI 57%

Evidence-Driven Decision Support for AI Model Selection in Research Software Engineering

基于证据的AI模型选择决策支持:研究软件工程中的AI模型选择

Alireza Joonbakhsh, Alireza Rostami, AmirMohammad Kamalinia, Ali Nazeri, Farshad Khunjush, Bedir Tekinerdogan, Siamak Farshidi

机构 * organization= Department of Computer Science Engineering, Shiraz University , city= Shiraz , country= Iran organization= Wageningen University \& Research , city= Wageningen , country= The Netherlands

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ModelSelect框架,通过多准则决策方法支持AI模型选择,提升科研软件决策的透明性和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11943 2025-12-16 cs.MA cs.AI econ.GN q-fin.EC 57%

How AI Agents Follow the Herd of AI? Network Effects, History, and Machine Optimism

AI代理如何跟随AI的群体?网络效应、历史与机器乐观

Yu Liu, Wenwen Li, Yifan Dou, Guangnan Ye

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究探讨AI代理在网络效应游戏中的决策行为,发现历史数据对LLM推理有显著影响,揭示了AI系统中均衡结果受历史塑造而非单纯激励驱动的特性。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13380 2025-12-16 cs.RO 50%

Universal Dexterous Functional Grasping via Demonstration-Editing Reinforcement Learning

通过演示编辑强化学习实现通用灵巧功能抓取

Chuan Mao, Haoqi Yuan, Ziye Huang, Chaoyi Xu, Kai Ma, Zongqing Lu

机构 * Peking University(北京大学) BeingBeyond

专题命中 规划推理 :planning(abstract)

AI总结 本研究提出DemoFunGrasp,通过演示编辑强化学习实现通用灵巧功能抓取,提升抓取性能和现实泛化能力。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12246 2025-12-16 cs.CV 50%

Moment and Highlight Detection via MLLM Frame Segmentation

通过MLLM帧分割进行时刻和亮点检测

I Putu Andika Bagas Jiwanta, Ayu Purwarianti

机构 * School of Electrical Engineering and Informatics(电气工程与信息学院) Institut Teknologi Bandung(万隆技术大学)

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出通过MLLM帧分割实现视频时刻和亮点检测,利用分割损失与因果LM损失结合,提升检测精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 7 篇

2512.12622 2025-12-16 cs.CV cs.RO 87%

D3D-VLP: Dynamic 3D Vision-Language-Planning Model for Embodied Grounding and Navigation

D3D-VLP:动态3D视觉-语言-规划模型用于具身接地与导航

Zihan Wang, Seungjun Lee, Guangzhao Dai, Gim Hee Lee

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) Nanjing University of Science and Technology(南京理工大学)

专题命中 视觉空间推理 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 D3D-VLP通过动态3D链式思维和协同学习策略,实现具身接地与导航的高效统一,提升多任务导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20164 2025-12-16 cs.CL 85%

Thinking with Visual Abstract: Enhancing Multimodal Reasoning via Visual Abstraction

通过视觉抽象思考:通过视觉抽象增强多模态推理

Dairu Liu, Ziyue Wang, Minyuan Ruan, Fuwen Luo, Chi Chen, Peng Li, Yang Liu

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 通过引入视觉抽象思考范式,提升多模态大语言模型在视觉感知和推理任务中的性能,实现更高效的视觉推理机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12395 2025-12-16 cs.CV 67%

ArtGen: Conditional Generative Modeling of Articulated Objects in Arbitrary Part-Level States

ArtGen: 条件生成建模任意部分级状态的关节物体

Haowen Wang, Xiaoping Yuan, Fugang Zhang, Rui Jian, Yuanwei Zhu, Xiuquan Qiao, Yakun Huang

机构 * Anhui University(安徽大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 ArtGen通过条件扩散框架生成任意部分级状态的关节3D物体,采用跨状态采样和思维链推理模块,提升运动学一致性与结构先验推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12822 2025-12-16 cs.CV cs.AI 57%

Lemon: A Unified and Scalable 3D Multimodal Model for Universal Spatial Understanding

Lemon:一种统一且可扩展的3D多模态模型用于通用空间理解

Yongyuan Liang, Xiyao Wang, Yuanchen Ju, Jianwei Yang, Furong Huang

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 Lemon提出一种统一的Transformer架构,通过联合处理3D点云块和语言标记,实现空间-语言融合,提升3D多模态模型的可扩展性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13250 2025-12-16 cs.CV 50%

Toward Ambulatory Vision: Learning Visually-Grounded Active View Selection

迈向便携视觉:基于视觉的主动视角选择

Juil Koo, Daehyeon Choi, Sangwoo Youn, Phillip Y. Lee, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出基于视觉的主动视角选择方法,通过仅利用当前图像中的视觉信息来选择最有信息量的视角,从而提升视觉问答的性能和泛化能力。

Comments Project page: https://active-view-selection.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13015 2025-12-16 cs.CV 50%

What Happens Next? Next Scene Prediction with a Unified Video Model

接下来会发生什么?一种统一的视频模型用于下一场景预测

Xinjie Li, Zhimin Chen, Rui Zhao, Florian Schiffers, Zhenyu Liao, Vimal Bhat

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Amazon(亚马逊)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出Next Scene Prediction任务,通过联合框架结合Qwen-VL和LTX,利用预训练、监督微调和强化学习提升视频模型的时间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18734 2025-12-16 cs.RO 50%

Learning Obstacle Avoidance using Double DQN for Quadcopter Navigation

使用双DQN学习避障以实现四旋翼导航

Nishant Doshi, Amey Sutavani, Sanket Gujar

机构 * Worcester Polytechnic Institute(沃斯特理工学院)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出使用双DQN算法,通过深度相机实现四旋翼机器人在模拟城市环境中的避障导航学习。

Comments Fixed typo in second author's name throughout the paper

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 5 篇

2506.13059 2025-12-16 cs.CL cs.LG 84%

Multipole Attention for Efficient Long Context Reasoning

多重注意力机制用于高效长上下文推理

Coleman Hooper, Sebastian Zhao, Luca Manolache, Sehoon Kim, Michael W. Mahoney, Yakun Sophia Shao, Kurt Keutzer, Amir Gholami

机构 * University of California, Berkeley(加州大学伯克利分校) ICSI LBNL(劳伦斯伯克利国家实验室)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 多重注意力机制通过精确计算重要标记的注意力并近似其余标记,提升长上下文推理效率。

Comments 15 pages

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12967 2025-12-16 cs.CL 79%

QwenLong-L1.5: Post-Training Recipe for Long-Context Reasoning and Memory Management

QwenLong-L1.5: 长上下文推理与内存管理的训练配方

Weizhou Shen, Ziyi Yang, Chenliang Li, Zhiyuan Lu, Miao Peng, Huashan Sun, Yingcheng Shi, Shengyi Liao, Shaopeng Lai, Bo Zhang, Dayiheng Liu, Fei Huang, Jingren Zhou, Ming Yan

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 QwenLong-L1.5通过长上下文数据合成、稳定强化学习和内存增强架构,提升长上下文推理能力及超长任务处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12042 2025-12-16 cs.CL 70%

Benchmarking Contextual Understanding for In-Car Conversational Systems

车载对话系统上下文理解评估

Philipp Habicht, Lev Sorokin, Abdullah Saydemir, Ken E. Friedl, Andrea Stocco

机构 * Humboldt University of Berlin(柏林洪堡大学) Technical University of Munich(慕尼黑技术大学)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文通过LLM和提示技术评估车载对话系统上下文理解,发现非推理模型在成本效率上表现最佳,DeepSeek-R1达到高F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13276 2025-12-16 cs.CV 50%

CogniEdit: Dense Gradient Flow Optimization for Fine-Grained Image Editing

CogniEdit: 密集梯度流优化用于细粒度图像编辑

Yan Li, Lin Liu, Xiaopeng Zhang, Wei Xue, Wenhan Luo, Yike Guo, Qi Tian

机构 * Hongkong University of Science and Technology(香港科学与技术大学) Huawei Company(华为公司)

专题命中 测试时计算 :reasoning(abstract)

AI总结 CogniEdit通过密集梯度流优化实现细粒度图像编辑,结合多模态推理与动态令牌焦点重新定位,提升指令遵循与视觉质量的平衡

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12196 2025-12-16 cs.MM cs.CV cs.SD eess.AS 50%

AutoMV: An Automatic Multi-Agent System for Music Video Generation

AutoMV: 一种自动多智能体系统用于音乐视频生成

Xiaoxuan Tang, Xinping Lei, Chaoran Zhu, Shiyun Chen, Ruibin Yuan, Yizhi Li, Changjae Oh, Ge Zhang, Wenhao Huang, Emmanouil Benetos, Yang Liu, Jiaheng Liu, Yinghao Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanjing University(南京大学) Queen Mary University of London(伦敦大学女王学院) Hong Kong University of Science and Technology(香港科技大学) University of Manchester(曼彻斯特大学)

专题命中 测试时计算 :verifier(abstract)

AI总结 AutoMV通过多智能体协作生成完整音乐视频,优于现有方法并接近专业水准。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 9 篇

2512.12777 2025-12-16 cs.CL cs.AI 81%

State over Tokens: Characterizing the Role of Reasoning Tokens

令牌上的状态:阐明推理令牌的作用

Mosh Levy, Zohar Elyoseph, Shauli Ravfogel, Yoav Goldberg

机构 * Bar-Ilan University(巴伊兰大学) University of Haifa(海法大学) New York University(纽约大学) Allen Institute for AI(人工智能研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SoT框架,将LLM的推理令牌视为外部化计算状态,而非文本叙述,以揭示其实际推理机制及未被关注的研究问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12008 2025-12-16 cs.CL cs.AI cs.PF 81%

Hold Onto That Thought: Assessing KV Cache Compression On Reasoning

Hold Onto That Thought: 评估KV缓存压缩在推理中的表现

Minghui Liu, Aadi Palnitkar, Tahseen Rabbani, Hyunwoo Jae, Kyle Rui Sang, Dixi Yao, Shayan Shabihi, Fuheng Zhao, Tian Li, Ce Zhang, Furong Huang, Kunpeng Zhang

机构 * University of Maryland(马里兰大学) University of Chicago(芝加哥大学) University of Utah(犹他大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了多种KV缓存压缩策略在长推理任务中的表现,发现H2O和改进的SnapKV在推理模型中表现优异,揭示了重 hitter 跟踪的有效性及缓存大小与推理成本的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08768 2025-12-16 cs.CL 79%

AraReasoner: Evaluating Reasoning-Based LLMs for Arabic NLP

AraReasoner: 评估基于推理的LLM在阿拉伯语NLP中的表现

Ahmed Hasanaath, Aisha Alansari, Ahmed Ashraf, Chafik Salmane, Hamzah Luqman, Saad Ezzini

机构 * King Fahd University of Petroleum and Minerals(国王法赫德石油和矿物大学) SDAIA–KFUPM Joint Research Center for Artificial Intelligence(SDAIA-KFUPM人工智能联合研究中心) Mohammed VI Polytechnic University(穆莱·易卜拉欣(polytechnic)大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 AraReasoner评估基于推理的LLM在阿拉伯语NLP中的表现,发现通过精心选择示例可显著提升分类任务性能,DeepSeek在复杂推理任务中表现优于GPT基线,LoRA微调进一步提升F1和BLEU分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12818 2025-12-16 cs.CL cs.AI cs.IR cs.LG 67%

Hindsight is 20/20: Building Agent Memory that Retains, Recalls, and Reflects

事后诸葛亮:构建具有保留、回忆和反思能力的智能体记忆

Chris Latimer, Nicoló Boschi, Andrew Neeser, Chris Bartholomew, Gaurav Srivastava, Xuan Wang, Naren Ramakrishnan

机构 * The Washington Post(华盛顿邮报) Virginia Tech(弗吉尼亚理工大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Hindsight通过结构化内存架构提升智能体在长对话中的记忆与推理能力,显著提高多会话和开放领域问题的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23661 2025-12-16 cs.CV 67%

LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training

LLaVA-OneVision-1.5:面向民主化多模态训练的完全开放框架

Xiang An, Yin Xie, Kaicheng Yang, Wenkang Zhang, Xiuwei Zhao, Zheng Cheng, Yirui Wang, Songcen Xu, Changrui Chen, Didi Zhu, Chunsheng Wu, Huajie Tan, Chunyuan Li, Jing Yang, Jie Yu, Xiyao Wang, Bin Qin, Yumeng Wang, Zizhen Yan, Ziyong Feng, Ziwei Liu, Bo Li, Jiankang Deng

机构 * LLaVA-OneVision Community Contributors(LLaVA-OneVision社区贡献者)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract)

AI总结 LLaVA-OneVision-1.5通过开放框架和高效训练方法实现了多模态模型的低成本高性能训练。

Comments LLaVA-OneVision-1.5 Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23188 2025-12-16 cs.CL 57%

Diagnose, Localize, Align: A Full-Stack Framework for Reliable LLM Multi-Agent Systems under Instruction Conflicts

诊断、定位、对齐:一种用于在指令冲突下可靠LLM多智能体系统的全栈框架

Guancheng Wan, Leixin Sun, Longxu Dou, Zitong Shi, Fang Wu, Eric Hanchen Jiang, Wenke Huang, Guibin Zhang, Hejia Geng, Xiangru Tang, Zhenfei Yin, Yizhou Sun, Wei Wang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Sea AI Lab(Sea AI 实验室) Stanford University(斯坦福大学) University of Oxford(牛津大学) Yale University(耶鲁大学) NTU(南洋理工大学) NUS(新加坡国立大学) Boston University(波士顿大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种全栈框架,通过诊断、定位和对齐三个阶段提升LLM多智能体系统在指令冲突下的可靠性。

Comments Upon further review, we realized that the version submitted to arXiv was not the final draft and omits crucial results and discussion. To avoid confusion and ensure the integrity of the record, we request withdrawal and will resubmit once the complete work is ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14029 2025-12-16 cs.CL 57%

Beyond Pass@1: Self-Play with Variational Problem Synthesis Sustains RLVR

超越Pass@1:基于变分问题合成的自我博弈维持RLVR

Xiao Liang, Zhongzhi Li, Yeyun Gong, Yelong Shen, Ying Nian Wu, Zhijiang Guo, Weizhu Chen

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出基于变分问题合成的自我博弈策略,有效维持RLVR训练中的策略熵,显著提升Pass@k性能,在多个基准测试中取得绝对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12957 2025-12-16 cs.DB cs.LO 50%

Database Research needs an Abstract Relational Query Language

数据库研究需要一种抽象关系查询语言

Wolfgang Gatterbauer, Diandre Miguel Sabale

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出了一种抽象关系查询语言(ARQL),旨在通过分离查询意图与语法,提供统一的语义框架,以支持机器生成查询与人类验证调试的交互需求。

Comments CIDR 2026. 16th Annual Conference on Innovative Data Systems Research (CIDR '26). January 18-21, 2026, Chaminade, USA. 16 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12707 2025-12-16 cs.CY 50%

From Linear Risk to Emergent Harm: Complexity as the Missing Core of AI Governance

从线性风险到涌现危害:复杂性作为AI治理的缺失核心

Hugo Roger Paz

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出基于复杂性的AI治理框架,强调通过动态系统映射和因果推理应对AI治理中的不确定性与涌现危害。

Comments White Paper / Policy Brief (Working Paper). Published version available at: https://doi.org/10.5281/zenodo.17929014

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理评测 27 篇

2508.01700 2025-12-16 cs.AI 85%

DeepVIS: Bridging Natural Language and Data Visualization Through Step-wise Reasoning

DeepVIS: 通过分步推理连接自然语言与数据可视化

Zhihao Shuai, Boyan Li, Siyu Yan, Yuyu Luo, Weikai Yang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 DeepVIS通过整合分步推理提升自然语言到可视化的质量,提供透明的推理过程以增强用户理解与调整能力。

Comments IEEE VIS 2025 full paper

Journal ref IEEE Transactions on Visualization and Computer Graphics, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21320 2025-12-16 cs.CL 83%

SciReasoner: Laying the Scientific Reasoning Ground Across Disciplines

SciReasoner: 跨学科的科学推理基础

Yizhou Wang, Chen Tang, Han Deng, Jiabei Xiao, Jiaqi Liu, Jianyu Wu, Jun Yao, Pengze Li, Encheng Su, Lintao Wang, Guohang Zhuang, Yuchen Ren, Ben Fei, Ming Hu, Xin Chen, Dongzhan Zhou, Junjun He, Xiangyu Yue, Zhenfei Yin, Jiamin Wu, Qihao Zheng, Yuhao Zhou, Huihui Xu, Chenglong Ma, Yan Lu, Wenlong Zhang, Chunfeng Song, Philip Torr, Shixiang Tang, Xinzhu Ma, Wanli Ouyang, Lei Bai

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 SciReasoner通过跨学科学习提升科学推理能力,支持多种任务,增强跨领域泛化和准确性。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11830 2025-12-16 cs.LG cs.AI 81%

CR3G: Causal Reasoning for Patient-Centric Explanations in Radiology Report Generation

CR3G:用于放射学报告生成的患者导向因果推理

Satyam Kumar

机构 * IIT Bombay(博伊斯大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 CR3G通过因果推理提升放射学报告生成的解释能力,增强AI诊断的可信度和实用性。

Comments 8 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10576 2025-12-16 cs.CV 78%

HumanSense: From Multimodal Perception to Empathetic Context-Aware Responses through Reasoning MLLMs

HumanSense: 从多模态感知到通过推理的 empathetic 上下文感知响应

Zheng Qin, Ruobing Zheng, Yabing Wang, Tianqi Li, Yi Yuan, Jingdong Chen, Le Wang

专题命中 推理评测 :reasoning(title,abstract)

AI总结 HumanSense通过多阶段模态渐进强化学习提升MLLMs在多模态感知和交互任务中的性能,强调推理能力对共情反馈的重要性。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏