arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-09 至 2025-12-09 共收录 123 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 25 篇

2512.04416 2025-12-09 cs.AI cs.SE 57%

DataGovBench: Benchmarking LLM Agents for Real-World Data Governance Workflows

DataGovBench: 为现实世界数据治理工作流程评估LLM代理

Zhou Liu, Zhaoyang Han, Guochen Yan, Hao Liang, Bohan Zeng, Xing Chen, Yuanfeng Song, Wentao Zhang

机构 * Peking University(北京大学) ByteDance(字节跳动)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 DataGovBench通过150种现实任务评估LLM代理在数据治理中的表现,提出DataGovAgent框架提升复杂任务性能和调试效率。

Comments Equal contribution: Zhou Liu and Zhaoyang Han. Corresponding authors: Yuanfeng Song and Wentao Zhang

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10680 2025-12-09 cs.LG stat.ML 57%

LAD-BNet: Lag-Aware Dual-Branch Networks for Real-Time Energy Forecasting on Edge Devices

LAD-BNet:面向边缘设备实时能源预测的时滞感知双分支网络

Jean-Philippe Lignier

机构 * University of La Réunion(留尼旺大学) PIMENT Laboratory(PIMENT实验室) Physics and Mathematical Engineering for Energy, Environment and Building(能源、环境与建筑的物理与数学工程)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 LAD-BNet通过时滞感知双分支网络在边缘设备上实现高效的实时能源预测,提升预测精度并降低推断时间,适用于智能电网和建筑领域。

Comments 27 pages, in French language. 10 tables, 26 references. Submitted to Energy and AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07819 2025-12-09 cs.RO 50%

Efficient and Compliant Control Framework for Versatile Human-Humanoid Collaborative Transportation

高效且合规的协作运输人机协作控制框架

Shubham S. Kumbhar, Abhijeet M. Kulkarni, Panagiotis Artemiadis

专题命中 规划推理 :planning(abstract)

AI总结 本文提出了一种高效且合规的协作运输人机协作控制框架,通过交互线性倒立摆和动态可行步态计划实现人形机器人与人类的协同运输任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07001 2025-12-09 eess.SY cs.SY 50%

Synergies between AI Computing and Power Systems: Metrics, Scheduling, and Resilience

人工智能计算与电力系统之间的协同:指标、调度与韧性

Farzaneh Pourahmadi, Olivier Corradi, Pierre Pinson

专题命中 规划推理 :planning(abstract)

AI总结 本文提出通过标准化碳指标和协调架构,实现人工智能计算与电力系统之间的协同,提升调度效率和系统韧性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23255 2025-12-09 eess.SY cs.SY 50%

Iterative VCG-based Mechanism Fosters Cooperation in Multi-Regional Network Design

迭代基于VCG的机制促进多区域网络设计中的合作

Mingjia He, Yannik Werner, Andrea Censi, Emilio Frazzoli, Gioele Zardini

专题命中 规划推理 :planning(abstract)

AI总结 本文提出一种迭代基于VCG的机制,用于多区域网络设计,促进子网络运营商之间的合作,提升整体网络效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00843 2025-12-09 cs.CV 50%

VLM-Assisted Continual learning for Visual Question Answering in Self-Driving

基于视觉语言模型的持续学习用于自动驾驶中的视觉问答

Yuxin Lin, Mengshi Qi, Liang Liu, Huadong Ma

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出结合视觉语言模型与持续学习的方法,以提升自动驾驶中视觉问答系统的性能和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06674 2025-12-09 cs.CV 50%

RunawayEvil: Jailbreaking the Image-to-Video Generative Models

RunawayEvil: 对图像到视频生成模型的劫持

Songping Wang, Rufan Qian, Yueming Lyu, Qinglong Liu, Linzhuang Zou, Jie Qin, Songhua Liu, Caifeng Shan

机构 * PRLab, Nanjing University(南京大学PRLab) Meituan(美团) Shanghai Jiao Tong University(上海交通大学)

专题命中 规划推理 :planning(abstract)

AI总结 RunawayEvil是一种针对图像到视频生成模型的多模态劫持框架,通过自我进化机制实现动态攻击策略,显著提升攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06659 2025-12-09 cs.CR 50%

The Evolution of Agentic AI in Cybersecurity: From Single LLM Reasoners to Multi-Agent Systems and Autonomous Pipelines

代理AI在网络安全中的演变:从单一LLM推理者到多代理系统和自主流水线

Vaishali Vinay

专题命中 规划推理 :reasoning(abstract)

AI总结 本文探讨了网络安全中代理AI从单一LLM到多代理系统的发展,分析了五代分类法及各代在推理深度、工具使用等维度的差异,并总结了当前面临的挑战。

Comments Accepted at ICAIC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 14 篇

2512.07132 2025-12-09 cs.CL cs.AI cs.CV 81%

DART: Leveraging Multi-Agent Disagreement for Tool Recruitment in Multimodal Reasoning

利用多智能体分歧进行多模态推理中的工具招募

Nithin Sivakumaran, Justin Chih-Yao Chen, David Wan, Yue Zhang, Jaehong Yoon, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Nanyang Technological University(南洋理工大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 DART通过多智能体分歧识别有用视觉工具,提升多模态推理中的工具调用效果。

Comments Code: https://github.com/nsivaku/dart

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07092 2025-12-09 cs.LG cs.AI 81%

The Geometry of Persona: Disentangling Personality from Reasoning in Large Language Models

人格的几何学:从推理中分离人格特征于大型语言模型

Zhixiang Wang

机构 * Precision and Intelligence Medical Imaging Lab, Beijing Friendship Hospital, Capital Medical University(首都医科大学北京友谊医院精准与智能医学影像实验室)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Soul Engine框架,通过解耦人格特质于LLM推理,实现安全可控的人格个性化。

Comments 10 pages, 3 figures, 1 table. Code and dataset available at https://huggingface.co/Zx93/Soul-Engine-Qwen2.5-0.5B

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06759 2025-12-09 cs.CV cs.AI 79%

VisChainBench: A Benchmark for Multi-Turn, Multi-Image Visual Reasoning Beyond Language Priors

VisChainBench: 一个多轮多图视觉推理基准,超越语言先验

Wenbo Lyu, Yingjun Du, Jinglin Zhao, Xianton Zhen, Ling Shao

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 VisChainBench是一个多轮多图视觉推理基准,通过多代理生成流水线构建,旨在评估LVLM在连续、相互依赖任务中进行多步骤视觉推理的能力。

Comments 12 pages,13figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07733 2025-12-09 cs.CV 78%

SpatialDreamer: Incentivizing Spatial Reasoning via Active Mental Imagery

SpatialDreamer: 通过主动心理意象激励空间推理

Meng Cao, Xingyu Li, Xue Liu, Ian Reid, Xiaodan Liang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·宾·扎耶德人工智能大学) Sun Yat-sen University(孙中山大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 SpatialDreamer通过主动心理意象和几何策略优化,提升多模态大语言模型在复杂空间推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07203 2025-12-09 cs.CV 78%

MMRPT: MultiModal Reinforcement Pre-Training via Masked Vision-Dependent Reasoning

MMRPT:通过遮蔽视觉依赖推理的多模态强化预训练

Xuhui Zheng, Kang An, Ziliang Wang, Yuhang Wang, Faqiang Qian, Yichao Wu

机构 * SenseTime(秒速科技)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 MMRPT通过强化学习提升多模态预训练效果,利用视觉基础推理增强模型对视觉内容的理解能力。

Comments 7 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05853 2025-12-09 cs.CV 78%

VRSA: Jailbreaking Multimodal Large Language Models through Visual Reasoning Sequential Attack

通过视觉推理序列攻击对多模态大语言模型进行劫持

Shiji Zhao, Shukun Xiong, Yao Huang, Yan Jin, Zhenyu Wu, Jiyang Guan, Ranjie Duan, Jialing Tao, Hui Xue, Xingxing Wei

机构 * Alibaba Group(阿里巴巴集团) Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 VRSA通过视觉推理序列攻击方法,针对多模态大语言模型的视觉模态进行劫持,提升攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06131 2025-12-09 cs.RO 78%

LOG-Nav: Efficient Layout-Aware Object-Goal Navigation with Hierarchical Planning

LOG-Nav: 面向复杂多房间室内环境的高效布局感知物体目标导航方法

Jiawei Hou, Yuting Xiao, Xiangyang Xue, Taiping Zeng

专题命中 视觉空间推理 :planning(title,abstract)

AI总结 LOG-Nav通过层次化规划和大语言模型智能体实现高效布局感知导航,实验显示其在复杂室内环境中的导航成功率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07302 2025-12-09 cs.CV cs.AI 57%

Towards Accurate UAV Image Perception: Guiding Vision-Language Models with Stronger Task Prompts

迈向准确的无人机图像感知:通过更强的任务提示引导视觉-语言模型

Mingning Guo, Mengwei Wu, Shaoxian Li, Haifeng Li, Chao Tao

机构 * School of Geosciences and InfoPhysics, Central South University(地质科学与信息物理学院,中南大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 AerialVP通过增强任务提示提升无人机图像感知性能,引入AerialSense基准评估模型在复杂场景下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05524 2025-12-09 cs.CV 50%

VOST-SGG: VLM-Aided One-Stage Spatio-Temporal Scene Graph Generation

VOST-SGG:基于视觉语言模型的一阶段时空场景图生成

Chinthani Sugandhika, Chen Li, Deepu Rajan, Basura Fernando

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院) Institute of High-Performance Computing, Agency for Science, Technology and Research, Singapore(科学、技术与研究局高性能计算研究所) Centre for Frontier AI Research, Agency for Science, Technology and Research, Singapore(科学、技术与研究局前沿人工智能研究中心)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 VOST-SGG通过整合视觉语言模型的常识推理能力,提出了一种基于多模态特征和双源查询初始化的一阶段时空场景图生成方法,实现了对视频中对象及其关系的高效建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01821 2025-12-09 cs.CV 50%

Seeing through Imagination: Learning Scene Geometry via Implicit Spatial World Modeling

通过想象看见:通过隐式空间世界建模学习场景几何

Meng Cao, Haokun Lin, Haoyuan Li, Haoran Tang, Rongtao Xu, Dong An, Xue Liu, Ian Reid, Xiaodan Liang

机构 * MBZUAI SYSU(南方科技大学) PKU(北京大学) Spatialtemporal AI(时空人工智能)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出MILO和RePE,通过隐式空间世界建模提升多模态大语言模型的空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14555 2025-12-09 cs.CV 50%

Descrip3D: Enhancing Large Language Model-based 3D Scene Understanding with Object-Level Text Descriptions

Descrip3D: 通过物体级文本描述增强基于大语言模型的3D场景理解

Jintang Xue, Ganning Zhao, Jie-En Yao, Hong-En Chen, Yue Hu, Meida Chen, Suya You, C. -C. Jay Kuo

机构 * University of Southern California(南加州大学) DEVCOM Army Research Laboratory(国防部陆军研究实验室)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 Descrip3D通过引入物体级文本描述,提升大语言模型在3D场景理解中的关系推理能力,有效增强复杂室内场景的语义理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06424 2025-12-09 cs.CV 50%

DragMesh: Interactive 3D Generation Made Easy

DragMesh: 交互式3D生成变得容易

Tianshan Zhang, Zeyu Zhang, Hao Tang

机构 * School of Computer Science, Peking University(北京大学计算机学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 DragMesh通过解耦运动学推理和运动生成,实现实时交互式3D生成,无需重新训练即可在新对象上生成合理运动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06096 2025-12-09 cs.CV 50%

BeLLA: End-to-End Birds Eye View Large Language Assistant for Autonomous Driving

BeLLA:端到端的鸟瞰图大语言助手用于自动驾驶

Karthik Mohan, Sonam Singh, Amit Arvind Kale

机构 * UC San Diego(加州大学圣地亚哥分校) Robert Bosch Corporate Research India(博世印度公司研究)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 BeLLA通过端到端架构连接统一的360°鸟瞰图表示与大语言模型,提升自动驾驶中的空间推理和问答能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01946 2025-12-09 cs.CV 50%

3DRS: MLLMs Need 3D-Aware Representation Supervision for Scene Understanding

3DRS: MLLMs 需要 3D 意识表示监督以实现场景理解

Xiaohu Huang, Jingjing Wu, Qunyi Xie, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室) Department of Computer Vision Technology (VIS), Baidu Inc.(百度公司计算机视觉技术部)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 3DRS 通过引入预训练 3D 基础模型的监督,提升 MLLM 的 3D 表示能力,从而增强场景理解性能

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 3 篇

2504.16828 2025-12-09 cs.LG cs.AI cs.CL 86%

Process Reward Models That Think

能够思考的过程奖励模型

Muhammad Khalifa, Rishabh Agarwal, Lajanugen Logeswaran, Jaekyeom Kim, Hao Peng, Moontae Lee, Honglak Lee, Lu Wang

机构 * University of Michigan(密歇根大学) Mila LG AI Research(LG人工智能研究) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Equal supervision(共同监督)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);test-time compute(abstract)

AI总结 ThinkPRM通过生成长CoT验证链实现高效过程奖励模型,以更少的监督标签在多个基准测试中超越现有方法。

Comments Add new ablation and minor writing fixes

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07710 2025-12-09 cs.AI cs.LG 62%

Each Prompt Matters: Scaling Reinforcement Learning Without Wasting Rollouts on Hundred-Billion-Scale MoE

每个提示都重要:在百亿规模MoE上扩展强化学习而不浪费回放

Anxiang Zeng, Haibo Zhang, Hailing Zhang, Kaixiang Mo, Liang Yao, Ling Hu, Long Zhang, Shuman Liu, Shuyi Xie, Yanshi Li, Yizhang Chen, Yuepeng Sheng, Yuwei Huang, Zhaochen Xu, Zhiqiang Zhou, Ziqin Liew

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出了一种百亿规模MoE模型的强化学习方法,通过消除无效提示、优化重要性采样和提升回放效率,实现了高效稳定的训练流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06017 2025-12-09 cs.RO eess.IV 50%

Training-Free Robot Pose Estimation using Off-the-Shelf Foundational Models

无需训练的机器人姿态估计使用现成的基础模型

Laurence Liang

机构 * McGill University(麦吉尔大学)

专题命中 测试时计算 :verifier(abstract)

AI总结 本文提出利用现成的基础模型无需训练即可估计机器人关节角度,通过实验验证了模型性能基准及测试扩展对预测效果的影响。

Comments Accepted at CVIS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 17 篇

2512.01485 2025-12-09 cs.AI cs.LG 86%

Multi-Path Collaborative Reasoning via Reinforcement Learning

基于强化学习的多路径协作推理

Jindi Lv, Yuhao Zhou, Zheng Zhu, Xiaofeng Wang, Guan Huang, Jiancheng Lv

机构 * Sichuan University(四川大学) GigaAI Tsinghua University(清华大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 本文提出M3PO框架,通过多路径协作机制提升大语言模型的推理能力,实现更可靠和高效的多步推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07783 2025-12-09 cs.CL 79%

On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models

在预训练、中训练和强化学习对推理语言模型的相互作用中

Charlie Zhang, Graham Neubig, Xiang Yue

机构 * Carnegie Mellon University, Language Technologies Institute(卡内基梅隆大学,语言技术研究所)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 研究探讨了预训练、中训练和强化学习在推理语言模型中的相互作用,发现RL需预训练留有余地才能提升能力,中训练提升性能,过程级奖励提高推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06859 2025-12-09 cs.AI 79%

JT-DA: Enhancing Data Analysis with Tool-Integrated Table Reasoning Large Language Models

JT-DA:利用工具集成的表格推理大语言模型提升数据分析

Ce Chi, Xing Wang, Zhendong Wang, Xiaofan Liu, Ce Li, Zhiyan Song, Chen Zhao, Kexin Yang, Boshen Shi, Jingjing Yang, Chao Deng, Junlan Feng

机构 * Jiutian Research, China Mobile, Beijing, China(钧天研究,中国移动,北京)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 JT-DA-8B通过工具集成的表格推理方法,提升复杂表格分析任务的性能和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06835 2025-12-09 cs.AI 79%

Decouple to Generalize: Context-First Self-Evolving Learning for Data-Scarce Vision-Language Reasoning

解耦以泛化:面向数据稀缺的视觉语言推理的上下文优先自进化学习

Tingyu Li, Zheng Sun, Jingxuan Wei, Siyuan Li, Conghui He, Lijun Wu, Cheng Tan

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai JiaoTong University(上海交通大学) University of Chinese Academy of Sciences(中国科学院大学) Zhejiang University(浙江大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 DoGe通过双解耦框架,引导模型优先从上下文学习以提升数据稀缺下的视觉语言推理能力,提出两阶段RL方法和演进课程学习流水线,有效解决传统方法的奖励黑客问题。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07109 2025-12-09 cs.AI cs.CL cs.LG 78%

A Neural Affinity Framework for Abstract Reasoning: Diagnosing the Compositional Gap in Transformer Architectures via Procedural Task Taxonomy

一种神经亲和框架用于抽象推理:通过程序性任务分类诊断Transformer架构中的组合性缺口

Miguel Ingram, Arthur Joseph Merritt

专题命中 复杂问题求解 :reasoning(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种神经亲和框架,通过程序性任务分类诊断Transformer架构中的组合性缺口,揭示了任务与Transformer模型之间的神经亲和力差异。

Comments 62 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏