arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-09 至 2025-12-09 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 14 篇

2512.07132 2025-12-09 cs.CL cs.AI cs.CV 81%

DART: Leveraging Multi-Agent Disagreement for Tool Recruitment in Multimodal Reasoning

利用多智能体分歧进行多模态推理中的工具招募

Nithin Sivakumaran, Justin Chih-Yao Chen, David Wan, Yue Zhang, Jaehong Yoon, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Nanyang Technological University(南洋理工大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 DART通过多智能体分歧识别有用视觉工具,提升多模态推理中的工具调用效果。

Comments Code: https://github.com/nsivaku/dart

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07092 2025-12-09 cs.LG cs.AI 81%

The Geometry of Persona: Disentangling Personality from Reasoning in Large Language Models

人格的几何学:从推理中分离人格特征于大型语言模型

Zhixiang Wang

机构 * Precision and Intelligence Medical Imaging Lab, Beijing Friendship Hospital, Capital Medical University(首都医科大学北京友谊医院精准与智能医学影像实验室)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Soul Engine框架,通过解耦人格特质于LLM推理,实现安全可控的人格个性化。

Comments 10 pages, 3 figures, 1 table. Code and dataset available at https://huggingface.co/Zx93/Soul-Engine-Qwen2.5-0.5B

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06759 2025-12-09 cs.CV cs.AI 79%

VisChainBench: A Benchmark for Multi-Turn, Multi-Image Visual Reasoning Beyond Language Priors

VisChainBench: 一个多轮多图视觉推理基准,超越语言先验

Wenbo Lyu, Yingjun Du, Jinglin Zhao, Xianton Zhen, Ling Shao

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 VisChainBench是一个多轮多图视觉推理基准,通过多代理生成流水线构建,旨在评估LVLM在连续、相互依赖任务中进行多步骤视觉推理的能力。

Comments 12 pages,13figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07733 2025-12-09 cs.CV 78%

SpatialDreamer: Incentivizing Spatial Reasoning via Active Mental Imagery

SpatialDreamer: 通过主动心理意象激励空间推理

Meng Cao, Xingyu Li, Xue Liu, Ian Reid, Xiaodan Liang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·宾·扎耶德人工智能大学) Sun Yat-sen University(孙中山大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 SpatialDreamer通过主动心理意象和几何策略优化,提升多模态大语言模型在复杂空间推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07203 2025-12-09 cs.CV 78%

MMRPT: MultiModal Reinforcement Pre-Training via Masked Vision-Dependent Reasoning

MMRPT:通过遮蔽视觉依赖推理的多模态强化预训练

Xuhui Zheng, Kang An, Ziliang Wang, Yuhang Wang, Faqiang Qian, Yichao Wu

机构 * SenseTime(秒速科技)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 MMRPT通过强化学习提升多模态预训练效果,利用视觉基础推理增强模型对视觉内容的理解能力。

Comments 7 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05853 2025-12-09 cs.CV 78%

VRSA: Jailbreaking Multimodal Large Language Models through Visual Reasoning Sequential Attack

通过视觉推理序列攻击对多模态大语言模型进行劫持

Shiji Zhao, Shukun Xiong, Yao Huang, Yan Jin, Zhenyu Wu, Jiyang Guan, Ranjie Duan, Jialing Tao, Hui Xue, Xingxing Wei

机构 * Alibaba Group(阿里巴巴集团) Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 VRSA通过视觉推理序列攻击方法,针对多模态大语言模型的视觉模态进行劫持,提升攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06131 2025-12-09 cs.RO 78%

LOG-Nav: Efficient Layout-Aware Object-Goal Navigation with Hierarchical Planning

LOG-Nav: 面向复杂多房间室内环境的高效布局感知物体目标导航方法

Jiawei Hou, Yuting Xiao, Xiangyang Xue, Taiping Zeng

专题命中 视觉空间推理 :planning(title,abstract)

AI总结 LOG-Nav通过层次化规划和大语言模型智能体实现高效布局感知导航,实验显示其在复杂室内环境中的导航成功率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07302 2025-12-09 cs.CV cs.AI 57%

Towards Accurate UAV Image Perception: Guiding Vision-Language Models with Stronger Task Prompts

迈向准确的无人机图像感知:通过更强的任务提示引导视觉-语言模型

Mingning Guo, Mengwei Wu, Shaoxian Li, Haifeng Li, Chao Tao

机构 * School of Geosciences and InfoPhysics, Central South University(地质科学与信息物理学院,中南大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 AerialVP通过增强任务提示提升无人机图像感知性能,引入AerialSense基准评估模型在复杂场景下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05524 2025-12-09 cs.CV 50%

VOST-SGG: VLM-Aided One-Stage Spatio-Temporal Scene Graph Generation

VOST-SGG:基于视觉语言模型的一阶段时空场景图生成

Chinthani Sugandhika, Chen Li, Deepu Rajan, Basura Fernando

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院) Institute of High-Performance Computing, Agency for Science, Technology and Research, Singapore(科学、技术与研究局高性能计算研究所) Centre for Frontier AI Research, Agency for Science, Technology and Research, Singapore(科学、技术与研究局前沿人工智能研究中心)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 VOST-SGG通过整合视觉语言模型的常识推理能力,提出了一种基于多模态特征和双源查询初始化的一阶段时空场景图生成方法,实现了对视频中对象及其关系的高效建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01821 2025-12-09 cs.CV 50%

Seeing through Imagination: Learning Scene Geometry via Implicit Spatial World Modeling

通过想象看见:通过隐式空间世界建模学习场景几何

Meng Cao, Haokun Lin, Haoyuan Li, Haoran Tang, Rongtao Xu, Dong An, Xue Liu, Ian Reid, Xiaodan Liang

机构 * MBZUAI SYSU(南方科技大学) PKU(北京大学) Spatialtemporal AI(时空人工智能)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出MILO和RePE,通过隐式空间世界建模提升多模态大语言模型的空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14555 2025-12-09 cs.CV 50%

Descrip3D: Enhancing Large Language Model-based 3D Scene Understanding with Object-Level Text Descriptions

Descrip3D: 通过物体级文本描述增强基于大语言模型的3D场景理解

Jintang Xue, Ganning Zhao, Jie-En Yao, Hong-En Chen, Yue Hu, Meida Chen, Suya You, C. -C. Jay Kuo

机构 * University of Southern California(南加州大学) DEVCOM Army Research Laboratory(国防部陆军研究实验室)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 Descrip3D通过引入物体级文本描述,提升大语言模型在3D场景理解中的关系推理能力,有效增强复杂室内场景的语义理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06424 2025-12-09 cs.CV 50%

DragMesh: Interactive 3D Generation Made Easy

DragMesh: 交互式3D生成变得容易

Tianshan Zhang, Zeyu Zhang, Hao Tang

机构 * School of Computer Science, Peking University(北京大学计算机学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 DragMesh通过解耦运动学推理和运动生成,实现实时交互式3D生成,无需重新训练即可在新对象上生成合理运动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06096 2025-12-09 cs.CV 50%

BeLLA: End-to-End Birds Eye View Large Language Assistant for Autonomous Driving

BeLLA:端到端的鸟瞰图大语言助手用于自动驾驶

Karthik Mohan, Sonam Singh, Amit Arvind Kale

机构 * UC San Diego(加州大学圣地亚哥分校) Robert Bosch Corporate Research India(博世印度公司研究)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 BeLLA通过端到端架构连接统一的360°鸟瞰图表示与大语言模型,提升自动驾驶中的空间推理和问答能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01946 2025-12-09 cs.CV 50%

3DRS: MLLMs Need 3D-Aware Representation Supervision for Scene Understanding

3DRS: MLLMs 需要 3D 意识表示监督以实现场景理解

Xiaohu Huang, Jingjing Wu, Qunyi Xie, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室) Department of Computer Vision Technology (VIS), Baidu Inc.(百度公司计算机视觉技术部)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 3DRS 通过引入预训练 3D 基础模型的监督,提升 MLLM 的 3D 表示能力,从而增强场景理解性能

详情

展开后加载摘要…

URL PDF HTML 收藏