arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-23 至 2025-12-23 共收录 114 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 27 篇

2512.19453 2025-12-23 cs.RO 67%

MaP-AVR: A Meta-Action Planner for Agents Leveraging Vision Language Models and Retrieval-Augmented Generation

MaP-AVR: 一种利用视觉语言模型和检索增强生成的元动作规划器

Zhenglong Guo, Yiming Zhao, Feng Jiang, Heng Jin, Zongbao Feng, Jianbin Zhou, Siyuan Xu

机构 * Li Auto

专题命中 规划推理 :chain-of-thought(abstract);planning(abstract)

AI总结 MaP-AVR通过元动作规划和检索增强生成技术,提升机器人在复杂环境中的任务规划能力。

Comments 8 pages, 10 figures, This work was completed in December 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18254 2025-12-23 cs.CV 67%

Loom: Diffusion-Transformer for Interleaved Generation

Loom:用于交错生成的扩散-变压器

Mingcheng Ye, Jiaming Liu, Yiren Song

机构 * Beijing Institute of Technology(北京理工大学) National University of Singapore(新加坡国立大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 Loom通过统一的扩散-变压器框架实现交错生成,提供更高效和可控的长周期生成,优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11960 2025-12-23 cs.RO 67%

Human Centric General Physical Intelligence for Agile Manufacturing Automation

以人为中心的敏捷制造通用物理智能

Sandeep Kanta, Mehrdad Tavassoli, Varun Teja Chirkuri, Venkata Akhil Kumar, Santhi Bharath Punati, Praveen Damacharla, Sunny Katyara

机构 * Northeastern University(东北大学) Bmade Robotics(Bmade机器人)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 本文探讨了通过VLA模型实现通用物理智能在敏捷制造中的应用,系统回顾了最新进展并提出未来研究方向。

Comments Advanced Engineering Informatics

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18745 2025-12-23 cs.CV cs.CL cs.LG 62%

InSight-o3: Empowering Multimodal Foundation Models with Generalized Visual Search

InSight-o3: 通过通用视觉搜索增强多模态基础模型

Kaican Li, Lewei Yao, Jiannan Wu, Tiezheng Yu, Jierun Chen, Haoli Bai, Lu Hou, Lanqing Hong, Wei Zhang, Nevin L. Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学) Huawei(华为)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 InSight-o3通过通用视觉搜索任务提升多模态基础模型的推理能力,解决复杂视觉信息整合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14918 2025-12-23 cs.CL cs.LG stat.ML 62%

Reliable Decision Support with LLMs: A Framework for Evaluating Consistency in Binary Text Classification Applications

利用LLM实现可靠决策支持:一种评估二元文本分类应用一致性的框架

Fadel M. Megahed, Ying-Ju Chen, L. Allision Jones-Farmer, Younghwa Lee, Jiawei Brooke Wang, Inez M. Zwetsloot

机构 * Farmer School of Business, Miami University, Oxford, OH 45056, USA(迈阿密大学法默商学院) College of Arts and Sciences, University of Dayton, Dayton, OH 45469, USA(Dayton大学文理学院) Amsterdam Business School, University of Amsterdam, Amsterdam, The Netherlands(阿姆斯特丹大学阿姆斯特丹商学院)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种评估LLM在二元文本分类中一致性的框架,通过实验验证了不同模型在金融新闻分类中的性能,并提供了系统化的LLM选择和可靠性评估方法。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19475 2025-12-23 cs.CL 57%

A Large-Language-Model Framework for Automated Humanitarian Situation Reporting

为自动化人道主义局势报告设计的大型语言模型框架

Ivan Decostanzi, Yelena Mejova, Kyriaki Kalimeri

机构 * ISI Foundation(ISI基金会) UNICEF(联合国儿童基金会)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种基于大型语言模型的自动化框架,用于生成结构化、可解释且可操作的人道主义局势报告,通过多级评估和透明引用链接提高了报告的准确性和实用性。

Comments 18 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19234 2025-12-23 cs.AI 57%

DeliveryBench: Can Agents Earn Profit in Real World?

DeliveryBench: 代理在现实世界中能否获利?

Lingjun Mao, Jiawei Ren, Kun Zhou, Jixuan Chen, Ziqiao Ma, Lianhui Qin

机构 * University of California, San Diego(加州大学圣地亚哥分校) University of Michigan(密歇根大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 DeliveryBench通过模拟现实世界中的食品配送任务,评估基于VLM的具身代理在长期规划和约束管理方面的性能,发现其与人类存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18596 2025-12-23 cs.LG 57%

EIA-SEC: Improved Actor-Critic Framework for Multi-UAV Collaborative Control in Smart Agriculture

EIA-SEC:改进的Actor-Critic框架用于智能农业多无人机协同控制

Quanxi Zhou, Wencan Mao, Yilei Liang, Manabu Tsukada, Yunling Liu, Jon Crowcroft

机构 * The University of Tokyo(东京大学) National Institute of Informatics(国家信息研究所) The University of Cambridge(剑桥大学) China Agricultural University(中国农业大学)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 EIA-SEC框架通过精英模仿和共享批评机制,提升多无人机在智能农业中的协同控制性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18425 2025-12-23 cs.LG 57%

MoE Pathfinder: Trajectory-driven Expert Pruning

MoE路径规划者:轨迹驱动的专家剪枝

Xican Yang, Yuanhe Tian, Yan Song

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 MoE路径规划者通过轨迹驱动的专家剪枝方法,提升MoE模型的计算效率和部署性能。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18202 2025-12-23 cs.AI 57%

Sophia: A Persistent Agent Framework of Artificial Life

Sophia:人工智能生命的一种持久代理框架

Mingyang Sun, Feng Hong, Weinan Zhang

机构 * Westlake University(西湖大学) Shanghai Innovation Institute(上海创新研究院) Project Cuddlepark Team(Project Cuddlepark团队) Shanghai Jiao Tong University(上海交通大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 Sophia通过引入系统3,实现持久代理框架,使AI代理具备自我改进、身份连续性和透明行为解释能力,推动人工生命的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17913 2025-12-23 cs.DC cs.AI 57%

Byzantine Fault-Tolerant Multi-Agent System for Healthcare: A Gossip Protocol Approach to Secure Medical Message Propagation

容错多智能体系统在医疗中的应用:基于 gossip 协议的安全医疗信息传播方法

Nihir Chadderwala

机构 * Nihir Chadderwala(独立研究者)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出一种基于 gossip 协议的拜占庭容错多智能体系统,用于医疗领域,通过加密验证和共识协议保障信息安全与系统容错性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12399 2025-12-23 cs.AI 57%

A Survey of Vibe Coding with Large Language Models

基于大语言模型的Vibe编码调研

Yuyao Ge, Lingrui Mei, Zenghao Duan, Tianhao Li, Yujia Zheng, Yiwei Wang, Lexin Wang, Jiayu Yao, Tianyu Liu, Yujun Cai, Baolong Bi, Fangda Guo, Jiafeng Guo, Shenghua Liu, Xueqi Cheng

机构 * Institute of Computing Technology Chinese Academy of Sciences(中国科学院计算技术研究所) Duke University(杜克大学) University of California Merced(加州大学默塞德分校) Peking University(北京大学) University of Queensland(昆士兰大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文调研了基于大语言模型的Vibe编码方法,系统分析了其理论基础和五个开发模型,揭示了上下文工程与协作模式对成功的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09510 2025-12-23 cs.RO cs.CV 50%

ViTA-Seg: Vision Transformer for Amodal Segmentation in Robotics

ViTA-Seg:用于机器人抓取的视觉Transformer

Donato Caramia, Florian T. Pokorny, Giuseppe Triggiani, Denis Ruffino, David Naso, Paolo Roberto Massenio

机构 * Department of Electrical Learning (RPL), KTH Royal Institute of Technology, 114 28, Stockholm, Sweden, (e-mail: )

专题命中 规划推理 :planning(abstract)

AI总结 ViTA-Seg是一种用于机器人抓取的视觉Transformer框架,通过双头架构实现高效的无遮挡分割,提升机器人操作的实时性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04628 2025-12-23 cs.CE q-bio.QM 50%

Projecting Molecules into Synthesizable Chemical Spaces

将分子投影到可合成的化学空间

Shitong Luo, Wenhao Gao, Zuofan Wu, Jian Peng, Connor W. Coley, Jianzhu Ma

专题命中 规划推理 :planning(abstract)

AI总结 本文提出一种基于变压器的模型,通过后缀表示法生成可合成的化学结构,提升合成可及性和药物发现效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 11 篇

2512.07276 2025-12-23 cs.CV 82%

Geo3DVQA: Evaluating Vision-Language Models for 3D Geospatial Reasoning from Aerial Imagery

Geo3DVQA:基于航拍影像评估视觉-语言模型在三维地理空间推理中的表现

Mai Tsujimoto, Junjue Wang, Weihao Xuan, Naoto Yokoya

机构 * The University of Tokyo(东京大学) RIKEN AIP(日本理化学研究所AIP)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

AI总结 Geo3DVQA通过评估视觉-语言模型在三维地理空间推理中的表现,揭示了RGB影像在3D空间分析中的局限性,并展示了领域特定指令微调对模型性能的提升。

Comments Accepted at WACV 2026. 32 pages long including the appendix. Revision details are provided in the supplements

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19024 2025-12-23 cs.RO cs.AI 70%

IndoorUAV: Benchmarking Vision-Language UAV Navigation in Continuous Indoor Environments

IndoorUAV:在连续室内环境中进行视觉-语言无人机导航的基准测试

Xu Liu, Yu Liu, Hanshuo Qiu, Yang Qirong, Zhouhui Lian

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 IndoorUAV通过构建室内无人机视觉-语言导航基准,结合多模态推理和任务分解,为长视距和短视距导航提供高质量数据与模型支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15178 2025-12-23 cs.RO cs.AI cs.LG cs.SY eess.SY 62%

GUIDEd Agents: Enhancing Navigation Policies through Task-Specific Uncertainty Abstraction in Localization-Limited Environments

GUIDEd Agents: 通过在定位受限环境中任务特定的不确定性抽象增强导航策略

Gokul Puthumanaillam, Paulo Padrao, Jose Fuentes, Leonardo Bobadilla, Melkior Ornik

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Providence College(普罗维登斯学院) Florida International University(佛罗里达国际大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 GUIDE通过任务特定不确定性抽象提升机器人在定位受限环境中的导航策略,实现任务完成与不确定性管理的平衡。

Comments Accepted for publication at RAL (Robotics and automation letters). Updated with the final version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19609 2025-12-23 cs.CV cs.AI 57%

MapTrace: Scalable Data Generation for Route Tracing on Maps

MapTrace: 用于地图路线追踪的可扩展数据生成

Artemis Panagopoulou, Aveek Purohit, Achin Kulshrestha, Soroosh Yazdani, Mohit Goyal

机构 * Google XR(谷歌XR) University of Pennsylvania(宾夕法尼亚大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 MapTrace通过合成数据生成提升地图路线追踪性能,微调模型使成功率提升6.4个百分点,减少路径追踪误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06118 2025-12-23 cs.CV cs.AI 57%

ViGoR: Improving Visual Grounding of Large Vision Language Models with Fine-Grained Reward Modeling

ViGoR:通过细粒度奖励建模提升大视觉语言模型的视觉 grounding

Siming Yan, Min Bai, Weifeng Chen, Xiong Zhou, Qixing Huang, Li Erran Li

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) AWS AI(AWS人工智能)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 ViGoR通过细粒度奖励建模提升大视觉语言模型的视觉 grounding 能力,采用更经济的人类评估和自动化方法,有效提高视觉推理准确性。

Comments Accepted by ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17953 2025-12-23 cs.CV cs.AI 57%

Seeing Beyond the Scene: Analyzing and Mitigating Background Bias in Action Recognition

超越场景:分析和缓解动作识别中的背景偏见

Ellie Zhou, Jihoon Chung, Olga Russakovsky

机构 * Westmont High School(韦斯蒙特高中) Princeton University(普林斯顿大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文分析了动作识别中背景偏见的问题,并提出缓解策略,通过输入分割和提示调优降低背景偏见,提升模型对人类动作的识别能力。

Comments Accepted to NeurIPS 2025 Workshops: SPACE in Vision, Language, and Embodied AI; and What Makes a Good Video: Next Practices in Video Generation and Evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18684 2025-12-23 cs.CV 50%

A Study of Finetuning Video Transformers for Multi-view Geometry Tasks

对多视角几何任务进行视频变换器微调的研究

Huimin Wu, Kwang-Ting Cheng, Stephen Lin, Zhirong Wu

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文通过微调视频基础模型,提出了一种简单有效的方法,实现了多视角几何任务如光流估计的高性能表现。

Comments AAAI 20206, Project website: geovit-aaai26.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08930 2025-12-23 cs.CV cs.GR 50%

Selfi: Self Improving Reconstruction Engine via 3D Geometric Feature Alignment

Selfi: 通过3D几何特征对齐实现自改进的重建引擎

Youming Deng, Songyou Peng, Junyi Zhang, Kathryn Heal, Tiancheng Sun, John Flynn, Steve Marschner, Lucy Chai

机构 * Cornell University(康奈尔大学) Google(谷歌) UC Berkeley(加州大学伯克利分校)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 Selfi通过特征对齐提升3D重建精度,利用VGGT输出作为伪地面真实值,实现NVS和姿态估计的高性能表现。

Comments Project Page: https://denghilbert.github.io/selfi/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18448 2025-12-23 cs.CV 50%

Object-Centric Framework for Video Moment Retrieval

面向视频时刻检索的对象中心框架

Zongyao Li, Yongkang Wong, Satoshi Yamazaki, Jianquan Liu, Mohan Kankanhalli

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出面向对象的视频时刻检索框架,通过场景图解析和关系跟踪器变压器,提升对对象层面语义和动态的建模能力,从而在多个基准上取得更优性能。

Comments AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18028 2025-12-23 cs.RO cs.CV 50%

Embodied4C: Measuring What Matters for Embodied Vision-Language Navigation

Embodied4C: 评估具身视觉-语言导航中至关重要的因素

Tin Stribor Sohn, Maximilian Dillitzer, Jason J. Corso, Eric Sax

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) UAS Esslingen(埃森嫩大学) TU Wien(维也纳技术大学) Dr. Ing. h.c. F. Porsche AG(保时捷股份有限公司) University of Michigan(密歇根大学) Voxel51 Inc.(Voxel51公司)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 Embodied4C通过三种异构具身评估VLMs的具身能力,发现跨模态对齐和指令微调比规模更重要,而空间和时间推理是可靠具身能力的主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05769 2025-12-23 cs.CV 50%

Digital Twin Buildings: 3D Modeling, GIS Integration, and Visual Descriptions Using Gaussian Splatting, ChatGPT/Deepseek, and Google Maps Platform

数字孪生建筑:利用高斯点扩散、ChatGPT/DeepSeek和Google地图平台进行3D建模、GIS集成和视觉描述

Kyle Gao, Dening Lu, Liangzhi Li, Nan Chen, Hongjie He, Linlin Xu, Jonathan Li

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出了一种基于高斯点扩散、ChatGPT和Google地图平台的数字孪生建筑框架,用于实现建筑的3D建模、GIS集成和视觉描述。

Comments -Fixed minor typo

Journal ref IEEE Geoscience and Remote Sensing Letters 22 (2025) 6013405

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 6 篇

2512.18215 2025-12-23 cs.LG cs.AI cs.CL cs.CV 82%

Stable and Efficient Single-Rollout RL for Multimodal Reasoning

稳定且高效的多模态推理单次迭代强化学习

Rui Liu, Dian Yu, Lei Ke, Haolin Liu, Yujun Zhou, Zhenwen Liang, Haitao Mi, Pratap Tokekar, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) University of Maryland(马里兰大学) University of Virginia(弗吉尼亚大学) University of Notre Dame(诺特大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MSSR通过熵基优势塑造机制,实现多模态推理中的稳定高效单次迭代强化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18311 2025-12-23 cs.AI cs.SE 81%

Monitoring Monitorability

监控可监控性

Melody Y. Guan, Miles Wang, Micah Carroll, Zehao Dou, Annie Y. Wei, Marcus Williams, Benjamin Arnav, Joost Huizinga, Ian Kivlichan, Mia Glaese, Jakub Pachocki, Bowen Baker

机构 * OpenAI

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);test-time compute(abstract)

AI总结 研究提出评估框架和指标,探讨了不同因素对AI系统可监控性的影响,发现更长的思维链和优化方法能提升监控效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18462 2025-12-23 cs.CL cs.AI cs.LG 67%

Mitigating Spurious Correlations in NLI via LLM-Synthesized Counterfactuals and Dynamic Balanced Sampling

通过LLM合成的反事实和动态平衡采样缓解NLI中的虚假相关性

Christopher Román Jaimes

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种自动化流程,通过LLM合成反事实和动态平衡采样缓解NLI中的虚假相关性,提升了模型性能和领域内准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24511 2025-12-23 cs.LG cs.AI 62%

Can Slow-thinking LLMs Reason Over Time? Empirical Studies in Time Series Forecasting

慢思考LLM能否在时间上进行推理?时间序列预测的实证研究

Mingyue Cheng, Jiahao Wang, Daoyu Wang, Xiaoyu Tao, Qi Liu, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨慢思考LLM能否在时间序列预测中进行推理,通过实验证明其零样本预测能力,揭示LLM在时间动态上的潜力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19585 2025-12-23 cs.CL 57%

Increasing the Thinking Budget is Not All You Need

增加思考预算并不足以提升性能

Ignacio Iacobacci, Zhaozhi Qian, Faroq AL-Tam, Muhammad AL-Qurishi, Riad Souissi

机构 * Elm Company(埃尔姆公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文研究了思考预算对模型性能的影响,发现增加预算并非最优策略,而自一致性和反思等配置能更有效提升推理准确性。

Comments 4 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏