arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-10-22 至 2025-10-22 共收录 77 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 7 篇

2505.14460 2025-10-22 cs.CV 78%

VisualQuality-R1: Reasoning-Induced Image Quality Assessment via Reinforcement Learning to Rank

Tianhe Wu, Jian Zou, Jie Liang, Lei Zhang, Kede Ma

机构 * City University of Hong Kong(香港城市大学) OPPO Research Institute(OPPO研究院) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25528 2025-10-22 cs.CV cs.AI cs.RO 70%

LLM-RG: Referential Grounding in Outdoor Scenarios using Large Language Models

Pranav Saxena, Avigyan Bhattacharya, Ji Zhang, Wenshan Wang

机构 * Birla Institute of Technology and Science Pilani, K.K Birla Goa Campus(比拉理工学院和科学学院,K.K Birla Goa校区) Carnegie Mellon University, Robotics Institute(卡内基梅隆大学,机器人研究所)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

Comments Human-aware Embodied AI Workshop @ IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02838 2025-10-22 cs.AI 70%

I-Design: Personalized LLM Interior Designer

Ata Çelen, Guo Han, Konrad Schindler, Luc Van Gool, Iro Armeni, Anton Obukhov, Xi Wang

机构 * ETH Zürich(苏黎世联邦理工学院) Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

Journal ref Computer Vision - ECCV 2024 Workshops, Lecture Notes in Computer Science (LNCS), vol. 15624, pp. 217-234, Springer, Cham, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10255 2025-10-22 cs.CV cs.RO 67%

When LLMs step into the 3D World: A Survey and Meta-Analysis of 3D Tasks via Multi-modal Large Language Models

Xianzheng Ma, Brandon Smart, Yash Bhalgat, Shuai Chen, Xinghui Li, Jian Ding, Jindong Gu, Dave Zhenyu Chen, Songyou Peng, Jia-Wang Bian, Philip H Torr, Marc Pollefeys, Matthias Nießner, Ian D Reid, Angel X. Chang, Iro Laina, Victor Adrian Prisacariu

机构 * University of Oxford(牛津大学) King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学) Technical University of Munich(慕尼黑技术大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Simon Fraser University(西蒙·弗雷泽大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

Comments 2nd version update to Jun.2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00441 2025-10-22 cs.RO 50%

Seeing through Uncertainty: Robust Task-Oriented Optimization in Visual Navigation

Yiyuan Pan, Yunzhe Xu, Zhe Liu, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) School of Automation and Intelligent Sensing(自动化与智能感知学院) Key Laboratory of System Control and Information Processing(系统控制与信息处理重点实验室) Ministry of Education of China(中华人民共和国教育部) National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家级重点实验室) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院)

专题命中 视觉空间推理 :planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 测试时计算 2 篇

2510.12838 2025-10-22 cs.CL cs.AI 84%

A$^2$FM: An Adaptive Agent Foundation Model for Tool-Aware Hybrid Reasoning

Qianben Chen, Jingyi Cao, Jiayu Zhang, Tianrui Qin, Xiaowan Li, King Zhu, Dingfeng Shi, He Zhu, Minghao Liu, Xiaobo Liang, Xin Gui, Ge Zhang, Jian Yang, Yuchen Eleanor Jiang, Wangchunshu Zhou

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05542 2025-10-22 cs.LG 57%

DreamPRM-1.5: Unlocking the Potential of Each Instance for Multimodal Process Reward Model Training

Qi Cao, Pengtao Xie

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 复杂问题求解 9 篇

2509.23967 2025-10-22 cs.CL 85%

HiPO: Hybrid Policy Optimization for Dynamic Reasoning in LLMs

Ken Deng, Zizheng Zhan, Wen Xiang, Wenqiang Zhu, Weihao Li, Jingxuan Xu, Tianhao Peng, Xinping Lei, Kun Wu, Yifan Yao, Haoyang Huang, Huaixi Tang, Kepeng Lei, Zhiyi Lai, Songwei Yu, Zongxian Feng, Zuchen Gao, Weihao Xie, Chenchen Zhang, Yanan Wu, Yuanxing Zhang, Lecheng Huang, Yuqun Zhang, Jie Liu, Zhaoxiang Zhang, Haotian Zhang, Bin Chen, Jiaheng Liu

机构 * Kuaishou Technology(快手科技) Nanjing University(南京大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19257 2025-10-22 cs.CV cs.CL 83%

MSR-Align: Policy-Grounded Multimodal Alignment for Safety-Aware Reasoning in Vision-Language Models

Yinan Xia, Yilei Jiang, Yingshui Tan, Xiaoyong Zhu, Xiangyu Yue, Bo Zheng

机构 * Future Lab, Alibaba Group(阿里巴巴集团未来实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18510 2025-10-22 cs.CL 79%

Identity-Aware Large Language Models require Cultural Reasoning

Alistair Plum, Anne-Marie Lutgen, Christoph Purschke, Achim Rettinger

机构 * University of Luxembourg, Luxembourg(卢森堡大学) Trier University, Germany(特里尔大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17922 2025-10-22 cs.CL cs.AI 73%

Select-Then-Decompose: From Empirical Analysis to Adaptive Selection Strategy for Task Decomposition in Large Language Models

Shuodi Liu, Yingzhuo Liu, Zi Wang, Yusheng Wang, Huijia Wu, Liuyu Xiang, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

Comments Accepted to the Main Conference of EMNLP 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18053 2025-10-22 cs.LG cs.AI 62%

Adaptive Divergence Regularized Policy Optimization for Fine-tuning Generative Models

Jiajun Fan, Tong Wei, Chaoran Cheng, Yuxin Chen, Ge Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19591 2025-10-22 cs.CL cs.AI cs.MA 62%

Multi-Agent Collaboration via Evolving Orchestration

Yufan Dang, Chen Qian, Xueheng Luo, Jingru Fan, Zihao Xie, Ruijie Shi, Weize Chen, Cheng Yang, Xiaoyin Che, Ye Tian, Xuantang Xiong, Lei Han, Zhiyuan Liu, Maosong Sun

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学) Siemens(西门子) Tencent Robotics X(腾讯机器人研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

Comments accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07153 2025-10-22 cs.CR cs.AI 57%

Mind the Web: The Security of Web Use Agents

Avishag Shapira, Parth Atulbhai Gandhi, Edan Habler, Asaf Shabtai

机构 * Ben-Gurion University of the Negev, Israel(内盖夫本·古里安大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17098 2025-10-22 cs.CL cs.CV 57%

TACO: Enhancing Multimodal In-context Learning via Task Mapping-Guided Sequence Configuration

Yanshu Li, Jianjiang Yang, Tian Yun, Pinyuan Feng, Jinfa Huang, Ruixiang Tang

机构 * Brown University(布朗大学) University of Bristol(布里斯托大学) Columbia University(哥伦比亚大学) University of Rochester(罗切斯特大学) Rutgers University(罗格斯大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

Comments EMNLP2025 Main, 28 pages, 11 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18327 2025-10-22 cs.SE 50%

InspectCoder: Dynamic Analysis-Enabled Self Repair through interactive LLM-Debugger Collaboration

Yunkun Wang, Yue Zhang, Guochang Li, Chen Zhi, Binhua Li, Fei Huang, Yongbin Li, Shuiguang Deng

专题命中 复杂问题求解 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理评测 21 篇

2510.08189 2025-10-22 cs.AI cs.CL 86%

R-Horizon: How Far Can Your Large Reasoning Model Really Go in Breadth and Depth?

Yi Lu, Jianing Wang, Linsen Guo, Wei He, Hongyin Tang, Tao Gui, Xuanjing Huang, Xuezhi Cao, Wei Wang, Xunliang Cai

机构 * Fudan University(复旦大学) Meituan LongCat Team(美团LongCat团队)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19187 2025-10-22 cs.CL cs.AI 86%

LIMOPro: Reasoning Refinement for Efficient and Effective Test-time Scaling

Yang Xiao, Jiashuo Wang, Ruifeng Yuan, Chunpu Xu, Kaishuai Xu, Wenjie Li, Pengfei Liu

机构 * The Hong Kong Polytechnic University(香港理工大学) Shanghai Jiao Tong University(上海交通大学) SII

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18154 2025-10-22 cs.AI cs.CY 83%

Annotating the Chain-of-Thought: A Behavior-Labeled Dataset for AI Safety

Antonio-Gabriel Chacón Menke, Phan Xuan Tan, Eiji Kamioka

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18672 2025-10-22 cs.LG cs.AI 81%

Reasoning Language Model Inference Serving Unveiled: An Empirical Study

Qi Li, Junpan Wu, Xiang Liu, Yuxin Wang, Zeyu Li, Zhenheng Tang, Yuhan Chen, Shaohuai Shi, Xiaowen Chu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) HKBU(香港 Baptist University) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15216 2025-10-22 cs.LG cs.CL 81%

Soundness-Aware Level: A Microscopic Signature that Predicts LLM Reasoning Potential

Xuansheng Wu, Xiaoman Pan, Wenlin Yao, Jianshu Chen

机构 * University of Georgia(佐治亚大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17900 2025-10-22 cs.CY cs.AI cs.CL 81%

Are LLMs Court-Ready? Evaluating Frontier Models on Indian Legal Reasoning

Kush Juvekar, Arghya Bhattacharya, Sai Khadloya, Utkarsh Saxena

机构 * Adalat AI

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18368 2025-10-22 cs.CL 79%

KoSimpleQA: A Korean Factuality Benchmark with an Analysis of Reasoning LLMs

Donghyeon Ko, Yeguk Jin, Kyubyung Chae, Byungwook Lee, Chansong Jo, Sookyo In, Jaehong Lee, Taesup Kim, Donghyun Kwak

机构 * Naver Cloud(Naver云) Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18112 2025-10-22 cs.CL 79%

Does Reasoning Help LLM Agents Play Dungeons and Dragons? A Prompt Engineering Experiment

Patricia Delafuente, Arya Honraopatil, Lara J. Martin

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Published at the Wordplay: When Language Meets Games Workshop (EMNLP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18863 2025-10-22 cs.SE 78%

EffiReasonTrans: RL-Optimized Reasoning for Code Translation

Yanlin Wang, Rongyi Ou, Yanli Wang, Mingwei Liu, Jiachi Chen, Ensheng Shi, Xilin Liu, Yuchi Ma, Zibin Zheng

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18303 2025-10-22 cs.CV 78%

Proactive Reasoning-with-Retrieval Framework for Medical Multimodal Large Language Models

Lehan Wang, Yi Qin, Honglong Yang, Xiaomeng Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 推理评测 :reasoning(title,abstract)

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18029 2025-10-22 cs.DB cs.AI 70%

DynaQuery: A Self-Adapting Framework for Querying Structured and Multimodal Data

Aymane Hassini

机构 * Al Akhawayn University(阿尔阿克哈文大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

Comments 15 pages, 2 figures, 10 tables. Source code and experimental artifacts are available at: https://github.com/aymanehassini/DynaQuery . The 'DynaQuery-Eval-5K' benchmark, introduced in this work, is also publicly available at: https://www.kaggle.com/datasets/aymanehassini/dynaquery-eval-5k-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18411 2025-10-22 cs.CL cs.LG 62%

DanmakuTPPBench: A Multi-modal Benchmark for Temporal Point Process Modeling and Understanding

Yue Jiang, Jichu Li, Yang Liu, Dingkang Yang, Feng Zhou, Quyu Kong

机构 * Fudan University(复旦大学) Center for Applied Statistics and School of Statistics, Renmin University of China(应用统计中心和中国人民大学统计学院) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算高级创新中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

Comments Accepted by Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18054 2025-10-22 cs.CV cs.CL 57%

HouseTour: A Virtual Real Estate A(I)gent

Ata Çelen, Marc Pollefeys, Daniel Barath, Iro Armeni

机构 * ETH Zürich(苏黎世联邦理工学院) Stanford University(斯坦福大学) Microsoft Spatial AI Lab(微软空间人工智能实验室) HUN-REN SZTAKI(匈牙利-罗马尼亚科学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Published on ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18043 2025-10-22 cs.AI 57%

CompactPrompt: A Unified Pipeline for Prompt Data Compression in LLM Workflows

Joong Ho Choi, Jiayang Zhao, Jeel Shah, Ritvika Sonawane, Vedant Singh, Avani Appalla, Will Flanagan, Filipe Condessa

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Workshop on LLMs and Generative AI for Finance at ACM ICAIF 2025

详情

展开后加载摘要…

URL PDF HTML 收藏