arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-10-23 至 2025-10-23 共收录 65 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 6 篇

2410.01735 2025-10-23 cs.CL cs.LG 73%

LASeR: Learning to Adaptively Select Reward Models with Multi-Armed Bandits

Duy Nguyen, Archiki Prasad, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(杜克大学夏洛特分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 测试时计算 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG

Comments NeurIPS 2025 camera-ready. First two authors contributed equally. Code: https://github.com/duykhuongnguyen/LASeR-MAB

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19752 2025-10-23 cs.RO cs.AI 57%

Learning Affordances at Inference-Time for Vision-Language-Action Models

Ameesh Shah, William Chen, Adwait Godbole, Federico Mora, Sanjit A. Seshia, Sergey Levine

机构 * UC Berkeley(伯克利大学) Physical Intelligence(物理智能)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

Comments 7 pages and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18982 2025-10-23 cs.AI 57%

Test-time Verification via Optimal Transport: Coverage, ROC, & Sub-optimality

Arpan Mukherjee, Marcello Bullo, Debabrota Basu, Deniz Gündüz

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 复杂问题求解 7 篇

2510.16062 2025-10-23 cs.CL cs.AI 88%

Can LLMs Correct Themselves? A Benchmark of Self-Correction in LLMs

Guiyao Tie, Zenghui Yuan, Zeli Zhao, Chaoran Hu, Tianhe Gu, Ruihang Zhang, Sizhe Zhang, Junran Wu, Xiaoyue Tu, Ming Jin, Qingsong Wen, Lixing Chen, Pan Zhou, Lichao Sun

机构 * Huazhong University of Science and Technology(华中科技大学) Griffith University(格里菲斯大学) Squirrel Ai Learning(squirrel ai 学习) Shanghai Jiaotong University(上海交通大学) Lehigh University(莱斯大学)

专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

Comments 47 pages, 25 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21625 2025-10-23 cs.CL 85%

Meeseeks: A Feedback-Driven, Iterative Self-Correction Benchmark evaluating LLMs' Instruction Following Capability

Jiaming wang, Yunke Zhao, Peng Ding, Jun Kuang, Yibin Shen, Zhe Tang, Yilin Jin, ZongYu Wang, Xiaoyu Li, Xuezhi Cao, Xunliang Cai

机构 * Meituan(美团)

专题命中 复杂问题求解 :self-correction(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16814 2025-10-23 cs.LG cs.CV 79%

Semi-off-Policy Reinforcement Learning for Vision-Language Slow-Thinking Reasoning

Junhao Shen, Haiteng Zhao, Yuzhe Gu, Songyang Gao, Kuikun Liu, Haian Huang, Jianfei Gao, Dahua Lin, Wenwei Zhang, Kai Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19451 2025-10-23 cs.CV cs.MM 78%

Reasoning Like Experts: Leveraging Multimodal Large Language Models for Drawing-based Psychoanalysis

Xueqi Ma, Yanbei Jiang, Sarah Erfani, James Bailey, Weifeng Liu, Krista A. Ehinger, Jey Han Lau

机构 * The University of Melbourne(墨尔本大学) China University of Petroleum (East China)(中国石油大学(华东))

专题命中 复杂问题求解 :reasoning(title,abstract)

Comments Accepted by ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18895 2025-10-23 cs.SE cs.AI cs.HC 57%

CosmoCore Affective Dream-Replay Reinforcement Learning for Code Generation

Santhosh Kumar Ravindran

机构 * Microsoft Corporation(微软公司)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17150 2025-10-23 cs.RO 50%

OmniVIC: A Self-Improving Variable Impedance Controller with Vision-Language In-Context Learning for Safe Robotic Manipulation

Heng Zhang, Wei-Hsing Huang, Gokhan Solak, Arash Ajoudani

机构 * Human-Robot Interfaces and Interaction Lab, Istituto Italiano di Tecnologia, Genoa, Italy(人机交互实验室,意大利理工学院,热那亚) Georgia Institute of Technology, Atlanta, USA(佐治亚理工学院,美国亚特兰大)

专题命中 复杂问题求解 :reasoning(abstract)

Comments Code, video and RAG dataset are available at \url{https://sites.google.com/view/omni-vic}

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16880 2025-10-23 cs.CE 50%

Chem-R: Learning to Reason as a Chemist

Weida Wang, Benteng Chen, Di Zhang, Wanhao Liu, Shuchen Pu, Ben Gao, Jin Zeng, Xiaoyong Wei, Tianshu Yu, Shuzhou Sun, Tianfan Fu, Wanli Ouyang, Lei Bai, Jiatong Li, Zifu Wang, Yuqiang Li, Shufei Zhang

专题命中 复杂问题求解 :reasoning(abstract)

Comments 9 pages, 5 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理评测 18 篇

2505.14489 2025-10-23 cs.AI cs.CL 86%

Reasoning Models Better Express Their Confidence

Dongkeun Yoon, Seungone Kim, Sohee Yang, Sunkyoung Kim, Soyeon Kim, Yongil Kim, Eunbi Choi, Yireun Kim, Minjoon Seo

机构 * KAIST(韩国科学技术院) LG AI Research(LG人工智能研究) CMU(卡内基梅隆大学) UCL(伦敦大学学院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19055 2025-10-23 cs.AI cs.SD eess.AS 85%

The MUSE Benchmark: Probing Music Perception and Auditory Relational Reasoning in Audio LLMS

Brandon James Carone, Iran R. Roman, Pablo Ripollés

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

Comments 5 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21776 2025-10-23 cs.CV 82%

Video-R1: Reinforcing Video Reasoning in MLLMs

Kaituo Feng, Kaixiong Gong, Bohao Li, Zonghao Guo, Yibing Wang, Tianshuo Peng, Junfei Wu, Xiaoying Zhang, Benyou Wang, Xiangyu Yue

机构 * CUHK MMLab(香港中文大学多模态实验室) CUHK (SZ)(香港中文大学(深圳)) Tsinghua University(清华大学) UCAS(中国科学院大学) CUHK HCCL(香港中文大学高性能计算实验室)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract)

Comments NeurIPS 2025, Project page: https://github.com/tulerfeng/Video-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19358 2025-10-23 cs.CL cs.AI 81%

M3-SLU: Evaluating Speaker-Attributed Reasoning in Multimodal Large Language Models

Yejin Kwon, Taewoo Kang, Hyunsoo Yoon, Changouk Kim

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Submitted to LREC 2026. 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19808 2025-10-23 cs.CV cs.CL cs.LG 73%

Pico-Banana-400K: A Large-Scale Dataset for Text-Guided Image Editing

Yusu Qian, Eli Bocek-Rivele, Liangchen Song, Jialing Tong, Yinfei Yang, Jiasen Lu, Wenze Hu, Zhe Gan

机构 * Apple(苹果公司)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19334 2025-10-23 stat.ML cs.AI cs.IR cs.LG 62%

Metadata Extraction Leveraging Large Language Models

Cuize Han, Sesh Jalagam

机构 * Box AI Platform(Box人工智能平台)

专题命中 推理评测 :CoT(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19150 2025-10-23 cs.CV cs.AI cs.LG 62%

X-Ego: Acquiring Team-Level Tactical Situational Awareness via Cross-Egocentric Contrastive Video Representation Learning

Yunzhe Wang, Soham Hans, Volkan Ustun

机构 * University of Southern California(南加州大学) USC Institute for Creative Technologies(USC创意技术研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19131 2025-10-23 cs.CL cs.LG eess.SP stat.ML 62%

Training-Free Spectral Fingerprints of Voice Processing in Transformers

Valentin Noël

机构 * Devoteam

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

Comments Preprint under review (2025). 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15831 2025-10-23 cs.CL cs.AI cs.CY 62%

Who's Asking? Investigating Bias Through the Lens of Disability Framed Queries in LLMs

Vishnu Hari, Kalpana Panda, Srikant Panda, Amit Agarwal, Hitesh Laxmichand Patel

机构 * Birla Institute of Technology and Science (BITS)(巴拉·技术与科学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19559 2025-10-23 cs.CV cs.AI cs.IR cs.MM 57%

A Matter of Time: Revealing the Structure of Time in Vision-Language Models

Nidham Tekaya, Manuela Waldner, Matthias Zeppelzauer

机构 * St. Pölten University of Applied Sciences(施普伦特应用科学大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17501 2025-10-23 cs.CV cs.AI 57%

Context-Aware Pseudo-Label Scoring for Zero-Shot Video Summarization

Yuanli Wu, Long Zhang, Yue Du, Bin Li

机构 * Nanyang Technological University(南洋理工大学) Guilin University of Electronic Technology(桂林电子科技大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05571 2025-10-23 cs.CL 57%

Presenting a Paper is an Art: Self-Improvement Aesthetic Agents for Academic Presentations

Chengzhi Liu, Yuzhe Yang, Kaiwen Zhou, Zhen Zhang, Yue Fan, Yanan Xie, Peng Qi, Xin Eric Wang

专题命中 推理评测 :self-correction(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11857 2025-10-23 cs.DC cs.LG 57%

LLMBridge: Reducing Costs to Access LLMs in a Prompt-Centric Internet

Noah Martin, Abdullah Bin Faisal, Hiba Eltigani, Rukhshan Haroon, Swaminathan Lamelas, Fahad Dogar

机构 * Tufts University(塔夫茨大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19626 2025-10-23 cs.CV 50%

MedReason-R1: Learning to Reason for CT Diagnosis with Reinforcement Learning and Local Zoom

Yifan Li, Fenghe Tang, Yingtai Li, Shaohua Kevin Zhou

机构 * 1 School of Biomedical Engineering, Division of Life Sciences Medicine, University of Science Technology of China, Hefei, Anhui, 230026, P.R. China 2 Center for Medical Imaging, Robotics Analytic Computing \& LEarning (MIRACLE), Suzhou Institute for Advanced Research, USTC, Suzhou 215123, P.R. China 3 Jiangsu Provincial Key Laboratory of Multimodal Digital Twin Technology, Suzhou Jiangsu, 215123 4 State Key Laboratory of Precision

专题命中 推理评测 :reasoning(abstract)

Comments The code, checkpoints, and dataset are available at: https://github.com/Leevan001/MedReason-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19336 2025-10-23 cs.CV 50%

DaMo: Data Mixing Optimizer in Fine-tuning Multimodal LLMs for Mobile Phone Agents

Kai Shi, Jun Yang, Ni Yang, Binqiang Pan, Qingsong Xie, Chao Zhang, Zhenyu Yang, Tianhuang Su, Haonan Lu

机构 * OPPO AI Center(OPPO人工智能中心)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12323 2025-10-23 cs.CV 50%

Doctor Approved: Generating Medically Accurate Skin Disease Images through AI-Expert Feedback

Janet Wang, Yunbei Zhang, Zhengming Ding, Jihun Hamm

机构 * Tulane University(路易斯安那州立大学)

专题命中 推理评测 :reasoning(abstract)

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10043 2025-10-23 cs.SE 50%

TrioXpert: An Automated Incident Management Framework for Microservice System

Yongqian Sun, Yu Luo, Xidao Wen, Yuan Yuan, Xiaohui Nie, Shenglin Zhang, Tong Liu, Xi Luo

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01069 2025-10-23 q-fin.GN econ.GN q-fin.EC 50%

The Promise and Peril of Generative AI: Evidence from GPT as Sell-Side Analysts

Edward Li, Min Shen, Zhiyuan Tu, Dexin Zhou

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他推理 7 篇

2510.19476 2025-10-23 cs.LG cs.AI 86%

A Concrete Roadmap towards Safety Cases based on Chain-of-Thought Monitoring

Julian Schulz

机构 * Meridian Research, Cambridge(梅迪安研究,剑桥)

专题命中 其他推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02344 2025-10-23 cs.AI 79%

Traffic-R1: Reinforced LLMs Bring Human-Like Reasoning to Traffic Signal Control Systems

Xingchen Zou, Yuhao Yang, Zheng Chen, Xixuan Hao, Yiqi Chen, Chao Huang, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) PCITECH The University of Hong Kong(香港大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏