arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-14 至 2025-11-14 共收录 72 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 8 篇

2511.10017 2025-11-14 cs.CV 85%

AffordBot: 3D Fine-grained Embodied Reasoning via Multimodal Large Language Models

Xinyi Wang, Xun Yang, Yanlong Xu, Yuchen Wu, Zhen Li, Na Zhao

机构 * University of Science and Technology of China(科学技术大学) Singapore University of Technology and Design(新加坡科技设计大学) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26091 2025-11-14 cs.CV cs.LG 79%

Text-to-Scene with Large Reasoning Models

Frédéric Berdoz, Luca A. Lanzendörfer, Nick Tuninga, Roger Wattenhofer

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.LG

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10279 2025-11-14 cs.CV 78%

PROPA: Toward Process-level Optimization in Visual Reasoning via Reinforcement Learning

Yanbei Jiang, Chao Lei, Yihao Ding, Krista Ehinger, Jey Han Lau

机构 * University of Melbourne(墨尔本大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21538 2025-11-14 cs.CV cs.AI 77%

Caption This, Reason That: VLMs Caught in the Middle

Zihan Weng, Lucas Gomez, Taylor Whittington Webb, Pouya Bashivan

机构 * Integrated Program in Neuroscience (IPN) McGill University(神经科学联合计划 麦吉尔大学) Mila, University of Montreal(蒙特利尔大学Mila) Microsoft Research USA(微软研究院美国总部) Department of Physiology McGill University(生理学系 麦吉尔大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

Comments Paper accepted by nips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15434 2025-11-14 cs.CV cs.LG 57%

Semantic4Safety: Causal Insights from Zero-shot Street View Imagery Segmentation for Urban Road Safety

Huan Chen, Ting Han, Siyu Chen, Zhihao Guo, Yiping Chen, Meiliu Wu

机构 * School of Geospatial Engineering and Science, Sun Yat-sen University(地理空间工程与科学学院,中山大学) School of Geographical and Earth Sciences, University of Glasgow(地理与地球科学学院,格拉斯哥大学) School of Economics and Management, Shanxi University(经济学与管理学院,山西大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.LG

Comments 11 pages, 10 figures, The 8th ACM SIGSPATIAL International Workshop on AI for Geographic Knowledge Discovery (GeoAI '25), November 3--6, 2025, Minneapolis, MN, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10059 2025-11-14 cs.CV 50%

When Eyes and Ears Disagree: Can MLLMs Discern Audio-Visual Confusion?

Qilang Ye, Wei Zeng, Meng Liu, Jie Zhang, Yupeng Hu, Zitong Yu, Yu Zhou

专题命中 视觉空间推理 :reasoning(abstract)

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06465 2025-11-14 cs.CV cs.MM 50%

Agent Journey Beyond RGB: Hierarchical Semantic-Spatial Representation Enrichment for Vision-and-Language Navigation

Xuesong Zhang, Yunbo Xu, Jia Li, Ruonan Liu, Zhenzhen Hu

专题命中 视觉空间推理 :reasoning(abstract)

Comments AAAI2026, I14 pages, 12 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09883 2025-11-14 cs.CV 50%

HCC-3D: Hierarchical Compensatory Compression for 98% 3D Token Reduction in Vision-Language Models

Liheng Zhang, Jin Wang, Hui Li, Bingfeng Zhang, Weifeng Liu

专题命中 视觉空间推理 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 测试时计算 3 篇

2507.20067 2025-11-14 cs.AI cs.CL cs.LG 67%

PITA: Preference-Guided Inference-Time Alignment for LLM Post-Training

Sarat Chandra Bobbili, Ujwal Dinesha, Dheeraj Narasimha, Srinivas Shakkottai

机构 * Texas A&M University(德克萨斯A&M大学) Inria(法国国家信息与自动化研究所)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09844 2025-11-14 cs.LG cs.PF 57%

Steering Pretrained Drafters during Speculative Decoding

Frédéric Berdoz, Peer Rheinboldt, Roger Wattenhofer

专题命中 测试时计算 :verifier(abstract);分类 cs.LG

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10648 2025-11-14 cs.CV 50%

Enhancing the Outcome Reward-based RL Training of MLLMs with Self-Consistency Sampling

Jiahao Wang, Weiye Xu, Aijun Yang, Wengang Zhou, Lewei Lu, Houqiang Li, Xiaohua Wang, Jinguo Zhu

机构 * Xi’an Jiaotong University(西安交通大学) University of Science and Technology of China(中国科学技术大学) SenseTime Research(商汤科技研究院)

专题命中 测试时计算 :reasoning(abstract)

Comments Accepted to NeurIPS 2025 (The Thirty-Ninth Annual Conference on Neural Information Processing Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 复杂问题求解 8 篇

2511.10621 2025-11-14 cs.CL cs.AI cs.LG 85%

SSR: Socratic Self-Refine for Large Language Model Reasoning

Haizhou Shi, Ye Liu, Bo Pang, Zeyu Leo Liu, Hao Wang, Silvio Savarese, Caiming Xiong, Yingbo Zhou, Semih Yavuz

机构 * Salesforce AI Research(Salesforce人工智能研究) Rutgers University(罗格斯大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Preprint; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10182 2025-11-14 cs.CL 79%

Beyond the Black Box: Demystifying Multi-Turn LLM Reasoning with VISTA

Yiran Zhang, Mingyang Lin, Mark Dras, Usman Naseem

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12143 2025-11-14 cs.AI 77%

Small Models Struggle to Learn from Strong Reasoners

Yuetai Li, Xiang Yue, Zhangchen Xu, Fengqing Jiang, Luyao Niu, Bill Yuchen Lin, Bhaskar Ramasubramanian, Radha Poovendran

机构 * University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) Western Washington University(西雅图华盛顿大学)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10395 2025-11-14 cs.LG cs.AI cs.CL 67%

AgentEvolver: Towards Efficient Self-Evolving Agent System

Yunpeng Zhai, Shuchang Tao, Cheng Chen, Anni Zou, Ziqian Chen, Qingxu Fu, Shinji Mai, Li Yu, Jiaji Deng, Zouying Cao, Zhaoyang Liu, Bolin Ding, Jingren Zhou

机构 * Tongyi Lab(通义实验室) Alibaba Group(阿里巴巴集团)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14289 2025-11-14 cs.AI cs.CL cs.LG 67%

From Capabilities to Performance: Evaluating Key Functional Properties of LLM Architectures in Penetration Testing

Lanxiao Huang, Daksh Dave, Tyler Cody, Peter Beling, Ming Jin

机构 * Bradley Department of Electrical and Computer Engineering, Virginia Tech(弗吉尼亚理工大学电气与计算机工程系布雷拉德部门) National Security Institute, Virginia Tech(弗吉尼亚理工大学国家安全研究所)

专题命中 复杂问题求解 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pages 15890 to 15916, Suzhou, China, November 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10583 2025-11-14 cs.CL cs.AI 62%

Evaluating Prompting Strategies with MedGemma for Medical Order Extraction

Abhinand Balachandran, Bavana Durgapraveen, Gowsikkan Sikkan Sudhagar, Vidhya Varshany J S, Sriram Rajkumar

机构 * EXL Health AI Lab at MEDIQA-OE 2025(EXL健康AI实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 2 figures 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10611 2025-11-14 cs.NI cs.AI 57%

Towards an Agentic Workflow for Internet Measurement Research

Alagappan Ramanathan, Eunju Kang, Dongsu Han, Sangeetha Abdu Jyothi

机构 * University of California, Irvine(加州大学伊维奇分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10457 2025-11-14 cs.CL 57%

Exploring State Tracking Capabilities of Large Language Models

Kiamehr Rezaee, Jose Camacho-Collados, Mohammad Taher Pilehvar

机构 * Cardiff NLP(卡迪夫NLP)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理评测 15 篇

2511.09831 2025-11-14 cs.CL cs.CY 88%

Answering Students' Questions on Course Forums Using Multiple Chain-of-Thought Reasoning and Finetuning RAG-Enabled LLM

Neo Wang, Sonit Singh

机构 * School of Computer Science and Engineering, University of New South Wales, Sydney, Australia(计算机科学与工程学院,新南威尔士大学,悉尼,澳大利亚)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10303 2025-11-14 cs.CL 86%

Rectify Evaluation Preference: Improving LLMs' Critique on Math Reasoning via Perplexity-aware Reinforcement Learning

Changyuan Tian, Zhicong Lu, Shuang Qian, Nayu Liu, Peiguang Li, Li Jin, Leiyi Hu, Zhizhao Zeng, Sirui Wang, Ke Zeng, Zhi Guo

专题命中 推理评测 :reasoning(title,abstract);math reasoning(title);分类 cs.CL

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10201 2025-11-14 cs.CL 85%

EffiReason-Bench: A Unified Benchmark for Evaluating and Advancing Efficient Reasoning in Large Language Models

Junquan Huang, Haotian Wu, Yubo Gao, Yibo Yan, Junyan Zhang, Yonghua Hei, Song Dai, Jie Zhang, Puay Siew Tan, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology(香港科技大学) Singapore Institute of Manufacturing Technology, A*STAR(新加坡制造技术研究所,A*STAR)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments 11 pages, 4 figures, 4 tables. Appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10289 2025-11-14 eess.AS cs.CL 70%

Music Flamingo: Scaling Music Understanding in Audio Language Models

Sreyan Ghosh, Arushi Goel, Lasha Koroshinadze, Sang-gil Lee, Zhifeng Kong, Joao Felipe Santos, Ramani Duraiswami, Dinesh Manocha, Wei Ping, Mohammad Shoeybi, Bryan Catanzaro

机构 * NVIDIA, CA, USA(NVIDIA公司) University of Maryland, College Park, USA(大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

Comments Project Page: https://research.nvidia.com/labs/adlr/MF/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19319 2025-11-14 cs.CL cs.AI 62%

FHIR-AgentBench: Benchmarking LLM Agents for Realistic Interoperable EHR Question Answering

Gyubok Lee, Elea Bach, Eric Yang, Tom Pollard, Alistair Johnson, Edward Choi, Yugang jia, Jong Ha Lee

机构 * Korea Advanced Institute of Science & Technology(韩国科学技术院) Verily Life Sciences(Verily 生物科技) Massachusetts Institute of Technology(麻省理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments ML4H 2025 Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10284 2025-11-14 cs.AI 57%

Beyond Verification: Abductive Explanations for Post-AI Assessment of Privacy Leakage

Belona Sonna, Alban Grastien, Claire Benn

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Accepted at the Workshop on Post-AI Formal Methods at AAAI-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10075 2025-11-14 cs.CL 57%

Format Matters: The Robustness of Multimodal LLMs in Reviewing Evidence from Tables and Charts

Xanh Ho, Yun-Ang Wu, Sunisth Kumar, Florian Boudin, Atsuhiro Takasu, Akiko Aizawa

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10014 2025-11-14 q-bio.QM cs.AI 57%

fastbmRAG: A Fast Graph-Based RAG Framework for Efficient Processing of Large-Scale Biomedical Literature

Guofeng Meng, Li Shen, Qiuyan Zhong, Wei Wang, Haizhou Zhang, Xiaozhen Wang

机构 * Changchun GeneScience Pharmaceuticals Co., Ltd.(长春基因科学制药有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 8 pages, 2 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09971 2025-11-14 cs.CL 57%

NumPert: Numerical Perturbations to Probe Language Models for Veracity Prediction

Peter Røysland Aarnes, Vinay Setty

机构 * University of Stavanger(斯塔万格大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted in ICJNLP/AACL SRW

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07127 2025-11-14 cs.LG 57%

REACT-LLM: A Benchmark for Evaluating LLM Integration with Causal Features in Clinical Prognostic Tasks

Linna Wang, Zhixuan You, Qihui Zhang, Jiunan Wen, Ji Shi, Yimin Chen, Yusen Wang, Fanqi Ding, Ziliang Feng, Li Lu

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26495 2025-11-14 cs.DB cs.CL 57%

Rethinking Text-to-SQL: Dynamic Multi-turn SQL Interaction for Real-world Database Exploration

Linzhuang Sun, Tianyu Guo, Hao Liang, Yuying Li, Qifeng Cai, Jingxuan Wei, Bihui Yu, Wentao Zhang, Bin Cui

机构 * University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏