arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-10-31 至 2025-10-31 共收录 70 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 4 篇

2510.26474 2025-10-31 cs.CV cs.AI cs.CL cs.LG 67%

Counteracting Matthew Effect in Self-Improvement of LVLMs through Head-Tail Re-balancing

Xin Guo, Zhiheng Xi, Yiwen Ding, Yitao Zhai, Xiaowei Shi, Xunliang Cai, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Meituan(美团) Shanghai Innovation Institute(上海创新研究院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26536 2025-10-31 cs.RO 50%

RoboOS-NeXT: A Unified Memory-based Framework for Lifelong, Scalable, and Robust Multi-Robot Collaboration

Huajie Tan, Cheng Chi, Xiansheng Chen, Yuheng Ji, Zhongxia Zhao, Xiaoshuai Hao, Yaoxu Lyu, Mingyu Cao, Junkai Zhao, Huaihai Lyu, Enshen Zhou, Ning Chen, Yankai Fu, Cheng Peng, Wei Guo, Dong Liang, Zhuo Chen, Mengsi Lyu, Chenrui He, Yulong Ao, Yonghua Lin, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(1 多媒体信息处理国家重点实验室,计算机学院,北京大学) Beijing Academy of Artificial Intelligence(2 北京人工智能研究院) Institute of Automation, Chinese Academy of Sciences(3 中国科学院自动化研究所) Beihang University(4 北航大学)

专题命中 视觉空间推理 :planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 测试时计算 1 篇

2505.11730 2025-10-31 cs.AI cs.LG 73%

Rethinking Optimal Verification Granularity for Compute-Efficient Test-Time Scaling

Hao Mark Chen, Guanxi Lu, Yasuyuki Okoshi, Zhiwen Mo, Masato Motomura, Hongxiang Fan

机构 * Imperial College London, UK(伦敦帝国学院) Institute of Science Tokyo, Japan(东京科学研究所)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 复杂问题求解 7 篇

2507.03704 2025-10-31 cs.CL cs.AI 81%

Controlling Thinking Speed in Reasoning Models

Zhengkai Lin, Zhihang Fu, Ze Chen, Chao Chen, Liang Xie, Wenxiao Wang, Deng Cai, Zheng Wang, Jieping Ye

机构 * State Key Lab of CAD&CG(CAD&CG状态重点实验室) Alibaba Cloud(阿里云) College of Computer Science and Technology(计算机科学与技术学院) School of Software Technology(软件技术学院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26114 2025-10-31 cs.CV 78%

OracleAgent: A Multimodal Reasoning Agent for Oracle Bone Script Research

Caoshuo Li, Zengmao Ding, Xiaobin Hu, Bang Li, Donghao Luo, Xu Peng, Taisong Jin, Yongge Liu, Shengwei Han, Jing Yang, Xiaoping He, Feng Gao, AndyPian Wu, SevenShu, Chaoyang Wang, Chengjie Wang

机构 * Xiamen University(厦门大学) Anyang Normal University(安阳师范学院) Tencent YouTu Lab(腾讯YouTu实验室) Tencent SSV(腾讯SSV)

专题命中 复杂问题求解 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17197 2025-10-31 cs.LG cs.AI eess.SP 73%

SignalLLM: A General-Purpose LLM Agent Framework for Automated Signal Processing

Junlong Ke, Qiying Hu, Shenghai Yuan, Yuecong Xu, Jianfei Yang

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电子与电气工程学院) MARS Lab, Nanyang Technological University, Singapore(南洋理工大学MARS实验室)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25798 2025-10-31 cs.LG cs.AI cs.CL 67%

MemEIC: A Step Toward Continual and Compositional Knowledge Editing

Jin Seong, Jiyun Park, Wencke Liermann, Hongseok Choi, Yoonji Nam, Hyun Kim, Soojong Lim, Namhoon Lee

机构 * Electronics and Telecommunications Research Institute, Republic of Korea(韩国电子电信研究院) POSTECH Sungkyunkwan University(全南大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2025, 38 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24797 2025-10-31 cs.CL cs.AI 62%

Large Language Models Report Subjective Experience Under Self-Referential Processing

Cameron Berg, Diogo de Lucena, Judd Rosenblatt

机构 * AE Studio(AE工作室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09499 2025-10-31 cs.CV cs.AI cs.CL 62%

MindGYM: What Matters in Question Synthesis for Thinking-Centric Fine-Tuning?

Zhe Xu, Daoyuan Chen, Zhenqing Ling, Yaliang Li, Ying Shen

机构 * Sun Yat-sen University(中山大学) Alibaba Group(阿里巴巴集团) FSIETP

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted by NeurIPS'25. 30 pages, 2 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26027 2025-10-31 cs.CV 50%

Enhancing Temporal Understanding in Video-LLMs through Stacked Temporal Attention in Vision Encoders

Ali Rasekh, Erfan Bagheri Soula, Omid Daliran, Simon Gottschalk, Mohsen Fayyaz

机构 * Leibniz University Hannover(莱比锡大学汉诺威分校) L3S Research Center(L3S研究中心) Microsoft(微软公司)

专题命中 复杂问题求解 :reasoning(abstract)

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理评测 19 篇

2510.23968 2025-10-31 cs.CV 85%

Reasoning Visual Language Model for Chest X-Ray Analysis

Andriy Myronenko, Dong Yang, Baris Turkbey, Mariam Aboian, Sena Azamat, Esra Akcicek, Hongxu Yin, Pavlo Molchanov, Marc Edgar, Yufan He, Pengfei Guo, Yucheng Tang, Daguang Xu

机构 * NVIDIA NIH/NCI CHOP/UPenn Basaksehir Cam and Sakura City Hospital

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

Comments NV-Reason-CXR-3B

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26732 2025-10-31 cs.AI cs.CL 81%

Cross-Platform Evaluation of Reasoning Capabilities in Foundation Models

J. de Curtò, I. de Zarzà, Pablo García, Jordi Cabot

机构 * BARCELONA Supercomputing Center (BSC)(巴塞罗那超级计算中心) LUXEMBOURG Institute of Science(卢森堡科学研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26037 2025-10-31 cs.CR cs.AI cs.CL 81%

SIRAJ: Diverse and Efficient Red-Teaming for LLM Agents via Distilled Structured Reasoning

Kaiwen Zhou, Ahmed Elgohary, A S M Iftekhar, Amin Saied

机构 * Microsoft Responsible AI Research(微软负责任人工智能研究) University of California(加州大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26322 2025-10-31 cs.CL 79%

SCRIBE: Structured Chain Reasoning for Interactive Behaviour Explanations using Tool Calling

Fares Fawzi, Vinitra Swamy, Dominik Glandorf, Tanya Nazaretsky, Tanja Käser

机构 * EPFL(苏黎世联邦理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06771 2025-10-31 cs.CV 78%

D-HUMOR: Dark Humor Understanding via Multimodal Open-ended Reasoning -- A Benchmark Dataset and Method

Sai Kartheek Reddy Kasu, Mohammad Zia Ur Rehman, Shahid Shafi Dar, Rishi Bharat Junghare, Dhanvin Sanjay Namboodiri, Nagendra Kumar

机构 * Indian Institute of Information Technology Dharwad, India(印度达拉瓦德信息科技学院) Indian Institute of Technology Indore, India(印度印度理工学院) Malaviya National Institute of Technology Jaipur, India(马拉维亚国家理工学院)

专题命中 推理评测 :reasoning(title,abstract)

Comments Accepted at IEEE International Conference on Data Mining (ICDM) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11094 2025-10-31 cs.CV 78%

Open3D-VQA: A Benchmark for Comprehensive Spatial Reasoning with Multimodal Large Language Model in Open Space

Weichen Zhang, Zile Zhou, Xin Zeng, Xuchen Liu, Jianjie Fang, Chen Gao, Yong Li, Jinqiang Cui, Xinlei Chen, Xiao-Ping Zhang

机构 * Tsinghua University(清华大学) Pengcheng Laboratory(鹏城实验室) Sun Yat-sen University(中山大学)

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25536 2025-10-31 cs.CL 70%

TwinVoice: A Multi-dimensional Benchmark Towards Digital Twins via LLM Persona Simulation

Bangde Du, Minghao Guo, Songming He, Ziyi Ye, Xi Zhu, Weihang Su, Shuqi Zhu, Yujia Zhou, Yongfeng Zhang, Qingyao Ai, Yiqun Liu

机构 * Tsinghua University(清华大学) Rutgers University(罗格斯大学) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

Comments Main paper: 11 pages, 3 figures, 6 tables. Appendix: 28 pages. Bangde Du and Minghao Guo contributed equally. Corresponding authors: Ziyi Ye (ziyiye@fudan.edu.cn), Qingyao Ai (aiqy@tsinghua.edu.cn)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26787 2025-10-31 cs.LG cs.AI cs.CL 67%

Remote Labor Index: Measuring AI Automation of Remote Work

Mantas Mazeika, Alice Gatti, Cristina Menghini, Udari Madhushani Sehwag, Shivam Singhal, Yury Orlovskiy, Steven Basart, Manasi Sharma, Denis Peskoff, Elaine Lau, Jaehyuk Lim, Lachlan Carroll, Alice Blair, Vinaya Sivakumar, Sumana Basu, Brad Kenstler, Yuntao Ma, Julian Michael, Xiaoke Li, Oliver Ingebretsen, Aditya Mehta, Jean Mottola, John Teichmann, Kevin Yu, Zaina Shaik, Adam Khoja, Richard Ren, Jason Hausenloy, Long Phan, Ye Htet, Ankit Aich, Tahseen Rabbani, Vivswan Shah, Andriy Novykov, Felix Binder, Kirill Chugunov, Luis Ramirez, Matias Geralnik, Hernán Mesura, Dean Lee, Ed-Yeremai Hernandez Cardona, Annette Diamond, Summer Yue, Alexandr Wang, Bing Liu, Ernesto Hernandez, Dan Hendrycks

机构 * Center for AI Safety(人工智能安全中心) Scale AI

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Website: https://www.remotelabor.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26802 2025-10-31 cs.CV cs.AI cs.CL 62%

Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark

Ziyu Guo, Xinyan Chen, Renrui Zhang, Ruichuan An, Yu Qi, Dongzhi Jiang, Xiangtai Li, Manyuan Zhang, Hongsheng Li, Pheng-Ann Heng

机构 * CUHK(香港中文大学) IMIXR MMLab Peking University(北京大学) Northeastern University(东北大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Project Page: https://video-cof.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14681 2025-10-31 cs.CL 57%

Massive Supervised Fine-tuning Experiments Reveal How Data, Layer, and Training Factors Shape LLM Alignment Quality

Yuto Harada, Yusuke Yamauchi, Yusuke Oda, Yohei Oseki, Yusuke Miyao, Yu Takagi

机构 * NII LLMC(日本信息处理学会大语言模型中心) The University of Tokyo(东京大学) NAIST(日本科学技术大学) Nagoya Institute of Technology(名古屋技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 (Main Conference). Models and evaluation results available at: https://github.com/llm-jp/massive-sft

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26309 2025-10-31 cs.AI cs.IR 57%

GraphCompliance: Aligning Policy and Context Graphs for LLM-Based Regulatory Compliance

Jiseong Chung, Ronny Ko, Wonchul Yoo, Makoto Onizuka, Sungmok Kim, Tae-Wan Kim, Won-Yong Shin

机构 * Seoul National University(首尔国立大学) Osaka University(大阪大学) Yonsei University(延世大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Under review at The Web Conference 2026 (Semantics & Knowledge track). Code will be released upon acceptance. This arXiv v1 contains no repository links to preserve double-blind review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26238 2025-10-31 cs.AI 57%

Questionnaire meets LLM: A Benchmark and Empirical Study of Structural Skills for Understanding Questions and Responses

Duc-Hai Nguyen, Vijayakumar Nanjappan, Barry O'Sullivan, Hoang D. Nguyen

机构 * University College Cork(科克大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 14 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26193 2025-10-31 cs.CL 57%

RCScore: Quantifying Response Consistency in Large Language Models

Dongjun Jang, Youngchae Ahn, Hyopil Shin

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Journal ref EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26006 2025-10-31 cs.CV cs.CL 57%

CAVE: Detecting and Explaining Commonsense Anomalies in Visual Environments

Rishika Bhagwatkar, Syrielle Montariol, Angelika Romanou, Beatriz Borges, Irina Rish, Antoine Bosselut

机构 * EPFL(瑞士联邦理工学院) MILA(蒙特利尔人工智能研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Journal ref 2025 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25997 2025-10-31 cs.AI cs.SE 57%

From Queries to Insights: Agentic LLM Pipelines for Spatio-Temporal Text-to-SQL

Manu Redd, Tao Zhe, Dongjie Wang

机构 * University of Kansas(堪萨斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 8 pages, 5 figures, GeoGenAgent'25 - ACM SIGSPATIAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25908 2025-10-31 cs.AI 57%

SciTrust 2.0: A Comprehensive Framework for Evaluating Trustworthiness of Large Language Models in Scientific Applications

Emily Herron, Junqi Yin, Feiyi Wang

机构 * Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Preprint Submitted to ACM Transactions on AI for Science (TAIS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11695 2025-10-31 cs.CL 57%

When Agents Trade: Live Multi-Market Trading Benchmark for LLM Agents

Lingfei Qian, Xueqing Peng, Yan Wang, Vincent Jim Zhang, Huan He, Hanley Smith, Yi Han, Yueru He, Haohang Li, Yupeng Cao, Yangyang Yu, Alejandro Lopez-Lira, Peng Lu, Jian-Yun Nie, Guojun Xiong, Jimin Huang, Sophia Ananiadou

机构 * Georgia Institute of Technology(佐治亚理工学院) Columbia University(哥伦比亚大学) Stevens Institute of Technology(史蒂文斯理工学院) University of Florida(佛罗里达大学) Harvard University(哈佛大学) National Centre for Text Mining, University of Manchester(曼彻斯特大学文本挖掘中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04852 2025-10-31 cs.CV cs.LG 57%

CAUSAL3D: A Comprehensive Benchmark for Causal Learning from Visual Data

Disheng Liu, Yiran Qiao, Wuche Liu, Yiren Lu, Yunlai Zhou, Tuo Liang, Yu Yin, Jing Ma

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments Datasets link: https://huggingface.co/datasets/LLDDSS/Causal3D_Dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04448 2025-10-31 cs.CV cs.MM 50%

TRUST-VL: An Explainable News Assistant for General Multimodal Misinformation Detection

Zehong Yan, Peng Qi, Wynne Hsu, Mong Li Lee

专题命中 推理评测 :reasoning(abstract)

Comments EMNLP 2025 Oral; Project Homepage: https://yanzehong.github.io/trust-vl/

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 其他推理 11 篇

2510.25933 2025-10-31 cs.AI cs.HC cs.LG cs.NE 81%

Humains-Junior: A 3.8B Language Model Achieving GPT-4o-Level Factual Accuracy by Directed Exoskeleton Reasoning

Nissan Yaron, Dan Bystritsky, Ben-Etzion Yaron

机构 * Humains AI Research(Humains人工智能研究) Inpris Ltd(Inpris公司)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏