arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-10-30 至 2025-10-30 共收录 63 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 2 篇

2506.08388 2025-10-30 cs.LG cs.AI cs.CL 67%

Reinforcement Learning Teachers of Test Time Scaling

Edoardo Cetin, Tianyu Zhao, Yujin Tang

机构 * Sakana AI, Japan(日本Sakana AI)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 复杂问题求解 10 篇

2508.07382 2025-10-30 cs.AI cs.LG 84%

Pentest-R1: Towards Autonomous Penetration Testing Reasoning Optimized via Two-Stage Reinforcement Learning

He Kong, Die Hu, Jingguo Ge, Liangxiong Li, Hui Li, Tong Li

机构 * State Key Laboratory of Cyberspace Security Defense, Institute of Information Engineering, Chinese Academy of Sciences(中国科学院网络空间安全防御重点实验室,信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络与安全学院)

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25510 2025-10-30 cs.AI 79%

MTIR-SQL: Multi-turn Tool-Integrated Reasoning Reinforcement Learning for Text-to-SQL

Zekun Xu, Siyu Xia, Chuhuai Yue, Jiajun Chai, Mingxue Tian, Xiaohan Wang, Wei Lin, Haoxuan Li, Guojun Yin

机构 * Meituan(美团) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing Institute of Technology(北京理工大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25091 2025-10-30 cs.AI 79%

H3M-SSMoEs: Hypergraph-based Multimodal Learning with LLM Reasoning and Style-Structured Mixture of Experts

Peilin Tan, Liang Xie, Churan Zhi, Dian Tu, Chuanqi Shi

机构 * University of California, San Diego(加州大学圣迭戈分校) Wuhan University of Technology(武汉科技大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24980 2025-10-30 cs.CV cs.AI 79%

FT-ARM: Fine-Tuned Agentic Reflection Multimodal Language Model for Pressure Ulcer Severity Classification with Reasoning

Reza Saadati Fard, Emmanuel Agu, Palawat Busaranuvong, Deepak Kumar, Shefalika Gautam, Bengisu Tulu, Diane Strong, Lorraine Loretz

机构 * Worcester Polytechnic Institute(沃斯特理工学院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17720 2025-10-30 cs.CL cs.AI 73%

Spontaneous Giving and Calculated Greed in Language Models

Yuxuan Li, Hirokazu Shirado

机构 * School of Computer Science Carnegie Mellon University(计算机科学学院卡内基梅隆大学)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2025 main conference and selected as an Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24719 2025-10-30 cs.CL cs.IR 70%

Iti-Validator: A Guardrail Framework for Validating and Correcting LLM-Generated Itineraries

Shravan Gadbail, Masumi Desai, Kamalakar Karlapalem

机构 * International Institute of Information Technology(国际信息科技学院)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25621 2025-10-30 cs.CL cs.AI cs.IR 66%

FARSIQA: Faithful and Advanced RAG System for Islamic Question Answering

Mohammad Aghajani Asl, Behrooz Minaei Bidgoli

专题命中 复杂问题求解 :reasoning(abstract,comments);分类 cs.CL、cs.AI

Comments 37 pages, 5 figures, 10 tables. Keywords: Retrieval-Augmented Generation (RAG), Question Answering (QA), Islamic Knowledge Base, Faithful AI, Persian NLP, Multi-hop Reasoning, Large Language Models (LLMs)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13002 2025-10-30 cs.HC cs.AI cs.CL 62%

AutoTRIZ: Automating Engineering Innovation with TRIZ and Large Language Models

Shuo Jiang, Weifeng Li, Yuping Qian, Yangjun Zhang, Jianxi Luo

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 28 pages, 12 figures

Journal ref Advanced Engineering Informatics 65 (2025): 103312

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24339 2025-10-30 cs.AI 57%

VDSAgents: A PCS-Guided Multi-Agent System for Veridical Data Science Automation

Yunxuan Jiang, Silan Hu, Xiaoning Wang, Yuanyuan Zhang, Xiangyu Chang

机构 * School of Management, Xi’an Jiaotong University(西安交通大学管理学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Data Science and Media Intelligence, Communication University of China(中国传媒大学数据科学与媒体智能学院) Beijing Baixingkefu Network Technology Co., Ltd.(北京百星科技网络技术有限公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

Comments 29 pages, 6 figures. Yunxuan Jiang and Silan Hu contributed equally. Code available at https://github.com/fengzer/VDSAgents . Submitted to Stat (manuscript ID: STAT-25-0222.R1, under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.07619 2025-10-30 q-fin.ST cs.CL 57%

Can ChatGPT Forecast Stock Price Movements? Return Predictability and Large Language Models

Alejandro Lopez-Lira, Yuehua Tang

机构 * University of Florida(佛罗里达大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

Comments Previously posted in SSRN https://papers.ssrn.com/sol3/papers.cfm?abstract_id=4412788

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理评测 14 篇

2510.25332 2025-10-30 cs.CV 89%

StreamingCoT: A Dataset for Temporal Dynamics and Multimodal Chain-of-Thought Reasoning in Streaming VideoQA

Yuhang Hu, Zhenyu Yang, Shihan Wang, Shengsheng Qian, Bin Wen, Fan Yang, Tingting Gao, Changsheng Xu

机构 * Henan Institute of Advanced Technology, Zhengzhou University(河南高级技术研究所,郑州大学) Institute of Automation, CAS(自动化研究所,中国科学院) UCAS(中国科学院大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24932 2025-10-30 cs.CL 83%

RiddleBench: A New Generative Reasoning Benchmark for LLMs

Deepon Halder, Alan Saji, Thanmay Jayakumar, Ratish Puduppully, Anoop Kunchukuttan, Raj Dabre

机构 * Nilekani Centre at AI4Bharat(AI4Bharat的Nilekani中心) Indian Institute of Technology Madras(印度理工学院马德拉斯分校) IT University of Copenhagen(哥本哈根技术大学) Microsoft(微软) Indian Institute of Engineering, Science and Technology, Shibpur(Shibpur印度工程科学技术学院)

专题命中 推理评测 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04458 2025-10-30 cs.CL 83%

Think Twice Before You Judge: Mixture of Dual Reasoning Experts for Multimodal Sarcasm Detection

Soumyadeep Jana, Abhrajyoti Kundu, Sanasam Ranbir Singh

机构 * Indian Institute of Technology Guwahati(印度理工学院古瓦哈提)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25187 2025-10-30 cs.CL 70%

Testing Cross-Lingual Text Comprehension In LLMs Using Next Sentence Prediction

Ritesh Sunil Chavan, Jack Mostow

机构 * Department of Computer Science(计算机科学系) Stony Brook University(石溪大学) School of Computer Science(计算机科学学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15584 2025-10-30 cs.HC 67%

To Rely or Not to Rely? Evaluating Interventions for Appropriate Reliance on Large Language Models

Jessica Y. Bo, Sophia Wan, Ashton Anderson

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract)

Journal ref Proceedings of the 2025 CHI Conference on Human Factors in Computing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09135 2025-10-30 cs.AI cs.CL cs.HC cs.LG 67%

Multimodal Fusion with LLMs for Engagement Prediction in Natural Conversation

Cheng Charles Ma, Kevin Hyekang Joo, Alexandria K. Vail, Sunreeta Bhattacharya, Álvaro Fernández García, Kailana Baker-Matsuoka, Sheryl Mathew, Lori L. Holt, Fernando De la Torre

机构 * Computer Science Department, Carnegie Mellon University(卡内基梅隆大学计算机科学系) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Neuroscience Institute, Carnegie Mellon University(卡内基梅隆大学神经科学研究所) Department of Psychology, The University of Texas at Austin(德克萨斯大学奥斯汀分校心理学系) Center for Perceptual Systems, The University of Texas at Austin(德克萨斯大学奥斯汀分校感知系统中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 22 pages, first three authors equal contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06677 2025-10-30 cs.RO cs.CV 67%

RoboCerebra: A Large-scale Benchmark for Long-horizon Robotic Manipulation Evaluation

Songhao Han, Boxiang Qiu, Yue Liao, Siyuan Huang, Chen Gao, Shuicheng Yan, Si Liu

机构 * Beihang University(北航大学) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

Comments 25 pages, 18 figures, Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25694 2025-10-30 cs.SE cs.AI cs.CL 62%

Process-Level Trajectory Evaluation for Environment Configuration in Software Engineering Agents

Jiayi Kuang, Yinghui Li, Xin Zhang, Yangning Li, Di Yin, Xing Sun, Ying Shen, Philip S. Yu

机构 * Youtu-LLM Team, Tencent Youtu Lab(腾讯优设实验室) Sun Yat-sen University(中山大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24788 2025-10-30 cs.CV cs.AI cs.LG 62%

The Underappreciated Power of Vision Models for Graph Structural Understanding

Xinjian Zhao, Wei Pang, Zhongkai Xue, Xiangru Jian, Lei Zhang, Yaoyao Xu, Xiaozhuang Song, Shu Wu, Tianshu Yu

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Cheriton School of Computer Science, University of Waterloo(滑铁卢大学切尔顿计算机科学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24762 2025-10-30 cs.CL cs.AI 62%

Falcon: A Comprehensive Chinese Text-to-SQL Benchmark for Enterprise-Grade Evaluation

Wenzhen Luo, Wei Guan, Yifan Yao, Yimin Pan, Feng Wang, Zhipeng Yu, Zhe Wen, Liang Chen, Yihong Zhuang

机构 * Ant Group(蚂蚁集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22967 2025-10-30 cs.CL cs.AI 62%

MAD-Fact: A Multi-Agent Debate Framework for Long-Form Factuality Evaluation in LLMs

Yucheng Ning, Xixun Lin, Fang Fang, Yanan Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences, Beijing 100085, China(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences, Beijing 100049, China(中国科学院大学网络安全学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-025-51369-x}

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10844 2025-10-30 cs.AI cs.CL 62%

Creativity or Brute Force? Using Brainteasers as a Window into the Problem-Solving Abilities of Large Language Models

Simeng Han, Howard Dai, Stephen Xia, Grant Zhang, Chen Liu, Lichang Chen, Hoang Huy Nguyen, Hongyuan Mei, Jiayuan Mao, R. Thomas McCoy

机构 * Yale University(耶鲁大学) Meta Superintelligence Labs(Meta超智能实验室) Georgia Institute of Technology(佐治亚理工学院) TTIC Massachusetts Institute of Technology(麻省理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.06818 2025-10-30 cs.CL cs.IR 57%

Large Language Models for Few-Shot Named Entity Recognition

Yufei Zhao, Xiaoshi Zhong, Erik Cambria, Jagath C. Rajapakse

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

Comments 17 pages, 2 figures. Accepted by AI, Computer Science and Robotics Technology (ACRT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19028 2025-10-30 cs.CV cs.AI 57%

InfoChartQA: A Benchmark for Multimodal Question Answering on Infographic Charts

Tianchi Xie, Minzhi Lin, Mengchen Liu, Yilin Ye, Changjian Chen, Shixia Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他推理 8 篇

2505.16854 2025-10-30 cs.AI cs.CV 79%

Think or Not? Selective Reasoning via Reinforcement Learning for Vision-Language Models

Jiaqi Wang, Kevin Qinghong Lin, James Cheng, Mike Zheng Shou

机构 * The Chinese University of Hong Kong(香港中文大学) Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

Comments camera ready revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25092 2025-10-30 cs.MA 78%

SeeingEye: Agentic Information Flow Unlocks Multimodal Reasoning In Text-only LLMs

Weijia Zhang, Zijia Liu, Haoru Li, Haoqi Chen, Jiaxuan You

专题命中 其他推理 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25195 2025-10-30 cs.SE 75%

Optimizing Knowledge Utilization for Multi-Intent Comment Generation with Large Language Models

Shuochuan Li, Zan Wang, Xiaoning Du, Zhuo Wu, Jiuqiao Yu, Junjie Chen

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25055 2025-10-30 cs.CL cs.AI cs.LG 67%

GAPMAP: Mapping Scientific Knowledge Gaps in Biomedical Literature Using Large Language Models

Nourah M Salem, Elizabeth White, Michael Bada, Lawrence Hunter

机构 * University of Colorado, Anschutz(科罗拉多大学安舒茨分校) University of Chicago(芝加哥大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25460 2025-10-30 cs.CL cs.AI 62%

Fine-Tuned Language Models for Domain-Specific Summarization and Tagging

Jun Wang, Fuming Lin, Yuyu Chen

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏