arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-07 至 2025-11-07 共收录 57 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 9 篇

2510.25766 2025-11-07 cs.CL 57%

Decomposition-Enhanced Training for Post-Hoc Attributions In Language Models

Sriram Balasubramanian, Samyadeep Basu, Koustava Goswami, Ryan Rossi, Varun Manjunatha, Roshan Santhosh, Ruiyi Zhang, Soheil Feizi, Nedim Lipka

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

Comments Post-hoc attribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13406 2025-11-07 cs.AI cs.CE cs.MA 57%

Collaboration Dynamics and Reliability Challenges of Multi-Agent LLM Systems in Finite Element Analysis

Chuan Tian, Yilei Zhang

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03844 2025-11-07 cs.MA 50%

ASAP: an Agentic Solution to Auto-optimize Performance of Large-Scale LLM Training

Yuran Ding, Xinwei Chen, Xiaofan Zhang, Zongwei Zhou

专题命中 复杂问题求解 :reasoning(abstract)

Comments This work has been accepted to Workshop on ML for Systems at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 14 篇

2511.04491 2025-11-07 cs.CL cs.AI cs.DB cs.IR cs.LG 82%

RUST-BENCH: Benchmarking LLM Reasoning on Unstructured Text within Structured Tables

Nikhil Abhyankar, Purvi Chaurasia, Sanchit Kabra, Ananya Srivastava, Vivek Gupta, Chandan K. Reddy

机构 * Virginia Tech(弗吉尼亚理工大学) IGDTUW New Delhi(新德里IGDTUW) Arizona State University(亚利桑那州立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01833 2025-11-07 cs.CV 82%

TIR-Bench: A Comprehensive Benchmark for Agentic Thinking-with-Images Reasoning

Ming Li, Jike Zhong, Shitian Zhao, Haoquan Zhang, Shaoheng Lin, Yuxiang Lai, Chen Wei, Konstantinos Psounis, Kaipeng Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) University of Southern California(南加州大学) Emory University(埃默里大学) Chinese University of Hong Kong(香港中文大学) Rice University(德克萨斯大学奥斯汀分校)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract)

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03845 2025-11-07 cs.AI cs.LG 82%

To See or To Read: User Behavior Reasoning in Multimodal LLMs

Tianning Dong, Luyi Ma, Varun Vasudevan, Jason Cho, Sushant Kumar, Kannan Achan

机构 * Personalization Team, Walmart Global Tech(Walmart全球科技个性化团队)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments Accepted by the 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01409 2025-11-07 cs.CL 79%

LiveSearchBench: An Automatically Constructed Benchmark for Retrieval and Reasoning over Dynamic Knowledge

Heng Zhou, Ao Yu, Yuchen Fan, Jianing Shi, Li Kang, Hejia Geng, Yongting Zhang, Yutao Fan, Yuhao Wu, Tiancheng He, Yiran Qin, Lei Bai, Zhenfei Yin

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) London School of Economics(伦敦经济学院) BUPT(北京邮电大学) Harbin Institute of Technology(哈尔滨工业大学) SUTD(新加坡科技设计大学) University of Oxford(牛津大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21591 2025-11-07 cs.CL 79%

FinEval-KR: A Financial Domain Evaluation Framework for Large Language Models' Knowledge and Reasoning

Shaoyu Dou, Yutian Shen, Mofan Chen, Zixuan Wang, Jiajie Xu, Qi Guo, Kailai Shao, Chao Chen, Haixiang Hu, Haibo Shi, Min Min, Liwen Zhang

机构 * Ant Group(蚂蚁集团) Shanghai University of Finance and Economics(上海金融学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Accepted by FinNLP@EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21814 2025-11-07 cs.CV cs.AI 77%

Gestura: A LVLM-Powered System Bridging Motion and Semantics for Real-Time Free-Form Gesture Understanding

Zhuoming Li, Aitong Liu, Mengxi Jia, Yubi Lu, Tengxiang Zhang, Changzhi Sun, Dell Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI) of China Telecom(中国电信人工智能研究院(TeleAI))

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

Comments IMWUT2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13956 2025-11-07 cs.AI cs.CV cs.MM 57%

Cross-modal Causal Intervention for Alzheimer's Disease Prediction

Yutao Jin, Haowen Xiao, Junyong Zhai, Yuxiao Li, Jielei Chu, Fengmao Lv, Yuxiao Li

机构 * Southwest Jiaotong University(西南交通大学) Southeast University(东南大学) Sichuan University(四川大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04132 2025-11-07 cs.LG 57%

Exploring the Feasibility of End-to-End Large Language Model as a Compiler

Hongbin Zhang, Shihao Gao, Yang Liu, Mingjie Xing, Yanjun Wu, Chen Zhao

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments This work has been accepted by IJCNN 2025 and submitted to the IEEE for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04093 2025-11-07 cs.AI 57%

KGFR: A Foundation Retriever for Generalized Knowledge Graph Question Answering

Yuanning Cui, Zequn Sun, Wei Hu, Zhangjie Fu

机构 * School of Computer Science, Nanjing University of Information Science and Technology(南京信息工程大学计算机科学学院) State Key Laboratory for Novel Software Technology, Nanjing University(南京大学软件新技术国家重点实验室) National Institute of Healthcare Data Science, Nanjing University(南京大学健康数据科学国家研究院) Engineering Research Center of Digital Forensics, Ministry of Education, Nanjing University of Information Science and Technology(南京信息工程大学教育部长江数字取证工程研究中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03995 2025-11-07 cs.CR cs.AI 57%

Hybrid Fuzzing with LLM-Guided Input Mutation and Semantic Feedback

Shiyin Lin

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04664 2025-11-07 cs.RO 50%

SAFe-Copilot: Unified Shared Autonomy Framework

Phat Nguyen, Erfan Aasi, Shiva Sreeram, Guy Rosman, Andrew Silva, Sertac Karaman, Daniela Rus

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) TRI(丰田研究机构) MIT LIDS(麻省理工学院领导力与决策科学实验室)

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04267 2025-11-07 cs.SE 50%

A Tool for Benchmarking Large Language Models' Robustness in Assessing the Realism of Driving Scenarios

Jiahui Wu, Chengjie Lu, Aitor Arrieta, Shaukat Ali

专题命中 推理评测 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04064 2025-11-07 cs.SE 50%

Benchmarking and Studying the LLM-based Agent System in End-to-End Software Development

Zhengran Zeng, Yixin Li, Rui Xie, Wei Ye, Shikun Zhang

专题命中 推理评测 :planning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23324 2025-11-07 cs.RO 50%

A Framework for Human-Reason-Aligned Trajectory Evaluation in Automated Vehicles

Lucas Elbert Suryana, Saeed Rahmani, Simeon Craig Calvert, Arkady Zgonnikov, Bart van Arem

机构 * Department of Transport and Planning(交通与规划部门) Centre for Meaningful Human Control(有意义的人控中心) Delft University of Technology(代尔夫特理工大学)

专题命中 推理评测 :planning(abstract)

Comments This version incorporates revisions based on peer-review feedback from a new submission. The work has been accepted and is being prepared for publication

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他推理 10 篇

2511.04432 2025-11-07 cs.CL 79%

If I Could Turn Back Time: Temporal Reframing as a Historical Reasoning Task for LLMs

Lars Bungum, Charles Yijia Huang, Abeer Kashar

机构 * NTNU Norway(挪威诺汉大学) University of Waterloo(滑铁卢大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

Comments 8 pages, 1 figure, 3 tables, submitted to aconference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04050 2025-11-07 cs.HC 78%

Revealing AI Reasoning Increases Trust but Crowds Out Unique Human Knowledge

Zenan Chen, Ruijiang Gao, Yingzhi Liang

专题命中 其他推理 :reasoning(title,abstract)

Comments 38 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11190 2025-11-07 cs.CV 78%

FlexAC: Towards Flexible Control of Associative Reasoning in Multimodal Large Language Models

Shengming Yuan, Xinyu Lyu, Shuailong Wang, Beitao Chen, Jingkuan Song, Lianli Gao

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Southwestern University of Finance and Economics(西南财经大学) Tongji University(同济大学)

专题命中 其他推理 :reasoning(title,abstract)

Comments 19 pages, 11 figures. Accepted by the 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04527 2025-11-07 cs.CL cs.AI 73%

Are language models aware of the road not taken? Token-level uncertainty and hidden state dynamics

Amir Zur, Atticus Geiger, Ekdeep Singh Lubana, Eric Bigelow

机构 * Department of Linguistics, Stanford University(斯坦福大学语言学系) Department of Psychology, Harvard University(哈佛大学心理学系) Center for Brain Science, Harvard University(哈佛大学脑科学中心) Physics of Intelligence Group, NTT Research(NTT研究物理智能小组)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04020 2025-11-07 cs.CL cs.AI 62%

Abductive Inference in Retrieval-Augmented Language Models: Generating and Validating Missing Premises

Shiyin Lin

机构 * Independent Researcher, Mountain View, CA94039, USA(独立研究者)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04002 2025-11-07 cs.LG cs.AI 62%

Memory- and Latency-Constrained Inference of Large Language Models via Adaptive Split Computing

Mingyu Sung, Vikas Palakonda, Suhwan Im, Sunghwan Moon, Il-Min Kim, Sangseok Yun, Jae-Mo Kang

机构 * Department of Artificial Intelligence, Kyungpook National University(人工智能系,庆北国立大学) Department of Electrical and Computer Engineering, Queen’s University(电气与计算机工程系,皇后大学) Department of Information and Communications Engineering, Pukyong National University(信息与通信工程系,浦项国立大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04560 2025-11-07 cs.CL 57%

BanglaMedQA and BanglaMMedBench: Evaluating Retrieval-Augmented Generation Strategies for Bangla Biomedical Question Answering

Sadia Sultana, Saiyma Sittul Muna, Mosammat Zannatul Samarukh, Ajwad Abrar, Tareque Mohmud Chowdhury

机构 * Department of Computer Science and Engineering, Islamic University of Technology(计算机科学与工程系,伊斯兰技术大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04541 2025-11-07 cs.IR cs.AI 57%

LLM-as-a-Judge: Toward World Models for Slate Recommendation Systems

Baptiste Bonin, Maxime Heuillet, Audrey Durand

机构 * Université Laval (IID)(拉瓦尔大学) Mila – Quebec AI Institute(魁北克人工智能研究所) CIFAR AI CHAIR(CIFAR人工智能主席)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04139 2025-11-07 cs.CL cs.SD 57%

CantoASR: Prosody-Aware ASR-LALM Collaboration for Low-Resource Cantonese

Dazhong Chen, Yi-Cheng Lin, Yuchen Huang, Ziwei Gong, Di Jiang, Zeying Xie, Yi R., Fung

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Hong Kong University of Science and Technology(香港科学与技术大学) National Taiwan University, Taiwan(台湾国立台湾大学) Columbia University(哥伦比亚大学) WeBank Co., Ltd., Shenzhen, China(深圳网商银行有限公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03908 2025-11-07 cs.CL 57%

Context informs pragmatic interpretation in vision-language models

Alvin Wei Ming Tan, Ben Prystawski, Veronica Boyce, Michael C. Frank

机构 * Department of Psychology Stanford University(心理学系 斯坦福大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

Comments Accepted at CogInterp Workshop, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏