arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-09-10 至 2025-09-10 共收录 56 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 7 篇

2405.15302 2025-09-10 cs.AI cs.CL cs.LG 87%

Understanding the Language Model to Solve the Symbolic Multi-Step Reasoning Problem from the Perspective of Buffer Mechanism

Zhiwei Wang, Yunji Wang, Zhongwang Zhang, Zhangchen Zhou, Hui Jin, Tianyang Hu, Jiacheng Sun, Zhenguo Li, Yaoyu Zhang, Zhi-Qin John Xu

机构 * Institute of Natural Sciences, MOE-LSC, Shanghai Jiao Tong University(上海交通大学自然科学院) School of Mathematical Sciences, Shanghai Jiao Tong University(上海交通大学数学学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Huawei Noah’s Ark Lab(华为诺亚实验室) Key Laboratory of Marine Intelligent Equipment and System, Ministry of Education(教育部海洋智能装备与系统重点实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07676 2025-09-10 cs.AI 83%

Unleashing the True Potential of LLMs: A Feedback-Triggered Self-Correction with Long-Term Multipath Decoding

Jipeng Li, Zeyu Gao, Yubin Qi, Hande Dong, Weijian Chen, Qiang Lin

机构 * Tencent(腾讯) Tsinghua University(清华大学) Institute of Dataspace, Hefei Comprehensive National Science Center(数据空间研究所,合肥综合性国家科学中心)

专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06945 2025-09-10 cs.CV cs.AI cs.CL cs.LG 82%

Interleaving Reasoning for Better Text-to-Image Generation

Wenxuan Huang, Shuang Chen, Zheyong Xie, Shaosheng Cao, Shixiang Tang, Yufan Shen, Qingyu Yin, Wenbo Hu, Xiaoman Wang, Yuntian Tang, Junbo Qiao, Yue Guo, Yao Hu, Zhenfei Yin, Philip Torr, Yu Cheng, Wanli Ouyang, Shaohui Lin

机构 * East China Normal University(华东师范大学) The Chinese University of Hong Kong(香港中文大学) Xiaohongshu Inc.(小红书公司) University of California, Los Angeles(加州大学洛杉矶分校) Zhejiang University(浙江大学) University of Oxford(牛津大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07680 2025-09-10 cs.CV cs.LG 79%

CAViAR: Critic-Augmented Video Agentic Reasoning

Sachit Menon, Ahmet Iscen, Arsha Nagrani, Tobias Weyand, Carl Vondrick, Cordelia Schmid

机构 * Google DeepMind(谷歌DeepMind) Columbia University(哥伦比亚大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01370 2025-09-10 cs.CV cs.CL 79%

Understanding Museum Exhibits using Vision-Language Reasoning

Ada-Astrid Balauca, Sanjana Garai, Stefan Balauca, Rasesh Udayakumar Shetty, Naitik Agrawal, Dhwanil Subhashbhai Shah, Yuqian Fu, Xi Wang, Kristina Toutanova, Danda Pani Paudel, Luc Van Gool

机构 * ETH Zürich, Switzerland(苏黎世联邦理工学院,瑞士) Indian Institute of Technology, Varanasi (IIT BHU)(印度瓦拉纳西理工学院(IIT BHU)) Google DeepMind(谷歌DeepMind)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

Comments Accepted at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06982 2025-09-10 cs.LG cs.AI cs.CL 67%

CARE: Decoding Time Safety Alignment via Rollback and Introspection Intervention

Xiaomeng Hu, Fei Huang, Chenhan Yuan, Junyang Lin, Tsung-Yi Ho

机构 * Alibaba Group(阿里巴巴集团) The Chinese University of Hong Kong(香港中文大学)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13905 2025-09-10 cs.AR 50%

Spec2RTL-Agent: Automated Hardware Code Generation from Complex Specifications Using LLM Agent Systems

Zhongzhi Yu, Mingjie Liu, Michael Zimmer, Yingyan Celine Lin, Yong Liu, Haoxing Ren

专题命中 复杂问题求解 :reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 14 篇

2506.00785 2025-09-10 cs.AI cs.CV cs.LG 90%

GeoChain: Multimodal Chain-of-Thought for Geographic Reasoning

Sahiti Yerramilli, Nilay Pande, Rynaa Grover, Jayant Sravan Tamarapalli

机构 * Google(谷歌) Waymo

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05602 2025-09-10 cs.CL 85%

Mitigating Spurious Correlations Between Question and Answer via Chain-of-Thought Correctness Perception Distillation

Hongyan Xie, Yitong Yao, Yikun Ban, Zixuan Huang, Deqing Wang, Zhenhe Wu, Haoxiang Su, Chao Wang, Shuangyong Song

机构 * School of Computer, Beihang University(计算机学院,北航) Institute of Artificial Intelligence (TeleAI)(人工智能研究院(TeleAI))

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL

Comments PrePrint

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17180 2025-09-10 cs.AI cs.CV cs.LG 81%

MaRVL-QA: A Benchmark for Mathematical Reasoning over Visual Landscapes

Nilay Pande, Sahiti Yerramilli, Jayant Sravan Tamarapalli, Rynaa Grover

机构 * Waymo Google(谷歌)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07159 2025-09-10 cs.AI 77%

PaVeRL-SQL: Text-to-SQL via Partial-Match Rewards and Verbal Reinforcement Learning

Heng Hao, Wenjun Hu, Oxana Verkholyak, Davoud Ataee Tarzanagh, Baruch Gutow, Sima Didari, Masoud Faraki, Hankyu Moon, Seungjai Min

机构 * Samsung SDSA(三星 SDSA)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12363 2025-09-10 cs.CV cs.AI cs.CL cs.LG cs.RO 67%

Towards Visuospatial Cognition via Hierarchical Fusion of Visual Experts

Qi Feng

机构 * Kyoto University(京都大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 26 pages, 19 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12791 2025-09-10 cs.CL cs.AI 62%

CTourLLM: Enhancing LLMs with Chinese Tourism Knowledge

Qikai Wei, Mingzhi Yang, Jinqiang Wang, Wenwei Mao, Jiabo Xu, Huansheng Ning

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06980 2025-09-10 cs.LG cs.AI 62%

RLFactory: A Plug-and-Play Reinforcement Learning Post-Training Framework for LLM Multi-Turn Tool-Use

Jiajun Chai, Guojun Yin, Zekun Xu, Chuhuai Yue, Yi Jia, Siyu Xia, Xiaohan Wang, Jiwen Jiang, Xiaoguang Li, Chengqi Dong, Hang He, Wei Lin

机构 * RLFactory Team(RLFactory团队)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06976 2025-09-10 cs.LG cs.AI 62%

A Knowledge-Guided Cross-Modal Feature Fusion Model for Local Traffic Demand Prediction

Lingyu Zhang, Pengfei Xu, Guobin Wu, Jian Liang, Ruiyang Dong, Yunhai Wang, Xuan Song

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07817 2025-09-10 cs.CL cs.MM 57%

Dual Knowledge-Enhanced Two-Stage Reasoner for Multimodal Dialog Systems

Xiaolin Chen, Xuemeng Song, Haokun Wen, Weili Guan, Xiangyu Zhao, Liqiang Nie

机构 * National University of Singapore(新加坡国立大学) Southern University of Science and Technology(南方科技大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) City University of Hong Kong(香港城市大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07190 2025-09-10 cs.CL cs.HC 57%

Rule-Based Moral Principles for Explaining Uncertainty in Natural Language Generation

Zahra Atf, Peter R Lewis

机构 * Faculty of Business and Information Technology(商业与信息技术学院) Ontario Tech University(安大略技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments This paper was accepted for presentation at the 35th IEEE International Conference on Collaborative Advances in Software and Computing. Conference website:https://conf.researchr.org/home/cascon-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07135 2025-09-10 cs.CL 57%

MedBench-IT: A Comprehensive Benchmark for Evaluating Large Language Models on Italian Medical Entrance Examinations

Ruggero Marino Lazzaroni, Alessandro Angioi, Michelangelo Puliga, Davide Sanna, Roberto Marras

机构 * University of Graz(格拉茨大学) OnePix Academy(OnePix学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted as an oral presentation at CLiC-it 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04656 2025-09-10 cs.CL 57%

AraHalluEval: A Fine-grained Hallucination Evaluation Framework for Arabic LLMs

Aisha Alansari, Hamzah Luqman

机构 * Information and Computer Science Department, King Fahd University of Petroleum and Minerals(信息与计算机科学系,国王法赫德石油和矿物大学) SDAIA-KFUPM Joint Research Center for Artificial Intelligence(SDAIA-KFUPM人工智能联合研究中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16661 2025-09-10 cs.CL 57%

A Japanese Language Model and Three New Evaluation Benchmarks for Pharmaceutical NLP

Shinnosuke Ono, Issey Sukeda, Takuro Fujii, Kosei Buma, Shunsuke Sasaki

机构 * EQUES Inc.(EQUES公司) The University of Tokyo(东京大学) University of Tsukuba(筑波大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 15 pages, 9 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07225 2025-09-10 cs.CR 50%

All You Need Is A Fuzzing Brain: An LLM-Powered System for Automated Vulnerability Detection and Patching

Ze Sheng, Qingxiao Xu, Jianwei Huang, Matthew Woodcock, Heqing Huang, Alastair F. Donaldson, Guofei Gu, Jeff Huang

专题命中 推理评测 :reasoning(abstract)

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他推理 5 篇

2509.07768 2025-09-10 cs.CL cs.AI 62%

Are LLMs Enough for Hyperpartisan, Fake, Polarized and Harmful Content Detection? Evaluating In-Context Learning vs. Fine-Tuning

Michele Joshua Maggini, Dhia Merzougui, Rabiraj Bandyopadhyay, Gaël Dias, Fabrice Maurel, Pablo Gamallo

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20454 2025-09-10 cs.LG cs.CL 62%

CoMMIT: Coordinated Multimodal Instruction Tuning

Xintong Li, Junda Wu, Tong Yu, Yu Wang, Xiang Chen, Jiuxiang Gu, Lina Yao, Julian McAuley, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校) Adobe Research(Adobe研究) The University of New South Wales(新南威尔士大学) CSIRO’s Data61(澳大利亚联邦科学与工业研究组织的数据61)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07763 2025-09-10 cs.SE cs.AI cs.PL 57%

What Were You Thinking? An LLM-Driven Large-Scale Study of Refactoring Motivations in Open-Source Projects

Mikel Robredo, Matteo Esposito, Fabio Palomba, Rafael Peñaloza, Valentina Lenarduzzi

机构 * University of Oulu(奥卢大学) University of Salerno(萨勒诺大学) University of Milano-Bicocca(米兰-布雷塞大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07727 2025-09-10 cs.LG cs.DC 57%

MoE-Compression: How the Compression Error of Experts Affects the Inference Accuracy of MoE Model?

Songkai Ma, Zhaorui Zhang, Sheng Di, Benben Liu, Xiaodong Yu, Xiaoyi Lu, Dan Wang

机构 * Department of Computing(计算系) Hong Kong Polytechnic University(香港理工大学) Mathematics and Computer Science Division(数学与计算机科学 division) Argonne National Laboratory(阿贡国家实验室) The University of Hong Kong(香港大学) Stevens Institute of Technology(史蒂文斯理工学院) Department of Computer Science and Engineering(计算机科学与工程系) University of California, Merced(加州大学默塞德分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07399 2025-09-10 cs.CL 57%

The Role of Exploration Modules in Small Language Models for Knowledge Graph Question Answering

Yi-Jie Cheng, Oscar Chew, Yun-Nung Chen

机构 * ASUS National Taiwan University(国立台湾大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

Comments Extended from ACL 2025 SRW

详情

展开后加载摘要…

URL PDF HTML 收藏