arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-09-03 至 2025-09-03 共收录 126 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 24 篇

2509.01324 2025-09-03 cs.CL 79%

KoBLEX: Open Legal Question Answering with Multi-hop Reasoning

Jihyung Lee, Daehui Kim, Seonjeong Hwang, Hyounghun Kim, Gary Lee

机构 * Graduate School of Artificial Intelligence, POSTECH, Republic of Korea(人工智能研究生院,POSTECH,韩国) Department of Computer Science and Engineering, POSTECH, Republic of Korea(计算机科学与工程系,POSTECH,韩国) AI Future Lab, KT, Republic of Korea(AI未来实验室,KT,韩国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00134 2025-09-03 cs.CL 79%

Personalized Causal Graph Reasoning for LLMs: An Implementation for Dietary Recommendations

Zhongqi Yang, Amir Rahmani

机构 * Department of Computer Science, University of California, Irvine(加州大学尔湾分校计算机科学系) School of Nursing, University of California, Irvine(加州大学尔湾分校护理学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00425 2025-09-03 cs.CL 79%

The Gold Medals in an Empty Room: Diagnosing Metalinguistic Reasoning in LLMs with Camlang

Fenghua Liu, Yulong Chen, Yixuan Liu, Zhujun Jin, Solomon Tsai, Ming Zhong

机构 * University of Cambridge(剑桥大学) University of Oxford(牛津大学) UIUC(伊利诺伊大学香槟分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19944 2025-09-03 cs.CV cs.CL 79%

KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts

Taebaek Hwang, Minseo Kim, Gisang Lee, Seonuk Kim, Hyunjun Eun

机构 * Waddle Seoul National University(首尔国立大学) Krafton UNIST(全南大学) SK Telecom(SK电信)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21471 2025-09-03 cs.AI 79%

LUMIR: an LLM-Driven Unified Agent Framework for Multi-task Infrared Spectroscopy Reasoning

Zujie Xie, Zixuan Chen, Jiheng Liang, Xiangyang Yu, Ziru Yu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18798 2025-09-03 cs.CL 79%

Distill Visual Chart Reasoning Ability from LLMs to MLLMs

Wei He, Zhiheng Xi, Wanxu Zhao, Xiaoran Fan, Yiwen Ding, Zifei Shan, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * School of Computer Science, Fudan University(复旦大学计算机学院) Weixin Group, Tencent(腾讯Weixin部门) Shanghai Innovation Institute(上海创新研究院) Shanghai Key Lab of Intelligent Information Processing(上海智能信息处理重点实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 Findings. The code and dataset are publicly available at https://github.com/hewei2001/ReachQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20356 2025-09-03 cs.CV 78%

Detecting Visual Information Manipulation Attacks in Augmented Reality: A Multimodal Semantic Reasoning Approach

Yanming Xiu, Maria Gorlatova

机构 * Duke University(杜克大学)

专题命中 推理评测 :reasoning(title,abstract)

Comments The paper has been accepted to the 2025 IEEE International Symposium on Mixed and Augmented Reality (ISMAR), and selected for publication in the 2025 IEEE Transactions on Visualization and Computer Graphics (TVCG) special issue

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02198 2025-09-03 cs.CL 70%

FActBench: A Benchmark for Fine-grained Automatic Evaluation of LLM-Generated Text in the Medical Domain

Anum Afzal, Juraj Vladika, Florian Matthes

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14446 2025-09-03 cs.CV cs.LG 70%

VLM-AD: End-to-End Autonomous Driving through Vision-Language Model Supervision

Yi Xu, Yuxin Hu, Zaiwei Zhang, Gregory P. Meyer, Siva Karthik Mustikovela, Siddhartha Srinivasa, Eric M. Wolff, Xin Huang

机构 * Cruise LLC (GM)(Cruise LLC(GM)) Northeastern University(东北大学) OpenAI(开放人工智能研究所) Meta University of Washington(华盛顿大学) Waymo LLC

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.LG

Comments Accepted by CoRL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02359 2025-09-03 cs.CV 67%

Why Do MLLMs Struggle with Spatial Understanding? A Systematic Analysis from Data to Architecture

Wanyue Zhang, Yibin Huang, Yangbin Xu, JingJing Huang, Helu Zhi, Shuo Ren, Wang Xu, Jiajun Zhang

专题命中 推理评测 :reasoning(abstract);planning(abstract)

Comments The benchmark MulSeT is available at https://huggingface.co/datasets/WanyueZhang/MulSeT

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01321 2025-09-03 cs.LG cs.CL 62%

Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward

Xinyu Tang, Zhenduo Zhang, Yurou Liu, Wayne Xin Zhao, Zujie Wen, Zhiqiang Zhang, Jun Zhou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China 2 Ant Group(中国人民大学北京校区人工智能学院,中国人民大学 2 抗集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01166 2025-09-03 cs.CL cs.AI 62%

Enhancing Large Language Model for Knowledge Graph Completion via Structure-Aware Alignment-Tuning

Yu Liu, Yanan Cao, Xixun Lin, Yanmin Shang, Shi Wang, Shirui Pan

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Griffith University(格里菲斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025, Main, Long Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08529 2025-09-03 cs.AI cs.CL 62%

A Multi-granularity Concept Sparse Activation and Hierarchical Knowledge Graph Fusion Framework for Rare Disease Diagnosis

Mingda Zhang, Na Zhao, Jianglong Qin, Guoyu Ye, Ruixiang Tang

机构 * School of Software, Yunnan University(云南大学软件学院) Yunnan Key Laboratory of Software Engineering(云南软件工程重点实验室) Yunnan Provincial Hospital of Traditional Chinese Medicine(云南中医药省人民医院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 12 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04078 2025-09-03 cs.CL cs.AI 62%

LLMEval-Med: A Real-world Clinical Benchmark for Medical LLMs with Physician Validation

Ming Zhang, Yujiong Shen, Zelin Li, Huayu Sha, Binze Hu, Yuhui Wang, Chenhao Huang, Shichun Liu, Jingqi Tong, Changhao Jiang, Mingxu Chai, Zhiheng Xi, Shihan Dou, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学) Shanghai Key Lab of Intelligent Information Processing(上海智能信息处理重点实验室) Shanghai AI Laboratory(上海人工智能实验室) Northwestern University(西北大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01213 2025-09-03 cs.CL 57%

Mitigating Catastrophic Forgetting in Continual Learning through Model Growth

Ege Süalp, Mina Rezaei

机构 * Department of Statistics Ludwig-Maximilian University(统计系路德维希-马克西米利安大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16647 2025-09-03 cs.CV cs.AI 57%

Point, Detect, Count: Multi-Task Medical Image Understanding with Instruction-Tuned Vision-Language Models

Sushant Gautam, Michael A. Riegler, Pål Halvorsen

机构 * Simula Metropolitan Center for Digital Engineering (SimulaMet), Norway(Simula数字工程中心(SimulaMet)) Oslo Metropolitan University (OsloMet), Norway(奥斯陆 Metropolitan 大学(OsloMet)) Simula Research Laboratory, Norway(Simula研究实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Accepted as a full paper at the 38th IEEE International Symposium on Computer-Based Medical Systems (CBMS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01311 2025-09-03 cs.CL 57%

FactGenius: Combining Zero-Shot Prompting and Fuzzy Relation Mining to Improve Fact Verification with Knowledge Graphs

Sushant Gautam

机构 * Simula Metropolitan Center for Digital Engineering(模拟元数字工程中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments accepted and presented at the 6th IN5550 Workshop on Neural Natural Language Processing (WNNLP 2024) at the University of Oslo, Norway

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13923 2025-09-03 cs.CL 57%

Why Not Transform Chat Large Language Models to Non-English?

Xiang Geng, Ming Zhu, Jiahuan Li, Zhejian Lai, Wei Zou, Shuaijie She, Jiaxin Guo, Xiaofeng Zhao, Yinglu Li, Yuang Li, Chang Su, Yanqing Zhao, Xinglin Lyu, Min Zhang, Jiajun Chen, Hao Yang, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, Nanjing 210023, China(新型软件技术国家重点实验室,南京大学,南京) Translation Services Center, Huawei Inc., Beijing 100085, China(翻译服务部,华为公司,北京)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

Comments The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-025-50646-z}

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00484 2025-09-03 cs.CV cs.AI 57%

VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding

Zhihong Zhang, Xiaojian Huang, Jin Xu, Zhuodong Luo, Xinzhi Wang, Jiansheng Wei, Xuejin Chen

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments https://videorewardbench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00373 2025-09-03 cs.CV cs.AI 57%

Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models

Sihao Wu, Gaojie Jin, Wei Huang, Jianhong Wang, Xiaowei Huang

机构 * University of Liverpool(利物浦大学) University of Exeter(埃克塞特大学) Purple Mountain Laboratories(紫金山实验室) University of Bristol(布里斯托大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09698 2025-09-03 cs.RO cs.AI 57%

ManipBench: Benchmarking Vision-Language Models for Low-Level Robot Manipulation

Enyu Zhao, Vedant Raval, Hejia Zhang, Jiageng Mao, Zeyu Shangguan, Stefanos Nikolaidis, Yue Wang, Daniel Seita

机构 * Department of Computer Science, University of Southern California(计算机科学系,南加州大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Conference on Robot Learning (CoRL) 2025. 50 pages and 30 figures. v2 is the camera-ready and includes a few more new experiments compared to v1

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 15 篇

2509.01885 2025-09-03 cs.CL cs.AI 81%

Extracting OPQRST in Electronic Health Records using Large Language Models with Reasoning

Zhimeng Luo, Abhibha Gupta, Adam Frisch, Daqing He

机构 * School of Computing and Information University of Pittsburgh(计算与信息学院 西弗吉尼亚大学) Department of Emergency Medicine University of Pittsburgh(急诊医学系 西弗吉尼亚大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00309 2025-09-03 cs.CL 79%

Balanced Actor Initialization: Stable RLHF Training of Distillation-Based Reasoning Models

Chen Zheng, Yiyuan Ma, Yuan Yang, Deyi Liu, Jing Liu, Zuquan Song, Yuxin Song, Cheng Ren, Hang Zhu, Xin Liu, Yiyuan Ma, Siyuan Qiao, Xun Zhou, Liang Xiang, Yonghui Wu

机构 * Peking University(北京大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17761 2025-09-03 cs.LG 79%

Towards a Unified Textual Graph Framework for Spectral Reasoning via Physical and Chemical Information Fusion

Jiheng Liang, Ziru Yu, Zujie Xie, Yuchen Guo, Yulan Guo, Xiangyang Yu

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

Comments We need to further modify and supplement the experiment

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03598 2025-09-03 cs.CL cs.AI 79%

Auto prompt sql: a resource-efficient architecture for text-to-sql translation in constrained environments

Zetong Tang, Qian Ma, Di Wu

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments 4 pages,2 figures,EITCE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01379 2025-09-03 cs.CL 70%

WATCHED: A Web AI Agent Tool for Combating Hate Speech by Expanding Data

Paloma Piot, Diego Sánchez, Javier Parapar

机构 * IRLab, CITIC, Universidade da Coruña, Spain(IR实验室、CITIC、科鲁纳大学、西班牙)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02036 2025-09-03 cs.CL cs.AI 62%

DeepSeek performs better than other Large Language Models in Dental Cases

Hexian Zhang, Xinyu Yan, Yanqi Yang, Lijian Jin, Ping Yang, Junwen Wang

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Abstract word count: 171; Total word count: 3130; Total number of tables: 2; Total number of figures: 3; Number of references: 32

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01565 2025-09-03 q-bio.QM cs.AI cs.DB cs.LG 62%

Enabling Down Syndrome Research through a Knowledge Graph-Driven Analytical Framework

Madan Krishnamurthy, Surya Saha, Pierrette Lo, Patricia L. Whetzel, Tursynay Issabekova, Jamed Ferreris Vargas, Jack DiGiovanna, Melissa A Haendel

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00935 2025-09-03 cs.LG cs.AI 62%

SCOUT: Toward Sub-Quadratic Attention via Segment Compression for Optimized Utility in Transformers

Aref Jafari, Yuhe Fan, Benyamin Jamialahmadi, Parsa Farinneya, Boxing Chen, Marzieh S. Tahaei

机构 * AAAI Press(AAAI出版社)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00053 2025-09-03 cs.MM cs.AI cs.CL 62%

Traj-MLLM: Can Multimodal Large Language Models Reform Trajectory Data Mining?

Shuo Liu, Di Yao, Yan Lin, Gao Cong, Jingping Bi

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Department of Computer Science, Aalborg University(奥胡斯大学计算机科学系) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 20 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏