arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-09-23 至 2025-09-23 共收录 132 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 39 篇

2502.12970 2025-09-23 cs.CL 79%

Reasoning-to-Defend: Safety-Aware Reasoning Can Defend Large Language Models from Jailbreaking

Junda Zhu, Lingyong Yan, Shuaiqiang Wang, Dawei Yin, Lei Sha

机构 * Beihang University(北京航空航天大学) Baidu Inc.(百度公司) Zhongguancun Laboratory(中关村实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12289 2025-09-23 cs.CL 79%

Evaluating Step-by-step Reasoning Traces: A Survey

Jinu Lee, Julia Hockenmaier

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16372 2025-09-23 cs.AI 79%

Evaluation of Causal Reasoning for Large Language Models in Contextualized Clinical Scenarios of Laboratory Test Interpretation

Balu Bhasuran, Mattia Prosperi, Karim Hanna, John Petrilli, Caretia JeLayne Washington, Zhe He

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17788 2025-09-23 cs.CL cs.AI 79%

One Agent to Serve All: a Lite-Adaptive Stylized AI Assistant for Millions of Multi-Style Official Accounts

Xingyu Fan, Feifei Li, Wenhui Que, Hailong Li

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15293 2025-09-23 cs.CV cs.RO 78%

How Good are Foundation Models in Step-by-Step Embodied Reasoning?

Dinura Dissanayake, Ahmed Heakl, Omkar Thawakar, Noor Ahsan, Ritesh Thawkar, Ketan More, Jean Lahoud, Rao Anwer, Hisham Cholakkal, Ivan Laptev, Fahad Shahbaz Khan, Salman Khan

机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) Linköping University(林雪平大学) Australian National University(澳大利亚国立大学)

专题命中 推理评测 :reasoning(title,abstract)

Comments Project page: https://mbzuai-oryx.github.io/FoMER-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17740 2025-09-23 cs.CV cs.CL 70%

WISE: Weak-Supervision-Guided Step-by-Step Explanations for Multimodal LLMs in Image Classification

Yiwen Jiang, Deval Mehta, Siyuan Yan, Yaling Shen, Zimu Wang, Zongyuan Ge

机构 * Faculty of Engineering, Monash University(墨尔本大学工程学院) AIM for Health Lab, Faculty of IT, Monash University(墨尔本大学信息技术学院健康人工智能实验室)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

Comments Accepted at EMNLP 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17974 2025-09-23 cs.CL cs.CV 70%

Evaluating Fairness in Large Vision-Language Models Across Diverse Demographic Attributes and Prompts

Xuyang Wu, Yuan Wang, Hsin-Tai Wu, Zhiqiang Tao, Yi Fang

机构 * Santa Clara University(圣克拉拉大学) DOCOMO Innovations, Inc.(DOCOMO创新公司) Rochester Institute of Technology(罗切斯特理工学院)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL

Comments EMNLP Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23765 2025-09-23 cs.CL cs.AI cs.LG 67%

From Chat Logs to Collective Insights: Aggregative Question Answering

Wentao Zhang, Woojeong Kim, Yuntian Deng

机构 * University of Waterloo(滑铁卢大学) Cornell University(康奈尔大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Journal ref EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13388 2025-09-23 cs.CL cs.AI cs.LG 67%

R3: Robust Rubric-Agnostic Reward Models

David Anugraha, Zilu Tang, Lester James V. Miranda, Hanyang Zhao, Mohammad Rifqi Farhansyah, Garry Kuwanto, Derry Wijaya, Genta Indra Winata

机构 * Stanford University(斯坦福大学) Boston University(波士顿大学) Columbia University(哥伦比亚大学) University of Toronto(多伦多大学) Institut Teknologi Bandung(Bandung 工程技术大学) Monash University Indonesia(墨尔本大学印尼分校) Capital One

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20099 2025-09-23 cs.CL cs.AI cs.IR 62%

Large Language Models Meet Knowledge Graphs for Question Answering: Synthesis and Opportunities

Chuangtao Ma, Yongrui Chen, Tianxing Wu, Arijit Khan, Haofen Wang

机构 * Aalborg University(奥尔堡大学) Southeast University(东南大学) Bowling Green State University(布雷恩特绿色州立大学) Tongji University(同济大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted at EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00367 2025-09-23 cs.CL cs.AI 62%

KoACD: The First Korean Adolescent Dataset for Cognitive Distortion Analysis via Role-Switching Multi-LLM Negotiation

JunSeo Kim, HyeHyeon Kim

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments Accepted to Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18172 2025-09-23 cs.CL cs.AI 62%

Unmasking Deceptive Visuals: Benchmarking Multimodal Large Language Models on Misleading Chart Question Answering

Zixin Chen, Sicheng Song, Kashun Shum, Yanna Lin, Rui Sheng, Weiqi Wang, Huamin Qu

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 34 pages in total, EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16322 2025-09-23 cs.CL cs.AI cs.HC 62%

SouLLMate: An Application Enhancing Diverse Mental Health Support with Adaptive LLMs, Prompt Engineering, and RAG Techniques

Qiming Guo, Jinwen Tang, Wenbo Sun, Haoteng Tang, Yi Shang, Wenlu Wang

机构 * Texas A&M University - Corpus Christi(德克萨斯A&M大学-科珀斯克里斯蒂分校) University of Missouri(密苏里大学) Delft University of Technology(代尔夫特理工大学) University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德谷分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 26 pages, 19 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11405 2025-09-23 cs.CL 57%

DCR: Quantifying Data Contamination in LLMs Evaluation

Cheng Xu, Nan Yan, Shuhao Guan, Changhong Jin, Yuke Mei, Yibing Guo, M-Tahar Kechadi

机构 * University College Dublin(都柏林大学学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16722 2025-09-23 cs.CL 57%

A Multi-Level Benchmark for Causal Language Understanding in Social Media Discourse

Xiaohan Ding, Kaike Ping, Buse Çarık, Eugenia Rho

机构 * Department of Computer Science, Virginia Tech, USA(计算机科学系,弗吉尼亚理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16720 2025-09-23 cs.CL 57%

Time to Revist Exact Match

Auss Abbood, Zaiqiao Meng, Nigel Collier

机构 * Language Technology Lab University of Cambridge(语言技术实验室剑桥大学) School of Computing Science University of Glasgow(计算科学学院格拉斯哥大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted for Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16686 2025-09-23 cs.CL 57%

EG-MLA: Embedding-Gated Multi-head Latent Attention for Scalable and Efficient LLMs

Zhengge Cai, Haowen Hou

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16679 2025-09-23 cs.CL 57%

Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle

Keliang Liu, Dingkang Yang, Ziyun Qian, Weijie Yin, Yuchi Wang, Hongsheng Li, Jun Liu, Peng Zhai, Yang Liu, Lihua Zhang

机构 * Fudan University(复旦大学) The Chinese University of Hong Kong, MMLab(香港中文大学MMLab) Lancaster University(兰卡斯特大学) Tongji University(同济大学) The University of Toronto(多伦多大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments A Survey of Reinforcement Learning for Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16610 2025-09-23 cs.CL 57%

LLMsPark: A Benchmark for Evaluating Large Language Models in Strategic Gaming Contexts

Junhao Chen, Jingbo Sun, Xiang Li, Haidong Xin, Yuhao Xue, Yibin Xu, Hao Zhao

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Tongji University(同济大学) AIR, Tsinghua University(清华大学人工智能研究院) BAAI(百度人工智能研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted by EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18831 2025-09-23 cs.CL 57%

Measuring Risk of Bias in Biomedical Reports: The RoBBR Benchmark

Jianyou Wang, Weili Cao, Longtian Bao, Youze Zheng, Gil Pasternak, Kaicheng Wang, Xiaoyue Wang, Ramamohan Paturi, Leon Bergen

机构 * Laboratory for Emerging Intelligence(新兴智能实验室) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Published at EMNLP 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15654 2025-09-23 cs.SD eess.AS 50%

EMO-RL: Emotion-Rule-Based Reinforcement Learning Enhanced Audio-Language Model for Generalized Speech Emotion Recognition

Pengcheng Li, Botao Zhao, Zuheng Kang, Junqing Peng, Xiaoyang Qu, Yayun He, Jianzong Wang

专题命中 推理评测 :reasoning(abstract)

Comments Accepted by the Findings of 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP Findings 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20168 2025-09-23 cs.CV 50%

Seeing is Believing? Mitigating OCR Hallucinations in Multimodal Large Language Models

Zhentao He, Can Zhang, Ziheng Wu, Zhenghao Chen, Yufei Zhan, Yifan Li, Zhao Zhang, Xian Wang, Minghui Qiu

机构 * ByteDance(字节跳动) CASIA(中国科学院自动化研究所) RUC(中国人民大学)

专题命中 推理评测 :reasoning(abstract)

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07343 2025-09-23 cs.SE 50%

Code Generation with Small Language Models: A Codeforces-Based Study

Débora Souza, Rohit Gheyi, Lucas Albuquerque, Gustavo Soares, Márcio Ribeiro

专题命中 推理评测 :reasoning(abstract)

Comments Accepted at International Conference on Machine Learning and Applications (ICMLA 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 19 篇

2509.17380 2025-09-23 cs.AI 83%

Correlation or Causation: Analyzing the Causal Structures of LLM and LRM Reasoning Process

Zhizhang FU, Guangsheng Bao, Hongbo Zhang, Chenkai Hu, Yue Zhang

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17287 2025-09-23 cs.CL 83%

FastCuRL: Curriculum Reinforcement Learning with Stage-wise Context Scaling for Efficient Training R1-like Reasoning Models

Mingyang Song, Mao Zheng, Zheng Li, Wenjie Yang, Xuan Luo, Yue Pan, Feng Zhang

机构 * Tencent Hunyuan(腾讯文英)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract);分类 cs.CL

Comments Accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20936 2025-09-23 cs.LG cs.AI cs.CL 82%

Dissecting Persona-Driven Reasoning in Language Models via Activation Patching

Ansh Poonia, Maeghal Jain

机构 * Independent(独立研究者)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP (Findings) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14063 2025-09-23 cs.CL 79%

Collaborative Rational Speech Act: Pragmatic Reasoning for Multi-Turn Dialog

Lautaro Estienne, Gabriel Ben Zenou, Nona Naderi, Jackie Cheung, Pablo Piantanida

机构 * International Laboratory on Learning Systems (ILLS)(国际学习系统实验室) Laboratoire Interdisciplinaire des Sciences du Numérique (LISN)(跨学科数字科学实验室) Mila - Quebec AI Institute(魁北克人工智能研究所) CNRS(法国国家科学研究中心) CentraleSupélec(中央超导研究所) Université Paris-Saclay(巴黎萨克雷大学) McGill University(麦吉尔大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18635 2025-09-23 cs.LG 79%

STRATA-TS: Selective Knowledge Transfer for Urban Time Series Forecasting with Retrieval-Guided Reasoning

Yue Jiang, Chenxi Liu, Yile Chen, Qin Chao, Shuai Liu, Cheng Long, Gao Cong

机构 * Nanyang Technological University(南洋理工大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09712 2025-09-23 cs.CL cs.AI 79%

The Thinking Therapist: Training Large Language Models to Deliver Acceptance and Commitment Therapy using Supervised Fine-Tuning and Odds Ratio Policy Optimization

Talha Tahir

机构 * Department of Psychiatry University of Toronto(精神病学系多伦多大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18076 2025-09-23 cs.AI 77%

Improving Large Language Models Function Calling and Interpretability via Guided-Structured Templates

Hy Dang, Tianyi Liu, Zhuofeng Wu, Jingfeng Yang, Haoming Jiang, Tao Yang, Pei Chen, Zhengyang Wang, Helen Wang, Huasheng Li, Bing Yin, Meng Jiang

机构 * University of Notre Dame(诺丁汉大学) Amazon(亚马逊)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

Comments Accepted to EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏