arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-11-13 至 2025-11-13 共收录 17 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 17 篇

2508.12495 2025-11-13 cs.CL cs.AI cs.LG 87%

Mitigating Hallucinations in Large Language Models via Causal Reasoning

Yuangang Li, Yiqing Shen, Yi Nian, Jiechao Gao, Ziyi Wang, Chenxiao Yu, Shawn Li, Jie Wang, Xiyang Hu, Yue Zhao

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27042 2025-11-13 cs.AI cs.LG 84%

e1: Learning Adaptive Control of Reasoning Effort

Michael Kleinman, Matthew Trager, Alessandro Achille, Wei Xia, Stefano Soatto

机构 * AWS Agentic AI(AWS智能人工智能)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09478 2025-11-13 cs.LG cs.AI cs.CL 80%

AdaCuRL: Adaptive Curriculum Reinforcement Learning with Invalid Sample Mitigation and Historical Revisiting

Renda Li, Hailang Huang, Fei Wei, Feng Xiong, Yong Wang, Xiangxiang Chu

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09339 2025-11-13 cs.CL 79%

mmJEE-Eval: A Bilingual Multimodal Benchmark for Evaluating Scientific Reasoning in Vision-Language Models

Arka Mukherjee, Shreya Ghosh

机构 * Kalinga Institute of Industrial Technology (KIIT)(喀里亚理工学院) Indian Institute of Technology (IIT), Bhubaneswar(印度理工学院(班加罗尔))

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

Comments Accepted to IJCNLP-AACL Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09438 2025-11-13 cs.LG cs.AI 62%

LLM-Guided Dynamic-UMAP for Personalized Federated Graph Learning

Sai Puppala, Ismail Hossain, Md Jahangir Alam, Tanzim Ahad, Sajedul Talukder

机构 * University of Texas at El Paso(德克萨斯理工大学) Southern Illinois University Carbondale(南方伊利诺伊大学卡本代尔分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09067 2025-11-13 cs.CL cs.AI 62%

MM-CRITIC: A Holistic Evaluation of Large Multimodal Models as Multimodal Critique

Gailun Zeng, Ziyang Luo, Hongzhan Lin, Yuchen Tian, Kaixin Li, Ziyang Gong, Jianxiong Guo, Jing Ma

机构 * Hong Kong Baptist University(香港 Baptist 大学) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港 Baptist 大学) National University of Singapore(新加坡国立大学) Beijing Normal University(北京师范大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

Comments 28 pages, 14 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09539 2025-11-13 cs.CL 57%

SynClaimEval: A Framework for Evaluating the Utility of Synthetic Data in Long-Context Claim Verification

Mohamed Elaraby, Jyoti Prakash Maheswari

机构 * University of Pittsburgh(匹兹堡大学) Zillow Inc.(Zillow公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Journal ref The 5th Workshop on Evaluation & Comparison of NLP Systems, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09313 2025-11-13 cs.CL 57%

Towards Explainable Khmer Polarity Classification

Marry Kong, Rina Buoy, Sovisal Chenda, Nguonly Taing

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09025 2025-11-13 cs.LG 57%

FLAD: Federated Learning for LLM-based Autonomous Driving in Vehicle-Edge-Cloud Networks

Tianao Xiang, Mingjian Zhi, Yuanguo Bi, Lin Cai, Yuhao Chen

机构 * Northeastern University(东北大学) University of Victoria(维多利亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08866 2025-11-13 cs.CL 57%

BioVerge: A Comprehensive Benchmark and Study of Self-Evaluating Agents for Biomedical Hypothesis Generation

Fuyi Yang, Chenchen Ye, Mingyu Derek Ma, Yijia Xiao, Matthew Yang, Wei Wang

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24792 2025-11-13 cs.CV cs.AI 57%

PISA-Bench: The PISA Index as a Multilingual and Multimodal Metric for the Evaluation of Vision-Language Models

Patrick Haller, Fabio Barth, Jonas Golde, Georg Rehm, Alan Akbik

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 8 pages, 11 tables and figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02615 2025-11-13 astro-ph.IM cs.AI 57%

Radio Astronomy in the Era of Vision-Language Models: Prompt Sensitivity and Adaptation

Mariia Drozdova, Erica Lastufka, Vitaliy Kinakh, Taras Holotyak, Daniel Schaerer, Slava Voloshynovskiy

机构 * University of Geneva(日内瓦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Machine Learning and the Physical Sciences Workshop, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13264 2025-11-13 cs.CL 57%

OpenGenAlign: A Preference Dataset and Benchmark for Trustworthy Reward Modeling in Open-Ended, Long-Context Generation

Hanning Zhang, Juntong Song, Juno Zhu, Yuanhao Wu, Tong Zhang, Cheng Niu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) NewsBreak

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Preprint update

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08621 2025-11-13 q-fin.ST cs.AI q-fin.CP 57%

The LLM Pro Finance Suite: Multilingual Large Language Models for Financial Applications

Gaëtan Caillaut, Raheel Qader, Jingshu Liu, Mariam Nakhlé, Arezki Sadoune, Massinissa Ahmim, Jean-Gabriel Barthelemy

机构 * Dragon LLM

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01634 2025-11-13 cs.CR cs.AI 57%

Prompt Injection as an Emerging Threat: Evaluating the Resilience of Large Language Models

Daniyal Ganiuly, Assel Smaiyl

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09058 2025-11-13 cs.CV 50%

VietMEAgent: Culturally-Aware Few-Shot Multimodal Explanation for Vietnamese Visual Question Answering

Hai-Dang Nguyen, Minh-Anh Dang, Minh-Tan Le, Minh-Tuan Le

机构 * Faculty Of Information Technology, VNU University of Engineering and Technology(信息科技学院,越南工程与技术大学) IT-BT Convergence Technology Division, Vietnam-Korea Institute of Science and Technology(IT-BT融合技术部,越南-韩国科学技术院) TADI Global Lab, TADI Global Company Limited(TADI全球实验室,TADI全球公司) Faculty of Finance, Banking Academy of Vietnam(金融学院,越南银行学院)

专题命中 推理评测 :reasoning(abstract)

Comments 7 pages, 3 figures, 3 tables, FAIR 2025 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18145 2025-11-13 cs.CV 50%

CHOICE: Benchmarking the Remote Sensing Capabilities of Large Vision-Language Models

Xiao An, Jiaxing Sun, Zihan Gui, Wei He

机构 * State Key Lab. LIESMARS, Wuhan University(武汉大学遥感信息与地学实验室国家重点实验室)

专题命中 推理评测 :reasoning(abstract)

Comments Accepted by NeurIPS 2025 Track on Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏