arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2506.00233 2025-06-03 cs.AI 57%

Ethical AI: Towards Defining a Collective Evaluation Framework

Aasish Kumar Sharma, Dimitar Kyosev, Julian Kunkel

机构 * Department of Computer Science(计算机科学系) Department of Legal Affairs Alis Grave Nil Private Limited(法律事务部Alis Grave Nil私人有限公司) Faculty of Mathematics and Computer Science(数学与计算机科学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 6 pages, 3 figures, accepted at 8th IEEE International Workshop on Advances in Artificial Intelligence and Machine Learning (AIML 2025): Futuristic AI and ML models & Intelligent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00054 2025-06-03 cs.IR cs.CL 57%

Retrieval-Augmented Generation: A Comprehensive Survey of Architectures, Enhancements, and Robustness Frontiers

Chaitanya Sharma

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17891 2025-06-03 cs.CL 57%

Scaling Diffusion Language Models via Adaptation from Autoregressive Models

Shansan Gong, Shivam Agarwal, Yizhe Zhang, Jiacheng Ye, Lin Zheng, Mukai Li, Chenxin An, Peilin Zhao, Wei Bi, Jiawei Han, Hao Peng, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Apple(苹果公司) Tencent AI Lab(腾讯AI实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments ICLR 2025. (minor updates) Code: https://github.com/HKUNLP/DiffuLLaMA

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03868 2025-06-03 cs.CL 57%

Can Language Models Reason about Individualistic Human Values and Preferences?

Liwei Jiang, Taylor Sorensen, Sydney Levine, Yejin Choi

机构 * University of Washington(华盛顿大学) Google DeepMind(谷歌DeepMind) Stanford University(斯坦福大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Camera Ready at ACL Main 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03448 2025-06-03 cs.HC cs.AI 57%

"Cold, Calculated, and Condescending": How AI Identifies and Explains Ableism Compared to Disabled People

Mahika Phutane, Ananya Seelam, Aditya Vashistha

机构 * Cornell University(康奈尔大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15409 2025-06-03 cs.CL 57%

Awes, Laws, and Flaws From Today's LLM Research

Adrian de Wynter

机构 * Microsoft(微软公司) University of York(约克大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted to ACL 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13533 2025-06-03 cs.CL 57%

Pandora's Box or Aladdin's Lamp: A Comprehensive Analysis Revealing the Role of RAG Noise in Large Language Models

Jinyang Wu, Shuai Zhang, Feihu Che, Mingkuan Feng, Chuyuan Zhang, Pengpeng Shao, Jianhua Tao

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15325 2025-06-03 cs.AI 57%

Odyssey: Empowering Minecraft Agents with Open-World Skills

Shunyu Liu, Yaoru Li, Kongcheng Zhang, Zhenyu Cui, Wenkai Fang, Yuxuan Zheng, Tongya Zheng, Mingli Song

专题命中 推理评测 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24731 2025-06-02 cs.CL 57%

Circuit Stability Characterizes Language Model Generalization

Alan Sun

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24258 2025-06-02 cs.AI 57%

FABLE: A Novel Data-Flow Analysis Benchmark on Procedural Text for Large Language Model Evaluation

Vishal Pallagani, Nitin Gupta, John Aydin, Biplav Srivastava

机构 * University of South Carolina(南卡罗来纳大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24098 2025-06-02 cs.CL 57%

HardTests: Synthesizing High-Quality Test Cases for LLM Coding

Zhongmou He, Yee Man Choi, Kexun Zhang, Jiabao Ji, Junting Zhou, Dejia Xu, Ivan Bercovich, Aidan Zhang, Lei Li

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01986 2025-06-02 cs.AR cs.AI 57%

TuRTLe: A Unified Evaluation of LLMs for RTL Generation

Dario Garcia-Gasulla, Gokcen Kestor, Emanuele Parisi, Miquel Albertí-Binimelis, Cristian Gutierrez, Razine Moundir Ghorab, Orlando Montenegro, Bernat Homs, Miquel Moreto

机构 * Barcelona Supercomputing Center(巴塞罗那超级计算中心) Universitat Politecnica de Catalunya(加泰罗尼亚理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03854 2025-06-02 cs.CL 57%

Vision-Language Models Struggle to Align Entities across Modalities

Iñigo Alonso, Gorka Azkune, Ander Salaberria, Jeremy Barnes, Oier Lopez de Lacalle

机构 * School of Informatics, The University of Edinburgh(信息学院,爱丁堡大学) HiTZ Center - Ixa, University of the Basque Country UPV/EHU(巴斯克国家大学HiTZ中心)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

Comments Accepted Findings ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20662 2025-06-02 cs.CV cs.AI 57%

Enhancing Table Recognition with Vision LLMs: A Benchmark and Neighbor-Guided Toolchain Reasoner

Yitong Zhou, Mingyue Cheng, Qingyang Mao, Feiyang Xu, Xin Li

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) Artificial Intelligence Research Institute, iFLYTEK Co., Ltd(iFLYTEK公司人工智能研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23922 2025-06-02 cs.CV cs.CL 57%

ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding

David Ma, Huaqing Yuan, Xingjian Wang, Qianbo Zang, Tianci Liu, Xinyang He, Yanbin Wei, Jiawei Guo, Ni Jiahui, Zhenzhu Yang, Meng Cao, Shanghaoran Quan, Yizhi Li, Wangchunshu Zhou, Jiaheng Liu, Wenhao Huang, Ge Zhang, Shiwen Ni, Xiaojie Jin

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23598 2025-05-30 cs.LG cs.SE 57%

LLM Performance for Code Generation on Noisy Tasks

Radzim Sendyka, Christian Cabrera, Andrei Paleyes, Diana Robinson, Neil Lawrence

机构 * University of Cambridge(剑桥大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22967 2025-05-30 cs.LG cs.MA 57%

MermaidFlow: Redefining Agentic Workflow Generation via Safety-Constrained Evolutionary Programming

Chengqi Zheng, Jianda Chen, Yueming Lyu, Wen Zheng Terence Ng, Haopeng Zhang, Yew-Soon Ong, Ivor Tsang, Haiyan Yin

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22959 2025-05-30 cs.CL 57%

LLM-based HSE Compliance Assessment: Benchmark, Performance, and Advancements

Jianwei Wang, Mengqi Wang, Yinsi Zhou, Zhenchang Xing, Qing Liu, Xiwei Xu, Wenjie Zhang, Liming Zhu

机构 * University of New South Wales(新南威尔士大学) Data61, CSIRO

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22787 2025-05-30 cs.CL 57%

Can Large Language Models Match the Conclusions of Systematic Reviews?

Christopher Polzak, Alejandro Lozano, Min Woo Sun, James Burgess, Yuhui Zhang, Kevin Wu, Serena Yeung-Levy

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19510 2025-05-30 cs.CL 57%

LLM Meets Scene Graph: Can Large Language Models Understand and Generate Scene Graphs? A Benchmark and Empirical Study

Dongil Yang, Minjin Kim, Sunghwan Kim, Beong-woo Kwak, Minjun Park, Jinseok Hong, Woontack Woo, Jinyoung Yeo

机构 * Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学) Graduate School of Metaverse, KAIST(元宇宙研究生院,韩国科学技术院) Graduate School of Culture Technology, KAIST(文化科技研究生院,韩国科学技术院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15538 2025-05-30 cs.CL cs.CY cs.HC 57%

SOTOPIA-$Ω$: Dynamic Strategy Injection Learning and Social Instruction Following Evaluation for Social Agents

Wenyuan Zhang, Tianyun Liu, Mengxiao Song, Xiaodong Li, Tingwen Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted by ACL 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18411 2025-05-30 cs.AI astro-ph.IM physics.comp-ph 57%

Gravity-Bench-v1: A Benchmark on Gravitational Physics Discovery for Agents

Nolan Koblischke, Hyunseok Jang, Kristen Menou, Mohamad Ali-Dib

机构 * University of Toronto(多伦多大学) New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Accepted at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16555 2025-05-30 cs.CL 57%

Divide and Conquer: A Hybrid Strategy Defeats Multimodal Large Language Models

Yanxu Mao, Peipei Liu, Tiehan Cui, Zhaoteng Yan, Congying Liu, Datao You

机构 * School of Software, Henan University(河南大学软件学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22252 2025-05-29 cs.LG cs.CE 57%

B-XAIC Dataset: Benchmarking Explainable AI for Graph Neural Networks Using Chemical Data

Magdalena Proszewska, Tomasz Danel, Dawid Rymarczyk

机构 * University of Edinburgh(爱丁堡大学) Jagiellonian University(雅盖隆大学) Jagiellonian University, Faculty of Mathematics and Computer Science(雅盖隆大学数学与计算机科学学院) Jagiellonian University, Faculty of Chemistry(雅盖隆大学化学学院) Ardigen SA(Ardigen公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments 26 pages, 16 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22126 2025-05-29 cs.CV cs.AI 57%

SridBench: Benchmark of Scientific Research Illustration Drawing of Image Generation Model

Yifan Chang, Yukang Feng, Jianwen Sun, Jiaxin Ai, Chuanhao Li, S. Kevin Zhou, Kaipeng Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Nankai University(南开大学) Wuhan University(武汉大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21757 2025-05-29 cs.CL 57%

BehaviorSFT: Behavioral Token Conditioning for Clinical Agents Across the Proactivity Spectrum

Yubin Kim, Zhiyuan Hu, Hyewon Jeong, Eugene Park, Shuyue Stella Li, Chanwoo Park, Shiyun Xiong, MingYu Lu, Hyeonhoon Lee, Xin Liu, Daniel McDuff, Cynthia Breazeal, Samir Tulebaev, Hae Won Park

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19674 2025-05-29 cs.CL 57%

Comparing Moral Values in Western English-speaking societies and LLMs with Word Associations

Chaoyi Xiang, Chunhua Liu, Simon De Deyne, Lea Frermann

机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算与信息系统学院) Complex Human Data Hub, The University of Melbourne(墨尔本大学复杂人类数据中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 9 pages,7 figures. Accepted to the ACL 2025 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19623 2025-05-29 cs.IR cs.AI 57%

AgentRecBench: Benchmarking LLM Agent-based Personalized Recommender Systems

Yu Shang, Peijie Liu, Yuwei Yan, Zijing Wu, Leheng Sheng, Yuanqing Yu, Chumeng Jiang, An Zhang, Fengli Xu, Yu Wang, Min Zhang, Yong Li

机构 * Tsinghua University(清华大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04962 2025-05-28 cs.CL cs.SD eess.AS 57%

VoxEval: Benchmarking the Knowledge Understanding Capabilities of End-to-End Spoken Language Models

Wenqian Cui, Xiaoqi Jiao, Ziqiao Meng, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) LIGHTSPEED STUDIOS National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments The Version of Record of this contribution is accepted to ACL 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21106 2025-05-28 cs.AI 57%

Interpreting Social Bias in LVLMs via Information Flow Analysis and Multi-Round Dialogue Evaluation

Zhengyang Ji, Yifan Jia, Shang Gao, Yutao Yue

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Shandong University(山东大学) Institute of Deep Perception Technology, JITRI(深度感知技术研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏