arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2505.04654 2025-05-09 cs.CL 57%

A Comparative Analysis of Ethical and Safety Gaps in LLMs using Relative Danger Coefficient

Yehor Tereshchenko, Mika Hämäläinen

机构 * Metropolia University of Applied Sciences(梅拉利亚应用科学大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Journal ref Proceedings of the 5th International Conference on Natural Language Processing for Digital Humanities, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04441 2025-05-09 cs.LG cs.SE 57%

Towards Effectively Leveraging Execution Traces for Program Repair with Code LLMs

Mirazul Haque, Petr Babkin, Farima Farmahinifarahani, Manuela Veloso

机构 * J. P. Morgan AI Research(摩根大通AI研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03988 2025-05-08 cs.DC cs.AI cs.PF 57%

Can Large Language Models Predict Parallel Code Performance?

Gregory Bolet, Giorgis Georgakoudis, Harshitha Menon, Konstantinos Parasyris, Niranjan Hasabnis, Hayden Estes, Kirk W. Cameron, Gal Oren

机构 * Virginia Tech, USA(弗吉尼亚理工大学) LLNL, USA(劳伦斯利弗莫尔国家实验室) Code Metal, USA(Code Metal公司) Stanford University, Technion, USA(斯坦福大学、技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 5 pages, 4 figures, accepted to AI4Sys Workshop at HPDC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20953 2025-05-07 cs.CL 57%

Clean & Clear: Feasibility of Safe LLM Clinical Guidance

Julia Ive, Felix Jozsa, Nick Jackson, Paulina Bondaronek, Ciaran Scott Hill, Richard Dobson

机构 * University College London(伦敦大学学院) Wolfson Institute of Biomedical Research(生物医学研究沃尔夫森研究所) King’s College Hospital(国王学院医院) National Hospital for Neurology and Neurosurgery(神经病学与神经外科国家医院) King’s College London(伦敦国王学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19187 2025-05-07 cs.CL 57%

BIG-Bench Extra Hard

Mehran Kazemi, Bahare Fatemi, Hritik Bansal, John Palowitch, Chrysovalantis Anastasiou, Sanket Vaibhav Mehta, Lalit K. Jain, Virginia Aglietti, Disha Jindal, Peter Chen, Nishanth Dikkala, Gladys Tyen, Xin Liu, Uri Shalit, Silvia Chiappa, Kate Olszewska, Yi Tay, Vinh Q. Tran, Quoc V. Le, Orhan Firat

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02177 2025-05-06 cs.CL 57%

Measuring Hong Kong Massive Multi-Task Language Understanding

Chuxue Cao, Zhenghao Zhu, Junqi Zhu, Guoying Lu, Siyu Peng, Juntao Dai, Weijie Shi, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Peking University(北京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01560 2025-05-06 cs.CL 57%

AI agents may be worth the hype but not the resources (yet): An initial exploration of machine translation quality and costs in three language pairs in the legal and news domains

Vicent Briva Iglesias, Gokhan Dogru

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14693 2025-05-06 cs.CV cs.AI 57%

Video-MMLU: A Massive Multi-Discipline Lecture Understanding Benchmark

Enxin Song, Wenhao Chai, Weili Xu, Jianwen Xie, Yuxuan Liu, Gaoang Wang

机构 * Zhejiang University(浙江大学) University of Washington(华盛顿大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Lambda, Inc.(Lambda公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Code, docs, and benchmark are all avaliable at https://enxinsong.com/Video-MMLU-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01242 2025-05-05 cs.LG 57%

mwBTFreddy: A Dataset for Flash Flood Damage Assessment in Urban Malawi

Evelyn Chapuma, Grey Mengezi, Lewis Msasa, Amelia Taylor

机构 * Kuyesera AI Lab, Malawi University of Business and Applied Sciences(基耶塞拉人工智能实验室,马拉维应用科学大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 推理评测 :planning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01081 2025-05-05 cs.AI 57%

MADIL: An MDL-based Framework for Efficient Program Synthesis in the ARC Benchmark

Sébastien Ferré

机构 * IRISA(里索斯研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 54 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00989 2025-05-05 cs.CL 57%

VTS-LLM: Domain-Adaptive LLM Agent for Enhancing Awareness in Vessel Traffic Services through Natural Language

Sijin Sun, Liangbin Zhao, Ming Deng, Xiuju Fu

机构 * Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR IHPC)(高性能计算研究所,科技研究局(A*STAR IHPC)) National University of Singapore(国立新加坡大学) Shanghai University(上海大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 8 pages, 5 figures, 7 tablels, submitted to ITSC2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00263 2025-05-02 cs.IR cs.CL 57%

EnronQA: Towards Personalized RAG over Private Documents

Michael J. Ryan, Danmei Xu, Chris Nivera, Daniel Campos

机构 * Stanford University(斯坦福大学) Snowflake(Snowflake公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 26 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19314 2025-05-02 cs.CL 57%

BrowseComp-ZH: Benchmarking Web Browsing Ability of Large Language Models in Chinese

Peilin Zhou, Bruce Leon, Xiang Ying, Can Zhang, Yifan Shao, Qichen Ye, Dading Chong, Zhiling Jin, Chenxuan Xie, Meng Cao, Yuxin Gu, Sixin Hong, Jing Ren, Jian Chen, Chao Liu, Yining Hua

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Peking University(北京大学) Mindverse AI Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Zhejiang University of Technology(浙江工业大学) MBZUAI NIO(蔚来汽车) HSBC(汇丰银行) Harvard T.H. Chan School of Public Health(哈佛大学T.H. Chan公共卫生学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21074 2025-05-01 cs.DB cs.AI 57%

On the Potential of Large Language Models to Solve Semantics-Aware Process Mining Tasks

Adrian Rebmann, Fabian David Schmidt, Goran Glavaš, Han van der Aa

机构 * SAP Signavio SAP SE Center for Artificial Intelligence and Data Science(人工智能与数据科学中心) University of Würzburg(乌尔姆大学) Faculty of Computer Science(计算机科学学院) University of Vienna(维也纳大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 31 pages, submitted to PS

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04907 2025-04-30 cs.CV cs.AI 57%

Video-Bench: Human-Aligned Video Generation Benchmark

Hui Han, Siyuan Li, Jiaqi Chen, Yiwen Yuan, Yuling Wu, Chak Tou Leong, Hanwen Du, Junchen Fu, Youhua Li, Jie Zhang, Chi Zhang, Li-jia Li, Yongxin Ni

机构 * Shanghai Jiao Tong University(上海交通大学) Stanford University(斯坦福大学) Fellou AI(Fellou人工智能) Fudan University(复旦大学) Carnegie Mellon University(卡内基梅隆大学) Peking University(北京大学) Hong Kong Polytechnic University(香港理工大学) University of Glasgow(格拉斯哥大学) City University of Hong Kong(香港城市大学) Westlake University(西湖大学) LiveX AI(LiveX人工智能) National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Accepted by CVPR'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02239 2025-04-29 cs.CL 57%

Pula: Training Large Language Models for Setswana

Nathan Brown, Vukosi Marivate

机构 * Data Science for Social Impact University of Pretoria School of Computing Clemson University(数据科学与社会影响 乌得勒支大学 学术 computing 勃林茅伊大学) Data Science for Social Impact Department of Computer Science University of Pretoria(数据科学与社会影响 计算机科学系 乌得勒支大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments NAACL 2025. 10 pages, 5 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18838 2025-04-29 cs.CL 57%

Toward Generalizable Evaluation in the LLM Era: A Survey Beyond Benchmarks

Yixin Cao, Shibo Hong, Xinze Li, Jiahao Ying, Yubo Ma, Haiyuan Liang, Yantao Liu, Zijun Yao, Xiaozhi Wang, Dan Huang, Wenxuan Zhang, Lifu Huang, Muhao Chen, Lei Hou, Qianru Sun, Xingjun Ma, Zuxuan Wu, Min-Yen Kan, David Lo, Qi Zhang, Heng Ji, Jing Jiang, Juanzi Li, Aixin Sun, Xuanjing Huang, Tat-Seng Chua, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Nanyang Technological University(南洋理工大学) Singapore Management University(新加坡管理学院) Tsinghua University(清华大学) Singapore University of Technology and Design(新加坡科技设计大学) University of California Davis(加州大学戴维斯分校) National University of Singapore(新加坡国立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Australian National University(澳大利亚国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15147 2025-04-29 cs.CL 57%

Latent Factor Models Meets Instructions: Goal-conditioned Latent Factor Discovery without Task Supervision

Zhouhang Xie, Tushar Khot, Bhavana Dalvi Mishra, Harshit Surana, Julian McAuley, Peter Clark, Bodhisattwa Prasad Majumder

机构 * University of California, San Diego(加州大学圣地亚哥分校) Allen Institute for AI(AI研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17967 2025-04-28 cs.AI 57%

LLM Agent Swarm for Hypothesis-Driven Drug Discovery

Kevin Song, Andrew Trotter, Jake Y. Chen

机构 * Systems Pharmacology AI Research Center, The University of Alabama at Birmingham(系统药理学人工智能研究中心,阿拉巴马大学伯明翰分校) Department of Biomedical Engineering, The University of Alabama at Birmingham(生物医学工程系,阿拉巴马大学伯明翰分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17828 2025-04-28 cs.CV cs.AI 57%

VEU-Bench: Towards Comprehensive Understanding of Video Editing

Bozheng Li, Yongliang Wu, Yi Lu, Jiashuo Yu, Licheng Tang, Jiawang Cao, Wenqing Zhu, Yuyang Sun, Jay Wu, Wenbo Zhu

机构 * Opus AI Research(Opus AI研究机构) Brown University(布朗大学) Southeast University(东南大学) University of Toronto(多伦多大学) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Accepted to CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20975 2025-04-28 cs.SE cs.AI cs.DB 57%

Geo-FuB: A Method for Constructing an Operator-Function Knowledge Base for Geospatial Code Generation Tasks Using Large Language Models

Shuyang Hou, Anqi Zhao, Jianyuan Liang, Zhangxiao Shen, Huayi Wu

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17360 2025-04-25 cs.CL 57%

PatientDx: Merging Large Language Models for Protecting Data-Privacy in Healthcare

Jose G. Moreno, Jesus Lovon, M'Rick Robin-Charlet, Christine Damase-Michel, Lynda Tamine

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Journal ref Workshop CL4Health @ NAACL 2025, May 2025, Albuquerque, New Mexico, United States

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22093 2025-04-25 cs.CV cs.AI 57%

How Well Can Vison-Language Models Understand Humans' Intention? An Open-ended Theory of Mind Question Evaluation Benchmark

Ximing Wen, Mallika Mainali, Anik Sen

机构 * College of Computing and Informatics, Drexel University(计算与信息学院,德雷塞尔大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 4 pages, accepted by ToM@AAAI25

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11761 2025-04-24 cs.AI 57%

Harnessing Language for Coordination: A Framework and Benchmark for LLM-Driven Multi-Agent Control

Timothée Anne, Noah Syrkis, Meriem Elhosni, Florian Turati, Franck Legendre, Alain Jaquier, Sebastian Risi

机构 * IT University of Copenhagen(哥本哈根技术大学) armasuisse Science+Technology(armasuisse科学与技术)

专题命中 推理评测 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12766 2025-04-24 cs.CL 57%

NovelQA: Benchmarking Question Answering on Documents Exceeding 200K Tokens

Cunxiang Wang, Ruoxi Ning, Boqi Pan, Tonghui Wu, Qipeng Guo, Cheng Deng, Guangsheng Bao, Xiangkun Hu, Zheng Zhang, Qian Wang, Yue Zhang

机构 * Westlake University(西湖大学) University of Waterloo(多伦多大学) Hangzhou Normal University(杭州师范大学) Shanghai AI Lab(上海人工智能实验室) SJTU(上海交通大学) NYU Shanghai(纽约大学上海分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted by ICLR-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15766 2025-04-23 cs.RO cs.AI 57%

Dynamic Intent Queries for Motion Transformer-based Trajectory Prediction

Tobias Demmler, Lennart Hartung, Andreas Tamke, Thao Dang, Alexander Hegai, Karsten Haug, Lars Mikelsons

机构 * Robert Bosch GmbH(博世公司) Institute for Intelligent Systems(智能系统研究所) University of Augsburg(奥尔登堡大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15527 2025-04-23 cs.CL 57%

Compass-V2 Technical Report

Sophia Maria

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15080 2025-04-22 cs.SE cs.AI 57%

Empowering AI to Generate Better AI Code: Guided Generation of Deep Learning Projects with LLMs

Chen Xie, Mingsheng Jiao, Xiaodong Gu, Beijun Shen

机构 * School of Computer Science, Shanghai Jiao Tong University(计算机科学学院,上海交通大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10074 2025-04-22 cs.AI 57%

MMKB-RAG: A Multi-Modal Knowledge-Based Retrieval-Augmented Generation Framework

Zihan Ling, Zhiyao Guo, Yixuan Huang, Yi An, Shuai Xiao, Jinsong Lan, Xiaoyong Zhu, Bo Zheng

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07346 2025-04-22 cs.CL 57%

BenchMAX: A Comprehensive Multilingual Evaluation Suite for Large Language Models

Xu Huang, Wenhao Zhu, Hanxu Hu, Conghui He, Lei Li, Shujian Huang, Fei Yuan

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) University of Zurich(苏黎世大学) Carnegie Mellon University(卡内基梅隆大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏