arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10577 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10577 篇

2501.02506 2025-05-21 cs.CL 57%

ToolHop: A Query-Driven Benchmark for Evaluating Large Language Models in Multi-Hop Tool Use

Junjie Ye, Zhengyin Du, Xuesong Yao, Weijian Lin, Yufei Xu, Zehui Chen, Zaiyuan Wang, Sining Zhu, Zhiheng Xi, Siyu Yuan, Tao Gui, Qi Zhang, Xuanjing Huang, Jiecao Chen

机构 * Fudan University(复旦大学) ByteDance(字节跳动) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted by ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13535 2025-05-21 cs.IR cs.AI 57%

Information Extraction from Visually Rich Documents using LLM-based Organization of Documents into Independent Textual Segments

Aniket Bhattacharyya, Anurag Tripathi, Ujjal Das, Archan Karmakar, Amit Pathak, Maneesh Gupta

机构 * Amazon(亚马逊)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Accepted to ACL Main 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17821 2025-05-21 cs.CV cs.CL 57%

VideoVista-CulturalLingo: 360$^\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension

Xinyu Chen, Yunxin Li, Haoyuan Shi, Baotian Hu, Wenhan Luo, Yaowei Wang, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17662 2025-05-21 cs.CL 57%

PLAYER*: Enhancing LLM-based Multi-Agent Communication and Interaction in Murder Mystery Games

Qinglin Zhu, Runcong Zhao, Bin Liang, Jinhua Du, Lin Gui, Yulan He

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13348 2025-05-20 cs.CL 57%

Investigating the Vulnerability of LLM-as-a-Judge Architectures to Prompt-Injection Attacks

Narek Maloyan, Bislan Ashinov, Dmitry Namiot

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12798 2025-05-20 cs.AI 57%

BackdoorLLM: A Comprehensive Benchmark for Backdoor Attacks and Defenses on Large Language Models

Yige Li, Hanxun Huang, Yunhan Zhao, Xingjun Ma, Jun Sun

机构 * Singapore Management University(新加坡管理大学) The University of Melbourne(墨尔本大学) Fudan University(复旦大学)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.12132 2025-05-20 cs.AI 57%

Automating construction contract review using knowledge graph-enhanced large language models

Chunmo Zheng, Saika Wong, Xing Su, Yinqiu Tang, Ahsan Nawaz, Mohamad Kassem

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12651 2025-05-20 cs.AI 57%

$\texttt{DIAMONDs}$: A Dataset for $\mathbb{D}$ynamic $\mathbb{I}$nformation $\mathbb{A}$nd $\mathbb{M}$ental modeling $\mathbb{O}$f $\mathbb{N}$umeric $\mathbb{D}$iscussions

Sayontan Ghosh, Mahnaz Koupaee, Yash Kumar Lal, Pegah Alipoormolabashi, Mohammad Saqib Hasan, Jun Seok Kang, Niranjan Balasubramanian

机构 * Department of Computer Science, Stony Brook University(计算机科学系,石英布鲁克大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12534 2025-05-20 cs.LG 57%

ChemPile: A 250GB Diverse and Curated Dataset for Chemical Foundation Models

Adrian Mirza, Nawaf Alampara, Martiño Ríos-García, Mohamed Abdelalim, Jack Butler, Bethany Connolly, Tunca Dogan, Marianna Nezhurina, Bünyamin Şen, Santosh Tirunagari, Mark Worrall, Adamo Young, Philippe Schwaller, Michael Pieler, Kevin Maik Jablonka

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12321 2025-05-20 cs.AI 57%

BeliefNest: A Joint Action Simulator for Embodied Agents with Theory of Mind

Rikunari Sagara, Koichiro Terao, Naoto Iwahashi

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11926 2025-05-20 cs.CV cs.AI 57%

SafeVid: Toward Safety Aligned Video Large Multimodal Models

Yixu Wang, Jiaxin Song, Yifeng Gao, Xin Wang, Yang Yao, Yan Teng, Xingjun Ma, Yingchun Wang, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11533 2025-05-20 cs.CL 57%

A Data Synthesis Method Driven by Large Language Models for Proactive Mining of Implicit User Intentions in Tourism

Jinqiang Wang, Huansheng Ning, Tao Zhu, Jianguo Ding

机构 * School of Computer & Communication Engineering, University of Science and Technology Beijing(信息与通信工程学院,北京科技大学) School of Computer Science, University of South China(计算机科学学院,南方大学) Department of Computer Science, Blekinge institute of Technology(计算机科学系,布莱京厄学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06964 2025-05-20 cs.AI 57%

Bridging AI and Carbon Capture: A Dataset for LLMs in Ionic Liquids and CBE Research

Gaurab Sarkar, Sougata Saha

机构 * State University of New York at Buffalo(纽约州立大学布法罗分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18575 2025-05-20 cs.CR cs.AI 57%

WASP: Benchmarking Web Agent Security Against Prompt Injection Attacks

Ivan Evtimov, Arman Zharmagambetov, Aaron Grattafiori, Chuan Guo, Kamalika Chaudhuri

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Code and data: https://github.com/facebookresearch/wasp

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11405 2025-05-19 cs.CV cs.CL 57%

EmotionHallucer: Evaluating Emotion Hallucinations in Multimodal Large Language Models

Bohao Xing, Xin Liu, Guoying Zhao, Chengyu Liu, Xiaolan Fu, Heikki Kälviäinen

机构 * Lappeenranta-Lahti University of Technology LUT(拉佩兰塔-拉赫蒂技术大学) University of Oulu(奥卢大学) Southeast University(东南大学) Shanghai Jiao Tong University(上海交通大学) Brno University of Technology(布拉格技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10664 2025-05-19 cs.CV cs.AI 57%

CLIP Embeddings for AI-Generated Image Detection: A Few-Shot Study with Lightweight Classifier

Ziyang Ou

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) University of Rochester(罗切斯特大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 8 pages, 5 figures, not submitted to any conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03049 2025-05-19 cs.LG cond-mat.mtrl-sci 57%

34 Examples of LLM Applications in Materials Science and Chemistry: Towards Automation, Assistants, Agents, and Accelerated Scientific Discovery

Yoel Zimmermann, Adib Bazgir, Alexander Al-Feghali, Mehrad Ansari, Joshua Bocarsly, L. Catherine Brinson, Yuan Chiang, Defne Circi, Min-Hsueh Chiu, Nathan Daelman, Matthew L. Evans, Abhijeet S. Gangan, Janine George, Hassan Harb, Ghazal Khalighinejad, Sartaaj Takrim Khan, Sascha Klawohn, Magdalena Lederbauer, Soroush Mahjoubi, Bernadette Mohr, Seyed Mohamad Moosavi, Aakash Naik, Aleyna Beste Ozhan, Dieter Plessers, Aritra Roy, Fabian Schöppach, Philippe Schwaller, Carla Terboven, Katharina Ueltzen, Yue Wu, Shang Zhu, Jan Janssen, Calvin Li, Ian Foster, Ben Blaiszik

机构 * ETH Zurich(苏黎世联邦理工学院) University of Missouri-Columbia(密苏里大学哥伦比亚分校) McGill University(麦吉尔大学) University of Houston(休斯顿大学) Duke University(杜克大学) University of California at Berkeley(加州大学伯克利分校) Lawrence Berkeley National Laboratory(伯克利国家实验室) University of Southern California(南加州大学) Humboldt University of Berlin(柏林洪堡大学) Université catholique de Louvain(列日天主大学) Matgenix SRL(Matgenix公司) University of California, Los Angeles(加州大学洛杉矶分校) Friedrich-Schiller-Universität Jena(耶拿弗里德里希-施莱尔大学) Federal Institute of Materials Research and Testing (BAM)(材料研究与测试联邦机构) Argonne National Laboratory(阿贡国家实验室) University of Toronto(多伦多大学) EPFL(洛桑联邦理工学院) Massachusetts Institute of Technology(麻省理工学院) University of Amsterdam(阿姆斯特丹大学) Acceleration(加速机构)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments arXiv admin note: substantial text overlap with arXiv:2411.15221. This paper is a refinement and analysis of the raw project submissions from arXiv:2411.15221

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10089 2025-05-16 cs.CL 57%

XRAG: Cross-lingual Retrieval-Augmented Generation

Wei Liu, Sony Trenous, Leonardo F. R. Ribeiro, Bill Byrne, Felix Hieber

机构 * Heidelberg Institute for Theoretical Studies gGmbH(海德堡理论研究所) Amazon AGI(亚马逊人工智能研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10083 2025-05-16 cs.LG 57%

ChronoSteer: Bridging Large Language Model and Time Series Foundation Model via Synthetic Data

Chengsen Wang, Qi Qi, Zhongwen Rao, Lujia Pan, Jingyu Wang, Jianxin Liao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09777 2025-05-16 cs.IR cs.CL 57%

A Survey on Large Language Models in Multimodal Recommender Systems

Alejo Lopez-Avila, Jinhua Du

机构 * Huawei London Research Centre(华为伦敦研究中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments 30 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17058 2025-05-15 cs.CR cs.AI 57%

ThreatModeling-LLM: Automating Threat Modeling using Large Language Models for Banking System

Tingmin Wu, Shuiqiao Yang, Shigang Liu, David Nguyen, Seung Jang, Alsharif Abuadbba

机构 * CSIRO’s Data61(CSIRO的数据61)

专题命中 推理评测 :CoT(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09116 2025-05-15 cs.CL 57%

P-MMEval: A Parallel Multilingual Multitask Benchmark for Consistent Evaluation of LLMs

Yidan Zhang, Yu Wan, Boyi Deng, Baosong Yang, Haoran Wei, Fei Huang, Bowen Yu, Junyang Lin, Fei Huang, Jingren Zhou

机构 * Tongyi Lab, Alibaba Group Inc(通义实验室,阿里巴巴集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08744 2025-05-14 cs.AI 57%

DeepMath-Creative: A Benchmark for Evaluating Mathematical Creativity of Large Language Models

Xiaoyang Chen, Xinan Dai, Yu Du, Qian Feng, Naixu Guo, Tingshuo Gu, Yuting Gao, Yingyi Gao, Xudong Han, Xiang Jiang, Yilin Jin, Hongyi Lin, Shisheng Lin, Xiangnan Li, Yuante Li, Yixing Li, Zhentao Lai, Zilu Ma, Yingrong Peng, Jiacheng Qian, Hao-Yu Sun, Jianbo Sun, Zirui Wang, Siwei Wu, Zian Wang, Bin Xu, Jianghao Xu, Yiyang Yu, Zichuan Yang, Hongji Zha, Ruichong Zhang

机构 * School of Mathematical Sciences, Tongji University(同济大学数学科学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01645 2025-05-14 cs.CV cs.AI 57%

HLV-1K: A Large-scale Hour-Long Video Benchmark for Time-Specific Long Video Understanding

Heqing Zou, Tianze Luo, Guiyang Xie, Victor Xiao Jie Zhang, Fengmao Lv, Guangcong Wang, Junyang Chen, Zhuochen Wang, Hansheng Zhang, Huaijian Zhang

机构 * ByteDance(字节跳动) Nanyang Technological University(南洋理工大学) Southwest Jiaotong University(西南交通大学) Great Bay University(大湾大学) Shenzhen University(深圳大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

Comments Accepted to ICME 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07215 2025-05-13 cs.AI 57%

Measuring General Intelligence with Generated Games

Vivek Verma, David Huang, William Chen, Dan Klein, Nicholas Tomlin

机构 * Computer Science Divison University of California, Berkeley(计算机科学系加州大学伯克利分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06418 2025-05-13 cs.CL 57%

Is your multimodal large language model a good science tutor?

Ming Liu, Liwen Wang, Wensheng Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06184 2025-05-12 cs.SI cs.CL cs.IR 57%

From Millions of Tweets to Actionable Insights: Leveraging LLMs for User Profiling

Vahid Rahimzadeh, Ali Hamzehpour, Azadeh Shakery, Masoud Asadpour

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Accepted at MisD @ AAAI ICWSM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06176 2025-05-12 cs.GR cs.CV cs.LG 57%

MonetGPT: Solving Puzzles Enhances MLLMs' Image Retouching Skills

Niladri Shekhar Dutt, Duygu Ceylan, Niloy J. Mitra

机构 * University College London(伦敦大学学院) Adobe Research UK(Adobe英国研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

Comments Accepted at SIGGRAPH 2025 [ACM Transactions on Graphics]; Project website: https://monetgpt.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05949 2025-05-12 cs.CL 57%

NeoQA: Evidence-based Question Answering with Generated News Events

Max Glockner, Xiang Jiang, Leonardo F. R. Ribeiro, Iryna Gurevych, Markus Dreyer

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02835 2025-05-12 cs.CV cs.CL 57%

R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning

Yi-Fan Zhang, Xingyu Lu, Xiao Hu, Chaoyou Fu, Bin Wen, Tianke Zhang, Changyi Liu, Kaiyu Jiang, Kaibing Chen, Kaiyu Tang, Haojie Ding, Jiankang Chen, Fan Yang, Zhang Zhang, Tingting Gao, Liang Wang

机构 * CASIA(中国科学院自动化研究所) THU(清华大学) KuaiShou(快手) NJU(南京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

Comments Home page: https://github.com/yfzhang114/r1_reward

详情

展开后加载摘要…

URL PDF HTML 收藏