arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-08-20 至 2025-08-20 共收录 118 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 14 篇

2508.13172 2025-08-20 cs.AR cs.AI cs.CL 86%

White-Box Reasoning: Synergizing LLM Strategy and gm/Id Data for Automated Analog Circuit Design

Jianqiu Chen, Siqi Li, Xu He

机构 * Shanghai Hynitron Technology Co., Ltd, Shanghai, China(上海宏讯科技有限公司) College of Information Science and Engineering, Hunan University, Changsha, China(信息科学与工程学院,湖南大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 8 pages, 4 figures, 7 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13721 2025-08-20 cs.AI 85%

CausalPlan: Empowering Efficient LLM Multi-Agent Collaboration Through Causality-Driven Planning

Minh Hoang Nguyen, Van Dai Do, Dung Nguyen, Thin Nguyen, Hung Le

机构 * Applied Artificial Intelligence Initiative (A 2 I 2 )(应用人工智能倡议) Deakin University(德金大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13382 2025-08-20 cs.CL cs.AI 81%

Datarus-R1: An Adaptive Multi-Step Reasoning LLM for Automated Data Analysis

Ayoub Ben Chaliah, Hela Dellagi

专题命中 推理与问题求解 :LLM(title);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13579 2025-08-20 cs.AI 77%

Toward Better EHR Reasoning in LLMs: Reinforcement Learning with Expert Attention Guidance

Yue Fang, Yuxin Guo, Jiaran Gao, Hongxin Ding, Xinke Jiang, Weibin Liao, Yongxin Xu, Yinghao Zhu, Zhibang Yang, Liantao Ma, Junfeng Zhao, Yasha Wang

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00424 2025-08-20 cs.AI 77%

Hawkeye:Efficient Reasoning with Model Collaboration

Jianshu She, Zhuohao Li, Zhemin Huang, Qi Li, Peiran Xu, Haonan Li, Qirong Ho

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(莫扎伊德·本·泽亚德人工智能大学) University of California, Los Angeles(加州大学洛杉矶分校) Stanford University(斯坦福大学) Independent Researcher(独立研究者)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05844 2025-08-20 cs.AI cs.CL cs.DB 73%

LEGO-GraphRAG: Modularizing Graph-based Retrieval-Augmented Generation for Design Space Exploration

Yukun Cao, Zengyi Gao, Zhiyang Li, Xike Xie, S. Kevin Zhou, Jianliang Xu

机构 * University of Science and Technology of China(中国科学技术大学) Hong Kong Baptist University(香港 Baptist 大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments VLDB'2025 [Experiment, Analysis & Benchmark]

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13365 2025-08-20 cs.CL 70%

Stands to Reason: Investigating the Effect of Reasoning on Idiomaticity Detection

Dylan Phelps, Rodrigo Wilkens, Edward Gow-Smith, Thomas Pickard, Maggie Mi, Aline Villavicencio

机构 * School of Computer Science, University of Sheffield, UK(谢菲尔德大学计算机科学学院) Healthy Lifespan Institute, University of Sheffield(谢菲尔德大学健康寿命研究所) Institute of Data Science and Artificial Intelligence, University of Exeter, UK(埃克塞特大学数据科学与人工智能研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06189 2025-08-20 cs.CV 67%

MA-CBP: A Criminal Behavior Prediction Framework Based on Multi-Agent Asynchronous Collaboration

Cheng Liu, Daou Zhang, Tingxu Liu, Yuhan Wang, Jinyang Chen, Yuexuan Li, Xinying Xiao, Chenbo Xin, Ziru Wang, Weichao Wu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13465 2025-08-20 cs.AI 57%

LM Agents May Fail to Act on Their Own Risk Knowledge

Yuzhi Tang, Tianxiao Li, Elizabeth Li, Chris J. Maddison, Honghua Dong, Yangjun Ruan

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13371 2025-08-20 cs.AI 57%

LOOP: A Plug-and-Play Neuro-Symbolic Framework for Enhancing Planning in Autonomous Systems

Ronit Virwani, Ruchika Suryawanshi

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

Comments Submitted to IAAI-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12314 2025-08-20 cs.MA cs.AI nlin.AO 57%

Synchronization Dynamics of Heterogeneous, Collaborative Multi-Agent AI Systems

Chiranjit Mitra

机构 * Independent Researcher(独立研究者)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 30 篇

2508.13257 2025-08-20 cs.AR cs.AI 89%

ViTAD: Timing Violation-Aware Debugging of RTL Code using Large Language Models

Wenhao Lv, Yingjie Xia, Xiyuan Chen, Li Kuang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13938 2025-08-20 cs.CL cs.CV 88%

MME-SCI: A Comprehensive and Challenging Science Benchmark for Multimodal Large Language Models

Jiacheng Ruan, Dan Jiang, Xian Gao, Ting Liu, Yuzhuo Fu, Yangyang Kang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 9 pages, 6 figures, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13206 2025-08-20 cs.CL 88%

BQA: Body Language Question Answering Dataset for Video Large Language Models

Shintaro Ozaki, Kazuki Hayashi, Miyu Oba, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted to ACL2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05668 2025-08-20 cs.IR cs.AI cs.CL 86%

A Survey of LLM-based Deep Search Agents: Paradigm, Optimization, Evaluation, and Challenges

Yunjia Xi, Jianghao Lin, Yongzhao Xiao, Zheli Zhou, Rong Shan, Te Gao, Jiachen Zhu, Weiwen Liu, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13196 2025-08-20 cs.LG cs.AI cs.IR 86%

Contextual Attention-Based Multimodal Fusion of LLM and CNN for Sentiment Analysis

Meriem Zerkouk, Miloud Mihoubi, Belkacem Chikhaoui

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments The 38th Canadian Conference on Artificial Intelligence ( 2025 )

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13774 2025-08-20 cs.SE cs.AI 85%

Agentic DraCor and the Art of Docstring Engineering: Evaluating MCP-empowered LLM Usage of the DraCor API

Peer Trilcke, Ingo Börner, Henny Sluyter-Gäthje, Daniil Skorinkin, Frank Fischer, Carsten Milling

机构 * University of Potsdam, Germany(波恩大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Preprint, submitted to the 2nd Workshop on Computational Drama Analysis at DraCor Summit 2025, September 03, 2025, Berlin, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13162 2025-08-20 cs.AR cs.LG 85%

FedChip: Federated LLM for Artificial Intelligence Accelerator Chip Design

Mahmoud Nazzal, Khoa Nguyen, Deepak Vungarala, Ramtin Zand, Shaahin Angizi, Hai Phan, Abdallah Khreishah

机构 * New Jersey Institute of Technology(新泽西理工学院) University of South Carolina(南卡罗来纳大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13543 2025-08-20 cs.HC 85%

"Can You See Me Think?" Grounding LLM Feedback in Keystrokes and Revision Patterns

Samra Zafar, Shifa Yousaf, Muhammad Shaheer Minhas

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments 15 pages, 4 figures, 6 tables, Submitted to IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13757 2025-08-20 cs.SE cs.AI 84%

COMPASS: A Multi-Dimensional Benchmark for Evaluating Code Generation in Large Language Models

James Meaden, Michał Jarosz, Piotr Jodłowski, Grigori Melnik

机构 * Codility

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13524 2025-08-20 cs.CV cs.AI 79%

Evaluating Open-Source Vision Language Models for Facial Emotion Recognition against Traditional Deep Learning Models

Vamsi Krishna Mulukutla, Sai Supriya Pavarala, Srinivasa Raju Rudraraju, Sridevi Bonthu

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

Journal ref EAI Endorsed Transactions on AI and Robotics, 4, August 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04125 2025-08-20 cs.SE cs.CR cs.LG 77%

VulScribeR: Exploring RAG-based Vulnerability Augmentation with LLMs

Seyed Shayan Daneshvar, Yu Nong, Xu Yang, Shaowei Wang, Haipeng Cai

机构 * University of Manitoba(曼尼托巴大学) Washington State University(华盛顿州立大学) University at Buffalo(布法罗大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments Accepted by TOSEM; 26 pages, 6 figures, 8 tables, 3 prompt templates, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13214 2025-08-20 cs.CR cs.AI 77%

Too Easily Fooled? Prompt Injection Breaks LLMs on Frustratingly Simple Multiple-Choice Questions

Xuyang Guo, Zekai Huang, Zhao Song, Jiahao Zhang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10736 2025-08-20 cs.CL 77%

Model Performance-Guided Evaluation Data Selection for Effective Prompt Optimization

Ximing Dong, Shaowei Wang, Dayi Lin, Ahmed E. Hassan

机构 * Centre for Software Excellence, Huawei, Canada(华为加拿大软件卓越中心) Department of Computer Science, University of Manitoba, Canada(曼尼托巴大学计算机科学系) School of Computing, Queen’s University, Canada(皇后大学计算学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments ACL 2025, Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21447 2025-08-20 cs.SE cs.ET 75%

LLM4VV: Evaluating Cutting-Edge LLMs for Generation and Evaluation of Directive-Based Parallel Programming Model Compiler Tests

Zachariah Sollenberger, Rahul Patel, Saieda Ali Zada, Sunita Chandrasekaran

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05064 2025-08-20 cs.GR cs.CL cs.CV 70%

A Study of the Framework and Real-World Applications of Language Embedding for 3D Scene Understanding

Mahmoud Chick Zaouali, Todd Charter, Yehor Karpichev, Brandon Haworth, Homayoun Najjaran

机构 * Faculty of Engineering and Computer Science, University of Victoria(工程与计算机科学学院,维多利亚大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13701 2025-08-20 eess.IV cs.CV 67%

subCellSAM: Zero-Shot (Sub-)Cellular Segmentation for Hit Validation in Drug Discovery

Jacob Hanimann, Daniel Siegismund, Mario Wieser, Stephan Steigele

机构 * University of Bern, Bern, Switzerland(伯尔尼大学) Genedata AG, Basel, Switzerland(基因数据公司)

专题命中 评测与基准 :foundation model(abstract);prompting(abstract)

Comments Accepted at DAGM German Conference on Pattern Recognition (GCPR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13833 2025-08-20 cs.CL cs.AI 62%

Extracting Structured Requirements from Unstructured Building Technical Specifications for Building Information Modeling

Insaf Nahri, Romain Pinquié, Philippe Véron, Nicolas Bus, Mathieu Thorel

机构 * LISPEN EA 7515, Arts et Métiers Institute of Technology(LISPEN EA 7515,艺术与技术理工学院) Information System and Applications Division, CSTB(信息系统与应用部门,CSTB) Univ. Grenoble Alpes, CNRS, Grenoble INP, G-SCOP(格勒诺布尔阿尔卑斯大学,CNRS,格勒诺布尔INP,G-SCOP)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13816 2025-08-20 cs.CL cs.AI 62%

The illusion of a perfect metric: Why evaluating AI's words is harder than it looks

Maria Paz Oliva, Adriana Correia, Ivan Vankov, Viktor Botev

机构 * Iris AI Borgen, Norway(Iris AI 布尔根,挪威) Iris AI Neurobiology BAS Sofia, Bulgaria(Iris AI 神经生物学 BAS 萨福ia,保加利亚) Iris AI Sofia, Bulgaria(Iris AI 萨福ia,保加利亚)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

Comments 11 pages, 1 figure. Accepted to RANLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06627 2025-08-20 cs.LG cs.AI 62%

Early Detection of Pancreatic Cancer Using Multimodal Learning on Electronic Health Records

Mosbah Aouad, Anirudh Choudhary, Awais Farooq, Steven Nevers, Lusine Demirkhanyan, Bhrandon Harris, Suguna Pappu, Christopher Gondi, Ravishankar Iyer

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

Journal ref Proceedings of Machine Learning for Healthcare (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏