arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-08-21 至 2025-08-21 共收录 119 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 19 篇

2410.03136 2025-08-21 cs.CL 79%

Deliberate Reasoning in Language Models as Structure-Aware Planning with an Accurate World Model

Siheng Xiong, Ali Payani, Yuan Yang, Faramarz Fekri

机构 * Georgia Institute of Technology(佐治亚理工学院) Cisco Research(思科研究)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

Comments ACL25 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14300 2025-08-21 cs.CR cs.CL cs.MA cs.NI 77%

MultiFuzz: A Dense Retrieval-based Multi-Agent System for Network Protocol Fuzzing

Youssef Maklad, Fares Wael, Ali Hamdi, Wael Elsersy, Khaled Shaban

机构 * Dept. of Computer Science, Qatar University, Doha, Qatar(计算机科学系,卡塔尔大学,多哈)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12769 2025-08-21 cs.CL cs.AI 73%

CRED-SQL: Enhancing Real-world Large Scale Database Text-to-SQL Parsing through Cluster Retrieval and Execution Description

Shaoming Duan, Zirui Wang, Chuanyi Liu, Zhibin Zhu, Yuhao Zhang, Peiyi Han, Liang Yan, Zewu Peng

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Pengcheng Laboratory, Shenzhen, China(鹏城实验室) Inspur Cloud Information Technology Co., Ltd, Jinan 250101, China(浪潮云信息技术有限公司) Guangdong Power Grid Co., Ltd, China(广东电网公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14055 2025-08-21 cs.CL cs.AI 73%

T-REX: Table -- Refute or Entail eXplainer

Tim Luka Horstmann, Baptiste Geisenberger, Mehwish Alam

机构 * Institut Polytechnique de Paris(巴黎政治科技学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14644 2025-08-21 cs.AI 70%

LeanGeo: Formalizing Competitional Geometry problems in Lean

Chendong Song, Zihan Wang, Frederick Pu, Haiming Wang, Xiaohan Lin, Junqi Liu, Jia Li, Zhengying Liu

机构 * Moonshot AI Numina Peking University(北京大学) University of Toronto(多伦多大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07773 2025-08-21 cs.AI 70%

Agent RL Scaling Law: Agent RL with Spontaneous Code Execution for Mathematical Problem Solving

Xinji Mai, Haotian Xu, Zhong-Zhi Li, Xing W, Weinong Wang, Jian Hu, Yingying Zhang, Wenqiang Zhang

机构 * Fudan University(复旦大学) Xiaohongshu(小红书) East China Normal University(华东师范大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14294 2025-08-21 cs.AI 70%

Explaining Hitori Puzzles: Neurosymbolic Proof Staging for Sequential Decisions

Maria Leonor Pacheco, Fabio Somenzi, Dananjay Srinivas, Ashutosh Trivedi

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14123 2025-08-21 cs.AR cs.AI physics.app-ph physics.optics 70%

AI Agents for Photonic Integrated Circuit Design Automation

Ankita Sharma, YuQi Fu, Vahid Ansari, Rishabh Iyer, Fiona Kuang, Kashish Mistry, Raisa Islam Aishy, Sara Ahmad, Joaquin Matres, Dirk R. Englund, Joyce K. S. Poon

机构 * University of Toronto(多伦多大学) Max Planck Institute of Microstructure Physics(马克斯·普朗克微结构物理研究所) GDSFactory Research Laboratory of Electronics, Massachusetts Institute of Technology(麻省理工学院电子研究实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12911 2025-08-21 cs.RO cs.LG 70%

LaViPlan : Language-Guided Visual Path Planning with RLVR

Hayeon Oh

机构 * Electronics and Telecommunications Research Institute(电子通信研究院)

专题命中 推理与问题求解 :language model(abstract);post-training(abstract);分类 cs.LG

Comments Accepted to the 2nd ICCV 2025 Workshop on the Challenge of Out-of-Label Hazards in Autonomous Driving (13 pages, 6 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18897 2025-08-21 cs.RO cs.AI 57%

MinD: Learning A Dual-System World Model for Real-Time Planning and Implicit Risk Analysis

Xiaowei Chi, Kuangzhi Ge, Jiaming Liu, Siyuan Zhou, Peidong Jia, Zichen He, Yuzhen Liu, Tingguang Li, Lei Han, Sirui Han, Shanghang Zhang, Yike Guo

专题命中 推理与问题求解 :pretraining(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 27 篇

2508.14704 2025-08-21 cs.AI cs.CL 90%

MCP-Universe: Benchmarking Large Language Models with Real-World Model Context Protocol Servers

Ziyang Luo, Zhiqi Shen, Wenzhuo Yang, Zirui Zhao, Prathyusha Jwalapuram, Amrita Saha, Doyen Sahoo, Silvio Savarese, Caiming Xiong, Junnan Li

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Website: https://mcp-universe.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13790 2025-08-21 cs.AI 89%

The NordDRG AI Benchmark for Large Language Models

Tapio Pitkäranta

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Aalto University(阿alto大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14056 2025-08-21 cs.CL cs.DB 89%

Confidence Estimation for Text-to-SQL in Large Language Models

Sepideh Entezari Maleki, Mohammadreza Pourreza, Davood Rafiei

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10016 2025-08-21 cs.CR cs.SD eess.AS 89%

The Man Behind the Sound: Demystifying Audio Private Attribute Profiling via Multimodal Large Language Model Agents

Lixu Wang, Kaixiang Yao, Xinfeng Li, Dong Yang, Haoyang Li, Xiaofeng Wang, Wei Dong

机构 * Nanyang Technological University(南洋理工大学) The University of Tokyo(东京大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14087 2025-08-21 cs.LG cs.AI hep-ex 86%

FM4NPP: A Scaling Foundation Model for Nuclear and Particle Physics

David Park, Shuhang Li, Yi Huang, Xihaier Luo, Haiwang Yu, Yeonju Go, Christopher Pinkenburg, Yuewei Lin, Shinjae Yoo, Joseph Osborn, Jin Huang, Yihui Ren

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14419 2025-08-21 cs.SE 85%

Static Analysis as a Feedback Loop: Enhancing LLM-Generated Code Beyond Correctness

Scott Blyth, Sherlock A. Licorish, Christoph Treude, Markus Wagner

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14553 2025-08-21 cs.SE cs.AI 84%

Towards LLM-generated explanations for Component-based Knowledge Graph Question Answering Systems

Dennis Schiese, Aleksandr Perevalov, Andreas Both

专题命中 评测与基准 :LLM(title,comments);large language model(abstract);language model(abstract);分类 cs.AI

Comments Presented at ICWI 2024, Zagreb. Released with ISBN: 978-989-8704-62-7. Data source: https://figshare.com/articles/dataset/Towards_LLM-generated_explanations_for_component-based_knowledge_graph_question_answering_systems/27079687

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14288 2025-08-21 cs.SE cs.CL 83%

Measuring LLM Code Generation Stability via Structural Entropy

Yewei Song, Tiezhu Sun, Xunzhu Tang, Prateek Rajput, Tegawende F. Bissyande, Jacques Klein

机构 * The Interdisciplinary Centre for Security, Reliability and Trust University of Luxembourg(安全、可靠与信任跨学科研究中心卢森堡大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

Comments ASE-NIER

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14295 2025-08-21 cs.CV cs.AI cs.LG 81%

Pixels to Play: A Foundation Model for 3D Gameplay

Yuguang Yue, Chris Green, Samuel Hunt, Irakli Salia, Wenzhe Shi, Jonathan J Hunt

机构 * Player2

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

Journal ref Conference on Games 2025 (Short paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14706 2025-08-21 cs.CL cs.AI cs.CV cs.LG cs.MM 80%

ShizhenGPT: Towards Multimodal LLMs for Traditional Chinese Medicine

Junying Chen, Zhenyang Cai, Zhiheng Liu, Yunjin Yang, Rongsheng Wang, Qingying Xiao, Xiangyi Feng, Zhan Su, Jing Guo, Xiang Wan, Guangjun Yu, Haizhou Li, Benyou Wang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14507 2025-08-21 cs.IT math.IT 80%

DeepTelecom: A Digital-Twin Deep Learning Dataset for Channel and MIMO Applications

Bohao Wang, Zehua Jiang, Zhenyu Yang, Chongwen Huang, Yongliang Shen, Siming Jiang, Chen Zhu, Zhaohui Yang, Richeng Jin, Zhaoyang Zhang, Sami Muhaidat, Merouane Debbah

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08113 2025-08-21 cs.LG cs.AI q-fin.ST 79%

Benchmarking Pre-Trained Time Series Models for Electricity Price Forecasting

Timothée Hornek Amir Sartipi, Igor Tchappi, Gilbert Fridgen

机构 * SnT - Interdisciplinary Center for Security, Reliability and Trust(SnT跨学科安全、可靠与信任中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09717 2025-08-21 cs.HC cs.AI cs.CL cs.CY 79%

Enhancing Depression-Diagnosis-Oriented Chat with Psychological State Tracking

Yiyang Gu, Yougen Zhou, Qin Chen, Ningning Zhou, Jie Zhou, Aimin Zhou, Liang He

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Shanghai Institute of Al for Education, East China Normal University(东华大学上海人工智能教育研究所) School of Psychology and Cognitive Science, East China Normal University(东华大学心理学与认知科学学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted by NLPCC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07204 2025-08-21 cs.CV 78%

Endo-FASt3r: Endoscopic Foundation model Adaptation for Structure from motion

Mona Sheikh Zeinoddin, Mobarak I. Hoque, Zafer Tandogdu, Greg Shaw, Matthew J. Clarkson, Evangelos Mazomenos, Danail Stoyanov

机构 * UCL Hawkes Institute, University College London, UK \ mona.zeinoddin.22 Interventional Science, University College London, UK

专题命中 评测与基准 :foundation model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02028 2025-08-21 cs.CV 78%

Bench2ADVLM: A Closed-Loop Benchmark for Vision-language Models in Autonomous Driving

Tianyuan Zhang, Ting Jin, Lu Wang, Jiangfan Liu, Siyuan Liang, Mingchuan Zhang, Aishan Liu, Xianglong Liu

机构 * Beihang University(北航大学) Nanyang Technological University(南洋理工大学) Henan University of Science and Technology(河南科技大学)

专题命中 评测与基准 :language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14727 2025-08-21 cs.SE cs.LG 77%

Assessing the Quality and Security of AI-Generated Code: A Quantitative Analysis

Abbas Sabra, Olivier Schmitt, Joseph Tyler

机构 * Sonar

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14109 2025-08-21 cs.CY cs.AI cs.ET 77%

PAPPL: Personalized AI-Powered Progressive Learning Platform

Shayan Bafandkar, Sungyong Chung, Homa Khosravian, Alireza Talebpour

机构 * The Grainger College of Engineering, Department of Civil and Environmental Engineering, University of Illinois at Urbana-Champaign, 205 N Matthews, Urbana, IL 61801(伊利诺伊大学厄巴纳-香槟分校格拉inger工程学院,土木与环境工程系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12096 2025-08-21 cs.CL cs.AI cs.LG 75%

STEM: Efficient Relative Capability Evaluation of LLMs through Structured Transition Samples

Haiquan Hu, Jiazhi Jiang, Shiyou Xu, Ruhan Zeng, Tian Wang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Submit to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03608 2025-08-21 cs.AI cs.DC cs.ET cs.NI 70%

Benchmarking Vector, Graph and Hybrid Retrieval Augmented Generation (RAG) Pipelines for Open Radio Access Networks (ORAN)

Sarat Ahmad, Zeinab Nezami, Maryam Hafeez, Syed Ali Raza Zaidi

机构 * School of Electronic and Electrical Engineering(电子与电气工程学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14104 2025-08-21 cs.SE cs.AI 70%

You Don't Know Until You Click:Automated GUI Testing for Production-Ready Software Evaluation

Yutong Bian, Xianhao Lin, Yupeng Xie, Tianyang Liu, Mingchen Zhuge, Siyuan Lu, Haoming Tang, Jinlin Wang, Jiayi Zhang, Jiaqi Chen, Xiangru Tang, Yongxin Ni, Sirui Hong, Chenglin Wu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏