arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-08-27 至 2025-08-27 共收录 164 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 28 篇

2408.05873 2025-08-27 cs.CL 88%

Recognizing Limits: Investigating Infeasibility in Large Language Models

Wenbo Zhang, Zihang Xu, Hengrui Cai

机构 * University of California Irvine(加州大学尔滨分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06029 2025-08-27 cs.CL cs.LG 86%

SmartBench: Is Your LLM Truly a Good Chinese Smartphone Assistant?

Xudong Lu, Haohao Gao, Renshou Wu, Shuai Ren, Xiaoxin Chen, Hongsheng Li, Fangyuan Li

机构 * vivo AI Lab(vivo人工智能实验室) CUHK MMLab(香港大学MMLab)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18420 2025-08-27 cs.LG 85%

LLM-Driven Intrinsic Motivation for Sparse Reward Reinforcement Learning

André Quadros, Cassio Silva, Ronnie Alves

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments 11 pages, 5 figures, Accepted to the ENIAC 2025 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14157 2025-08-27 q-bio.QM cs.AI 84%

DrugGen: Advancing Drug Discovery with Large Language Models and Reinforcement Learning Feedback

Mahsa Sheikholeslami, Navid Mazrouei, Yousof Gheisari, Afshin Fasihi, Matin Irajpour, Ali Motahharynia

机构 * Regenerative Medicine Research Center, Isfahan University of Medical Sciences(再生医学研究中心,伊斯法罕医科大学) Department of Medicinal Chemistry, School of Pharmacy, Isfahan University of Medical Sciences(药理学系,药学院,伊斯法罕医科大学) Department of Genetics and Molecular Biology, Isfahan University of Medical Sciences(遗传学与分子生物学系,伊斯法罕医科大学)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.AI

Comments 20 pages, 5 figures, 3 tables, and 7 supplementary files. To use the model, see https://huggingface.co/alimotahharynia/DrugGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18600 2025-08-27 cs.GT cs.MA econ.GN q-fin.EC 82%

Bias-Adjusted LLM Agents for Human-Like Decision-Making via Behavioral Economics

Ayato Kitadai, Yusuke Fukasawa, Nariaki Nishino

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10271 2025-08-27 q-bio.QM cs.LG q-bio.GN 79%

Evaluating DNA function understanding in genomic language models using evolutionarily implausible sequences

Shiyu Jiang, Xuyin Liu, Zitong Jerry Wang

机构 * Center for Interdisciplinary Studies, School of Science, Westlake University, Hangzhou, China(西湖大学交叉科学中心,理学院,杭州,中国) Department of Quantitative and Computational Biology, University of Southern California, Los Angeles, CA, United States(定量与计算生物学系,南加州大学,洛杉矶,CA,美国)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20728 2025-08-27 cs.AI 79%

Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models

Zesen Lyu, Dandan Zhang, Wei Ye, Fangdi Li, Zhihang Jiang, Yao Yang

机构 * Hangzhou Institute for Advanced Study, UCAS(杭州高等研究 institute,UCAS) Zhejiang Lab(浙江实验室) Zhejiang University(浙江大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

Comments Accepted by EMNLP 2025 Main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19163 2025-08-27 cs.AI cs.HC cs.MA 77%

MATRIX: Multi-Agent simulaTion fRamework for safe Interactions and conteXtual clinical conversational evaluation

Ernest Lim, Yajie Vera He, Jared Joselowitz, Kate Preston, Mohita Chowdhury, Louis Williams, Aisling Higham, Katrina Mason, Mariane Melo, Tom Lawton, Yan Jia, Ibrahim Habli

机构 * Ufonia Limited(乌菲尼亚有限公司) University of York(约克大学) NHS Improvement Academy(国家健康服务改进学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 36 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18554 2025-08-27 cs.AI 77%

SchemaCoder: Automatic Log Schema Extraction Coder with Residual Q-Tree Boosting

Lily Jiaxin Wan, Chia-Tung Ho, Rongjian Liang, Cunxi Yu, Deming Chen, Haoxing Ren

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 18 pages, 16 figures, under review for AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16701 2025-08-27 cs.CY cs.AI 77%

Generative Artificial Intelligence and Agents in Research and Teaching

Jussi S. Jauhiainen, Aurora Toppari

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

Comments 113 pages, 6 figures, 13 tables, 2 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15955 2025-08-27 cs.SE 75%

Boosting Redundancy-based Automated Program Repair by Fine-grained Pattern Mining

Jiajun Jiang, Fengjie Li, Zijie Zhao, Zhirui Ye, Mengjiao Liu, Bo Wang, Hongyu Zhang, Junjie Chen

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments This paper has been accepted by ICSME 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18929 2025-08-27 cs.CL cs.AI 73%

Diverse And Private Synthetic Datasets Generation for RAG evaluation: A multi-agent framework

Ilias Driouich, Hongliu Cao, Eoin Thomas

机构 * AMADEUS France(AMADEUS法国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments ECAI 2025 TRUST AI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18783 2025-08-27 cs.CL 70%

Controllable Conversational Theme Detection Track at DSTC 12

Igor Shalyminov, Hang Su, Jake Vincent, Siffi Singh, Jason Cai, James Gung, Raphael Shu, Saab Mansour

机构 * Amazon(亚马逊)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments DSTC12@SigDial2025; data and code available at https://github.com/amazon-science/dstc12-controllable-conversational-theme-detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18701 2025-08-27 cs.CL 70%

Attention2Probability: Attention-Driven Terminology Probability Estimation for Robust Speech-to-Text System

Yanfan Du, Jun Zhang, Bin Wang, Jin Qiu, Lu Huang, Yuan Ge, Xiaoqian Liu, Tong Xiao, Jingbo Zhu

机构 * ByteDance(字节跳动)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 9 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19195 2025-08-27 cs.CL 70%

Label Set Optimization via Activation Distribution Kurtosis for Zero-shot Classification with Generative Models

Yue Li, Zhixue Zhao, Carolina Scarton

机构 * Department of Computer Science, University of Sheffield, UK(计算机科学系,谢菲尔德大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18798 2025-08-27 cs.FL 67%

CASP: An evaluation dataset for formal verification of C code

Niclas Hertzberg, Merlijn Sevenhuijsen, Liv Kåreborn, Anna Lokrantz

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17334 2025-08-27 cs.CV cs.AI cs.CL cs.LG 67%

Mind the (Language) Gap: Towards Probing Numerical and Cross-Lingual Limits of LVLMs

Somraj Gautam, Abhirama Subramanyam Penamakuri, Abhishek Bhandari, Gaurav Harit

机构 * Indian Institute of Technology Jodhpur(印度理工学院朱罗普尔)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19221 2025-08-27 cs.CL 57%

Evaluating the Evaluators: Are readability metrics good measures of readability?

Isabel Cachola, Daniel Khashabi, Mark Dredze

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18569 2025-08-27 cs.CL cs.CV 57%

The Mind's Eye: A Multi-Faceted Reward Framework for Guiding Visual Metaphor Generation

Girish A. Koushik, Fatemeh Nazarieh, Katherine Birch, Shenbin Qian, Diptesh Kanojia

机构 * NICE Research Group(NICE研究组) Centre for Translation Studies(翻译研究中心) Institute for People-Centred AI(以人为本的人工智能研究所) School of Computer Science & Electronic Engineering, University of Surrey, UK(Surrey大学计算机科学与电子工程学院)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21939 2025-08-27 cs.CR cs.AI 57%

HonestCyberEval: An AI Cyber Risk Benchmark for Automated Software Exploitation

Dan Ristea, Vasilios Mavroudis

机构 * Alan Turing Institute(艾伦·图灵研究所)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19165 2025-08-27 cs.CV 50%

Dual Enhancement on 3D Vision-Language Perception for Monocular 3D Visual Grounding

Yuzhen Li, Min Liu, Yuan Bian, Xueping Wang, Zhaoyang Li, Gen Li, Yaonan Wang

机构 * School of Artificial Intelligence and Robotics, Hunan University(人工智能与机器人学院,湖南大学) College of Information Science and Engineering, Hunan Normal University(信息科学与工程学院,湖南师范大学) School of Informatics, University of Edinburgh(信息学院,爱丁堡大学)

专题命中 评测与基准 :language model(abstract)

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15902 2025-08-27 cs.CV 50%

Text-Driven 3D Hand Motion Generation from Sign Language Data

Léore Bensabath, Mathis Petrovich, Gül Varol

机构 * LIGM, École des Ponts, IP Paris, Univ Gustave Eiffel, CNRS(LIGM,巴黎理工大学,IP巴黎,埃菲尔大学,CNRS)

专题命中 评测与基准 :LLM(abstract)

Comments Project page: https://imagine.enpc.fr/~leore.bensabath/HandMDM/, 24 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06905 2025-08-27 cs.CV 50%

MultiRef: Controllable Image Generation with Multiple Visual References

Ruoxi Chen, Dongping Chen, Siyuan Wu, Sinan Wang, Shiyun Lang, Petr Sushko, Gaoyang Jiang, Yao Wan, Ranjay Krishna

机构 * Zhejiang Wanli University(浙江万里大学) University of Washington(华盛顿大学) Huazhong University of Science and Technology(华中科技大学) Allen Institute for AI(人工智能研究院)

专题命中 评测与基准 :LLM(abstract)

Comments Accepted to ACM MM 2025 Datasets

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 32 篇

2508.14090 2025-08-27 cs.CL cs.AI 90%

DLLMQuant: Quantizing Diffusion-based Large Language Models

Chen Xu, Dawei Yang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22239 2025-08-27 cs.CR cs.AI cs.SY eess.SY 89%

Large Language Model-Based Framework for Explainable Cyberattack Detection in Automatic Generation Control Systems

Muhammad Sharshar, Ahmad Mohammad Saber, Davor Svetinovic, Amr M. Youssef, Deepa Kundur, Ehab F. El-Saadany

机构 * Department of Computer Science, College of Computing and Mathematical Sciences, Khalifa University(计算机科学系,计算与数学科学学院,哈利法大学) ECE Department, University of Toronto(电子工程系,多伦多大学) Concordia Institute for Information Systems Engineering (CIISE), Concordia University(信息系统工程研究所(CIISE),康科迪亚大学) Department of Electrical Engineering, College of Engineering and Physical Sciences, Khalifa University(电气工程系,工程与物理科学学院,哈利法大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

Comments Accepted Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18955 2025-08-27 cs.SE 89%

Interleaving Large Language Models for Compiler Testing

Yunbo Ni, Shaohua Li

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16680 2025-08-27 cs.LG cs.AI 88%

CALR: Corrective Adaptive Low-Rank Decomposition for Efficient Large Language Model Layer Compression

Muchammad Daniyal Kautsar, Afra Majida Hariono, Widyawan, Syukron Abu Ishaq Alfarozi, Kuntpong Woraratpanya

机构 * Department of Electrical and Information Engineering, Universitas Gadjah Mada(电子与信息工程系,加雅马达大学) School of Information Technology, King Mongkut’s Institute of Technology Ladkrabang(信息技术学院,拉差班科技学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

Comments Submitted to IEEE Transactions on Artificial Intelligence. This is the preprint version, not peer-reviewed. The final version may differ after peer review. (11 pages, 3 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18976 2025-08-27 cs.CR cs.CL 85%

The Double-edged Sword of LLM-based Data Reconstruction: Understanding and Mitigating Contextual Vulnerability in Word-level Differential Privacy Text Sanitization

Stephen Meisenbacher, Alexandra Klymenko, Andreea-Elena Bodea, Florian Matthes

机构 * Technical University of Munich School of Computation, Information(慕尼黑技术大学计算、信息与技术学院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments 15 pages, 4 figures, 8 tables. Accepted to WPES @ CCS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18850 2025-08-27 cs.DC cs.AI 85%

ClusterFusion: Expanding Operator Fusion Scope for LLM Inference via Cluster-Level Collective Primitive

Xinhao Luo, Zihan Liu, Yangjie Zhou, Shihan Fang, Ziyu Huang, Yu Feng, Chen Zhang, Shixuan Sun, Zhenzhe Zheng, Jingwen Leng, Minyi Guo

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Qi Zhi Institute(上海启智研究院) National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18819 2025-08-27 cs.CL cs.SI 85%

LLM-based Contrastive Self-Supervised AMR Learning with Masked Graph Autoencoders for Fake News Detection

Shubham Gupta, Shraban Kumar Chatterjee, Suman Kundu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏