arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-08-27 至 2025-08-27 共收录 28 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 28 篇

2402.05123 2025-08-27 cs.CL 90%

A Survey on Data Selection for LLM Instruction Tuning

Bolin Zhang, Jiahao Wang, Qianlong Du, Jiajun Zhang, Zhiying Tu, Dianhui Chu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Harbin Institute of Technology (Weihai)(哈尔滨工业大学(威海))

专题命中 评测与基准 :LLM(title,abstract);instruction tuning(title,abstract);large language model(abstract);language model(abstract)

Comments Published in JAIR (Vol. 83, Article 32, 2025)

Journal ref Journal of Artificial Intelligence Research, 83:32, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18905 2025-08-27 cs.AI 89%

Interactive Evaluation of Large Language Models for Multi-Requirement Software Engineering Tasks

Dimitrios Rontogiannis, Maxime Peyrard, Nicolas Baldwin, Martin Josifoski, Robert West, Dimitrios Gunopulos

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21038 2025-08-27 cs.CR cs.AI 89%

Prefill-level Jailbreak: A Black-Box Risk Analysis of Large Language Models

Yakai Li, Jiekang Hu, Weiduan Sang, Luping Ma, Dongsheng Nie, Weijuan Zhang, Aimin Yu, Yi Su, Qingjia Huang, Qihang Zhou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Sinochem Energy High-Tech Co., Ltd.(中石化能源高科技有限公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18651 2025-08-27 cs.CL cs.AI 88%

Breaking the Trade-Off Between Faithfulness and Expressiveness for Large Language Models

Chenxu Yang, Qingyi Si, Zheng Lin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22863 2025-08-27 cs.HC cs.CL 88%

Large Language Models for Depression Recognition in Spoken Language Integrating Psychological Knowledge

Yupei Li, Shuaijie Shao, Manuel Milling, Björn W. Schuller

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Journal ref Frontiers in Computer Science, Volume 7, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05873 2025-08-27 cs.CL 88%

Recognizing Limits: Investigating Infeasibility in Large Language Models

Wenbo Zhang, Zihang Xu, Hengrui Cai

机构 * University of California Irvine(加州大学尔滨分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06029 2025-08-27 cs.CL cs.LG 86%

SmartBench: Is Your LLM Truly a Good Chinese Smartphone Assistant?

Xudong Lu, Haohao Gao, Renshou Wu, Shuai Ren, Xiaoxin Chen, Hongsheng Li, Fangyuan Li

机构 * vivo AI Lab(vivo人工智能实验室) CUHK MMLab(香港大学MMLab)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18420 2025-08-27 cs.LG 85%

LLM-Driven Intrinsic Motivation for Sparse Reward Reinforcement Learning

André Quadros, Cassio Silva, Ronnie Alves

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments 11 pages, 5 figures, Accepted to the ENIAC 2025 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14157 2025-08-27 q-bio.QM cs.AI 84%

DrugGen: Advancing Drug Discovery with Large Language Models and Reinforcement Learning Feedback

Mahsa Sheikholeslami, Navid Mazrouei, Yousof Gheisari, Afshin Fasihi, Matin Irajpour, Ali Motahharynia

机构 * Regenerative Medicine Research Center, Isfahan University of Medical Sciences(再生医学研究中心,伊斯法罕医科大学) Department of Medicinal Chemistry, School of Pharmacy, Isfahan University of Medical Sciences(药理学系,药学院,伊斯法罕医科大学) Department of Genetics and Molecular Biology, Isfahan University of Medical Sciences(遗传学与分子生物学系,伊斯法罕医科大学)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.AI

Comments 20 pages, 5 figures, 3 tables, and 7 supplementary files. To use the model, see https://huggingface.co/alimotahharynia/DrugGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18600 2025-08-27 cs.GT cs.MA econ.GN q-fin.EC 82%

Bias-Adjusted LLM Agents for Human-Like Decision-Making via Behavioral Economics

Ayato Kitadai, Yusuke Fukasawa, Nariaki Nishino

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10271 2025-08-27 q-bio.QM cs.LG q-bio.GN 79%

Evaluating DNA function understanding in genomic language models using evolutionarily implausible sequences

Shiyu Jiang, Xuyin Liu, Zitong Jerry Wang

机构 * Center for Interdisciplinary Studies, School of Science, Westlake University, Hangzhou, China(西湖大学交叉科学中心,理学院,杭州,中国) Department of Quantitative and Computational Biology, University of Southern California, Los Angeles, CA, United States(定量与计算生物学系,南加州大学,洛杉矶,CA,美国)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20728 2025-08-27 cs.AI 79%

Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models

Zesen Lyu, Dandan Zhang, Wei Ye, Fangdi Li, Zhihang Jiang, Yao Yang

机构 * Hangzhou Institute for Advanced Study, UCAS(杭州高等研究 institute,UCAS) Zhejiang Lab(浙江实验室) Zhejiang University(浙江大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

Comments Accepted by EMNLP 2025 Main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19163 2025-08-27 cs.AI cs.HC cs.MA 77%

MATRIX: Multi-Agent simulaTion fRamework for safe Interactions and conteXtual clinical conversational evaluation

Ernest Lim, Yajie Vera He, Jared Joselowitz, Kate Preston, Mohita Chowdhury, Louis Williams, Aisling Higham, Katrina Mason, Mariane Melo, Tom Lawton, Yan Jia, Ibrahim Habli

机构 * Ufonia Limited(乌菲尼亚有限公司) University of York(约克大学) NHS Improvement Academy(国家健康服务改进学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 36 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18554 2025-08-27 cs.AI 77%

SchemaCoder: Automatic Log Schema Extraction Coder with Residual Q-Tree Boosting

Lily Jiaxin Wan, Chia-Tung Ho, Rongjian Liang, Cunxi Yu, Deming Chen, Haoxing Ren

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 18 pages, 16 figures, under review for AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16701 2025-08-27 cs.CY cs.AI 77%

Generative Artificial Intelligence and Agents in Research and Teaching

Jussi S. Jauhiainen, Aurora Toppari

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

Comments 113 pages, 6 figures, 13 tables, 2 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15955 2025-08-27 cs.SE 75%

Boosting Redundancy-based Automated Program Repair by Fine-grained Pattern Mining

Jiajun Jiang, Fengjie Li, Zijie Zhao, Zhirui Ye, Mengjiao Liu, Bo Wang, Hongyu Zhang, Junjie Chen

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments This paper has been accepted by ICSME 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18929 2025-08-27 cs.CL cs.AI 73%

Diverse And Private Synthetic Datasets Generation for RAG evaluation: A multi-agent framework

Ilias Driouich, Hongliu Cao, Eoin Thomas

机构 * AMADEUS France(AMADEUS法国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments ECAI 2025 TRUST AI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18783 2025-08-27 cs.CL 70%

Controllable Conversational Theme Detection Track at DSTC 12

Igor Shalyminov, Hang Su, Jake Vincent, Siffi Singh, Jason Cai, James Gung, Raphael Shu, Saab Mansour

机构 * Amazon(亚马逊)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments DSTC12@SigDial2025; data and code available at https://github.com/amazon-science/dstc12-controllable-conversational-theme-detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18701 2025-08-27 cs.CL 70%

Attention2Probability: Attention-Driven Terminology Probability Estimation for Robust Speech-to-Text System

Yanfan Du, Jun Zhang, Bin Wang, Jin Qiu, Lu Huang, Yuan Ge, Xiaoqian Liu, Tong Xiao, Jingbo Zhu

机构 * ByteDance(字节跳动)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 9 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19195 2025-08-27 cs.CL 70%

Label Set Optimization via Activation Distribution Kurtosis for Zero-shot Classification with Generative Models

Yue Li, Zhixue Zhao, Carolina Scarton

机构 * Department of Computer Science, University of Sheffield, UK(计算机科学系,谢菲尔德大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18798 2025-08-27 cs.FL 67%

CASP: An evaluation dataset for formal verification of C code

Niclas Hertzberg, Merlijn Sevenhuijsen, Liv Kåreborn, Anna Lokrantz

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17334 2025-08-27 cs.CV cs.AI cs.CL cs.LG 67%

Mind the (Language) Gap: Towards Probing Numerical and Cross-Lingual Limits of LVLMs

Somraj Gautam, Abhirama Subramanyam Penamakuri, Abhishek Bhandari, Gaurav Harit

机构 * Indian Institute of Technology Jodhpur(印度理工学院朱罗普尔)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19221 2025-08-27 cs.CL 57%

Evaluating the Evaluators: Are readability metrics good measures of readability?

Isabel Cachola, Daniel Khashabi, Mark Dredze

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18569 2025-08-27 cs.CL cs.CV 57%

The Mind's Eye: A Multi-Faceted Reward Framework for Guiding Visual Metaphor Generation

Girish A. Koushik, Fatemeh Nazarieh, Katherine Birch, Shenbin Qian, Diptesh Kanojia

机构 * NICE Research Group(NICE研究组) Centre for Translation Studies(翻译研究中心) Institute for People-Centred AI(以人为本的人工智能研究所) School of Computer Science & Electronic Engineering, University of Surrey, UK(Surrey大学计算机科学与电子工程学院)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21939 2025-08-27 cs.CR cs.AI 57%

HonestCyberEval: An AI Cyber Risk Benchmark for Automated Software Exploitation

Dan Ristea, Vasilios Mavroudis

机构 * Alan Turing Institute(艾伦·图灵研究所)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19165 2025-08-27 cs.CV 50%

Dual Enhancement on 3D Vision-Language Perception for Monocular 3D Visual Grounding

Yuzhen Li, Min Liu, Yuan Bian, Xueping Wang, Zhaoyang Li, Gen Li, Yaonan Wang

机构 * School of Artificial Intelligence and Robotics, Hunan University(人工智能与机器人学院,湖南大学) College of Information Science and Engineering, Hunan Normal University(信息科学与工程学院,湖南师范大学) School of Informatics, University of Edinburgh(信息学院,爱丁堡大学)

专题命中 评测与基准 :language model(abstract)

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15902 2025-08-27 cs.CV 50%

Text-Driven 3D Hand Motion Generation from Sign Language Data

Léore Bensabath, Mathis Petrovich, Gül Varol

机构 * LIGM, École des Ponts, IP Paris, Univ Gustave Eiffel, CNRS(LIGM,巴黎理工大学,IP巴黎,埃菲尔大学,CNRS)

专题命中 评测与基准 :LLM(abstract)

Comments Project page: https://imagine.enpc.fr/~leore.bensabath/HandMDM/, 24 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06905 2025-08-27 cs.CV 50%

MultiRef: Controllable Image Generation with Multiple Visual References

Ruoxi Chen, Dongping Chen, Siyuan Wu, Sinan Wang, Shiyun Lang, Petr Sushko, Gaoyang Jiang, Yao Wan, Ranjay Krishna

机构 * Zhejiang Wanli University(浙江万里大学) University of Washington(华盛顿大学) Huazhong University of Science and Technology(华中科技大学) Allen Institute for AI(人工智能研究院)

专题命中 评测与基准 :LLM(abstract)

Comments Accepted to ACM MM 2025 Datasets

详情

展开后加载摘要…

URL PDF HTML 收藏