arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-16 至 2025-09-16 共收录 62 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 62 篇

2509.12168 2025-09-16 cs.CL cs.AI 91%

RAGs to Riches: RAG-like Few-shot Learning for Large Language Model Role-playing

Timothy Rupprecht, Enfu Nan, Arash Akbari, Arman Akbari, Lei Lu, Priyanka Maan, Sean Duffy, Pu Zhao, Yumei He, David Kaeli, Yanzhi Wang

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Northeastern University(东北大学) Tulane University(路易斯安那州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18337 2025-09-16 cs.CL 90%

Can LLMs assist with Ambiguity? A Quantitative Evaluation of various Large Language Models on Word Sense Disambiguation

T. G. D. K. Sumanathilaka, Nicholas Micallef, Julian Hough

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 12 pages,6 tables, 1 figure, Proceedings of the 1st International Conference on NLP & AI for Cyber Security

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.01219 2025-09-16 cs.CL cs.AI cs.CY cs.LG 90%

Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models

Yue Zhang, Yafu Li, Leyang Cui, Deng Cai, Lemao Liu, Tingchen Fu, Xinting Huang, Enbo Zhao, Yu Zhang, Chen Xu, Yulong Chen, Longyue Wang, Anh Tuan Luu, Wei Bi, Freda Shi, Shuming Shi

机构 * Tencent AI lab(腾讯AI实验室) Soochow University(苏州大学) Zhejiang University(浙江大学) Renmin University of China(中国人民大学) Nanyang Technological University(南洋理工大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments work in progress;

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12098 2025-09-16 cs.CL cs.AI 90%

Is 'Hope' a person or an idea? A pilot benchmark for NER: comparing traditional NLP tools and large language models on ambiguous entities

Payam Latifi

机构 * Department of Humanities University of Turin(人文学院 特林姆大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 14 pages, 9 figures, 2 tables. This is a pilot study evaluating six NER systems -- three traditional tools (NLTK, spaCy, Stanza) and three LLMs (Gemini-1.5-flash, DeepSeek-V3, Qwen-3-4B) -- on a small, ambiguity-rich dataset of 119 tokens. The annotated dataset, prompts are provided in appendices for full reproducibility. All experiments were conducted on 14 May 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10683 2025-09-16 cs.CV cs.AI 89%

A Comparison and Evaluation of Fine-tuned Convolutional Neural Networks to Large Language Models for Image Classification and Segmentation of Brain Tumors on MRI

Felicia Liu, Jay J. Yoo, Farzad Khalvati

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03814 2025-09-16 cs.RO cs.AI 89%

Large Language Models for Multi-Robot Systems: A Survey

Peihan Li, Zijian An, Shams Abrar, Lifeng Zhou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11446 2025-09-16 cs.SE 89%

Large Language Models (LLMs) for Requirements Engineering (RE): A Systematic Literature Review

Mohammad Amin Zadenoori, Jacek Dąbrowski, Waad Alhoshan, Liping Zhao, Alessio Ferrari

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10814 2025-09-16 cs.CR 89%

Automatic Generation of a Cryptography Misuse Taxonomy Using Large Language Models

Yang Zhang, Wenyi Ouyang, Yi Zhang, Liang Cheng, Chen Wu, Wenxin Hu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 23 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20344 2025-09-16 cs.CL 88%

LinguaLens: Towards Interpreting Linguistic Mechanisms of Large Language Models via Sparse Auto-Encoder

Yi Jing, Zijun Yao, Hongzhu Guo, Lingxu Ran, Xiaozhi Wang, Lei Hou, Juanzi Li

机构 * DCST, BNRist(DCST、BNRist;KIRC、人工智能研究院、清华大学,中国) KIRC, Institute for Artificial Intelligence, Tsinghua University, China(中文语言文学系、北京大学,中国) Department of Chinese Language and Literature, Peking University, China

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted by EMNLP 2025 MainConference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11335 2025-09-16 cs.LG cond-mat.mtrl-sci 88%

MatQnA: A Benchmark Dataset for Multi-modal Large Language Models in Materials Characterization and Analysis

Yonghao Weng, Liqiang Gao, Linwu Zhu, Jian Huang

机构 * Department of Materials Engineering(材料工程系) Zhejiang University(浙江大学) Department of Data Intelligence(数据智能系) Shiyanjia Lab of Scientific Compass(科学之桥实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10697 2025-09-16 cs.CL 88%

A Survey on Retrieval And Structuring Augmented Generation with Large Language Models

Pengcheng Jiang, Siru Ouyang, Yizhu Jiao, Ming Zhong, Runchu Tian, Jiawei Han

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments KDD'25 survey track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05070 2025-09-16 cs.CL 88%

Performance Evaluation of Large Language Models in Bangla Consumer Health Query Summarization

Ajwad Abrar, Farzana Tabassum, Sabbir Ahmed

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23231 2025-09-16 cs.SE cs.AI 88%

CCCI: Code Completion with Contextual Information for Complex Data Transfer Tasks Using Large Language Models

Hangzhan Jin, Mohammad Hamdaqa

机构 * PolyTechnique Montréal(蒙特利尔理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments The 29th International Conference on Evaluation and Assessment in Software Engineering

Journal ref The 29th International Conference on Evaluation and Assessment in Software Engineering (EASE 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16445 2025-09-16 cs.CE q-bio.BM 88%

ProLLaMA: A Protein Large Language Model for Multi-Task Protein Language Processing

Liuzhenghao Lv, Zongying Lin, Hao Li, Yuyang Liu, Jiaxi Cui, Calvin Yu-Chian Chen, Li Yuan, Yonghong Tian

专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract)

Comments IEEE Transactions on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11026 2025-09-16 cs.AI cs.CL 87%

Rethinking Human Preference Evaluation of LLM Rationales

Ziang Li, Manasi Ganti, Zixian Ma, Helena Vasconcelos, Qijia He, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(title,abstract);language model(abstract,journal_ref);large language model(abstract);分类 cs.CL、cs.AI

Comments Published in the XLLM-Reason-Plan Workshop on the Application of LLM Explainability to Reasoning and Planning at COLM 2025

Journal ref Proceedings of the XLLM-Reason-Plan Workshop, Conference on Language Modeling (COLM) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10682 2025-09-16 cs.CR cs.AI cs.CL cs.ET cs.LG 87%

LLM in the Middle: A Systematic Review of Threats and Mitigations to Real-World LLM-based Systems

Vitor Hugo Galhardo Moia, Igor Jochem Sanz, Gabriel Antonio Fontes Rebello, Rodrigo Duarte de Meneses, Briland Hitaj, Ulf Lindqvist

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 37 pages, 8 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21587 2025-09-16 cs.CL 85%

A Cross-Cultural Comparison of LLM-based Public Opinion Simulation: Evaluating Chinese and U.S. Models on Diverse Societies

Weihong Qi, Fan Huang, Jisun An, Haewoon Kwak

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10570 2025-09-16 cs.RO cs.AI 85%

Large Foundation Models for Trajectory Prediction in Autonomous Driving: A Comprehensive Survey

Wei Dai, Shengen Wu, Wei Wu, Zhenhao Wang, Sisuo Lyu, Haicheng Liao, Limin Yu, Weiping Ding, Runwei Guan, Yutao Yue

机构 * Department of Mathematical Sciences, School of Physical sciences, University of Liverpool(利物浦大学数学科学系) Department of Communications and Networking, School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学通讯与网络系) Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能方向) Deep Interdisciplinary Intelligence Lab, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)深度跨学科智能实验室) School of Mathematics and Statistics, Shandong University(山东大学数学与统计学院) School of Artificial Intelligence and Computer Science, Nantong University(南通大学人工智能与计算机科学学院) Thrust of Data Science and Analytics, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)数据科学与分析方向) Institute of Deep Perception Technology, Jiangsu(江苏深度感知技术研究院)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02573 2025-09-16 cs.CV 85%

Remote Sensing SpatioTemporal Vision-Language Models: A Comprehensive Survey

Chenyang Liu, Jiafan Zhang, Keyan Chen, Man Wang, Zhengxia Zou, Zhenwei Shi

机构 * Department of Aerospace Intelligent Science and Technology, School of Astronautics, Beihang University(航空航天智能科学与技术系,航天学院,北航) Key Laboratory of Spacecraft Design Optimization and Dynamic Simulation Technologies, Ministry of Education, China(航天器设计优化与动态仿真技术重点实验室,教育部,中国) College of Computer Science, Inner Mongolia University(计算机科学学院,内蒙古大学) Shen Yuan Honors College of Beihang University(盛元荣誉学院,北航)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);foundation model(abstract)

Comments Published in IEEE Geoscience and Remote Sensing Magazine

Journal ref IEEE Geoscience and Remote Sensing Magazine, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09198 2025-09-16 cs.CL 83%

GmSLM : Generative Marmoset Spoken Language Modeling

Talia Sternberg, Michael London, David Omer, Yossi Adi

机构 * The School of Computer Science and Engineering(计算机科学与工程学院) The Edmond and Lily Safra center for Brain Sciences (ELSC)(脑科学中心)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11620 2025-09-16 cs.CL cs.CY 83%

AesBiasBench: Evaluating Bias and Alignment in Multimodal Language Models for Personalized Image Aesthetic Assessment

Kun Li, Lai-Man Po, Hongzheng Yang, Xuyuan Xu, Kangcheng Liu, Yuzhi Zhao

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

Comments Accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11106 2025-09-16 cs.CL cs.AI cs.LG 82%

Fluid Language Model Benchmarking

Valentin Hofmann, David Heineman, Ian Magnusson, Kyle Lo, Jesse Dodge, Maarten Sap, Pang Wei Koh, Chun Wang, Hannaneh Hajishirzi, Noah A. Smith

机构 * Allen Institute for AI(阿尔伦人工智能研究所) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10937 2025-09-16 cs.CL 81%

An Interpretable Benchmark for Clickbait Detection and Tactic Attribution

Lihi Nofar, Tomer Portal, Aviv Elbaz, Alexander Apartsin, Yehudit Aperstein

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10708 2025-09-16 cs.CL 81%

SearchInstruct: Enhancing Domain Adaptation via Retrieval-Based Instruction Dataset Creation

Iman Barati, Mostafa Amiri, Heshaam Faili

机构 * Iran University of Science and Technology(伊朗科学技术大学) University of Tehran(塔里哈大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11256 2025-09-16 cs.CL cs.AI 81%

Line of Duty: Evaluating LLM Self-Knowledge via Consistency in Feasibility Boundaries

Sahil Kale, Vijaykant Nadadur

机构 * Knowledgeverse AI(知识verse人工智能)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

Comments 14 pages, 8 figures, Accepted to the 5th TrustNLP Workshop at NAACL 2025

Journal ref Proceedings of the 5th Workshop on Trustworthy NLP (TrustNLP 2025), pages 127-140, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14827 2025-09-16 cs.CR cs.AI cs.CL cs.LG 80%

Enhancing Prompt Injection Attacks to LLMs via Poisoning Alignment

Zedian Shao, Hongbin Liu, Jaden Mu, Neil Zhenqiang Gong

机构 * Georgia Institute of Technology(佐治亚理工学院) Duke University(杜克大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08638 2025-09-16 eess.AS cs.AI cs.MM cs.SD 79%

YuE: Scaling Open Foundation Models for Long-Form Music Generation

Ruibin Yuan, Hanfeng Lin, Shuyue Guo, Ge Zhang, Jiahao Pan, Yongyi Zang, Haohe Liu, Yiming Liang, Wenye Ma, Xingjian Du, Xinrun Du, Zhen Ye, Tianyu Zheng, Zhengxuan Jiang, Yinghao Ma, Minghao Liu, Zeyue Tian, Ziya Zhou, Liumeng Xue, Xingwei Qu, Yizhi Li, Shangda Wu, Tianhao Shen, Ziyang Ma, Jun Zhan, Chunhui Wang, Yatian Wang, Xiaowei Chi, Xinyue Zhang, Zhenzhu Yang, Xiangzhou Wang, Shansong Liu, Lingrui Mei, Peng Li, Junjie Wang, Jianwei Yu, Guojian Pang, Xu Li, Zihao Wang, Xiaohuan Zhou, Lijun Yu, Emmanouil Benetos, Yong Chen, Chenghua Lin, Xie Chen, Gus Xia, Zhaoxiang Zhang, Chao Zhang, Wenhu Chen, Xinyu Zhou, Xipeng Qiu, Roger Dannenberg, Jiaheng Liu, Jian Yang, Wenhao Huang, Wei Xue, Xu Tan, Yike Guo

机构 * HKUST(香港科技大学) MAP(多模态艺术投影)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

Comments https://github.com/multimodal-art-projection/YuE

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12190 2025-09-16 cs.CY cs.AI cs.CL 79%

Survival at Any Cost? LLMs and the Choice Between Self-Preservation and Human Harm

Alireza Mohamadi, Ali Yavari

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18240 2025-09-16 cs.CL cs.AI 79%

MTalk-Bench: Evaluating Speech-to-Speech Models in Multi-Turn Dialogues via Arena-style and Rubrics Protocols

Yuhao Du, Qianwei Huang, Guo Zhu, Zhanchen Dai, Shunian Chen, Qiming Zhu, Le Pan, Minghao Chen, Yuhao Zhang, Li Zhou, Benyou Wang, Haizhou Li

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳))

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10790 2025-09-16 cs.LG cs.AI 79%

GoldenTransformer: A Modular Fault Injection Framework for Transformer Robustness Research

Luke Howard

机构 * Radnor High School(拉多尔高中)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 4 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏