arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-08-22 至 2025-08-22 共收录 41 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 41 篇

2504.15640 2025-08-22 cs.CL cs.AI 91%

Cequel: Cost-Effective Querying of Large Language Models for Text Clustering

Hongtao Wang, Taiyan Zhang, Renchi Yang, Jianliang Xu

机构 * Hong Kong Baptist University(香港 Baptist 大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15606 2025-08-22 cs.CR 89%

Towards Scalable and Interpretable Mobile App Risk Analysis via Large Language Models

Yu Yang, Zhenyuan Li, Xiandong Ran, Jiahao Liu, Jiahui Wang, Bo Yu, Shouling Ji

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15370 2025-08-22 cs.CL cs.AI 88%

Unveiling Trust in Multimodal Large Language Models: Evaluation, Analysis, and Mitigation

Yichi Zhang, Yao Huang, Yifan Wang, Yitong Sun, Chang Liu, Zhe Zhao, Zhengwei Fang, Huanran Chen, Xiao Yang, Xingxing Wei, Hang Su, Yinpeng Dong, Jun Zhu

机构 * Department of Computer Science and Technology, College of AI, Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University(计算机科学与技术系、人工智能学院、人工智能研究所、清华-博世联合机器学习中心、THBI实验室、BNRist中心、清华大学) Institute of Artificial Intelligence, Beihang University(人工智能研究院、北航) RealAI

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments For Appendix, please refer to arXiv:2406.07057

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21635 2025-08-22 cs.CL cs.AI 88%

Sadeed: Advancing Arabic Diacritization Through Small Language Model

Zeina Aldallal, Sara Chrouf, Khalil Hennara, Mohamed Motaism Hamed, Muhammad Hreden, Safwan AlModhayan

专题命中 评测与基准 :language model(title,abstract);small language model(title);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13612 2025-08-22 cs.CL cs.AI 88%

Large Language Models for Automated Literature Review: An Evaluation of Reference Generation, Abstract Writing, and Review Composition

Xuemei Tang, Xufeng Duan, Zhenguang G. Cai

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 12 pages, 5 figures, 5 tables, Accepted by EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15361 2025-08-22 cs.CL 88%

A Survey on Large Language Model Benchmarks

Shiwen Ni, Guhong Chen, Shuaimin Li, Xuanang Chen, Siyi Li, Bingli Wang, Qiyao Wang, Xingjian Wang, Yifan Zhang, Liyang Fan, Chengming Li, Ruifeng Xu, Le Sun, Min Yang

机构 * Shenzhen Key Laboratory for High Performance Data Mining(深圳高性能数据挖掘重点实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所) Southern University of Science and Technology(南方科技大学) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology of China(中国科学技术大学) Shanghai University of Electric Power(上海电力大学) Shanghai AI Lab(上海人工智能实验室) South China University of Technology(华南理工大学) Shenzhen University(深圳大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) Shenzhen MSU-BIT University(深圳MSU-BIT大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen University of Advanced Technology(深圳大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16622 2025-08-22 cs.CL 88%

Leveraging Large Language Models for Explainable Activity Recognition in Smart Homes: A Critical Evaluation

Michele Fiori, Gabriele Civitarese, Priyankar Choudhary, Claudio Bettini

机构 * EveryWare Lab, Dept. of Computer Science, University of Milan(米兰大学计算机科学系EveryWare实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17894 2025-08-22 cs.CL cs.AI 87%

Mutarjim: Advancing Bidirectional Arabic-English Translation with a Small Language Model

Khalil Hennara, Muhammad Hreden, Mohamed Motaism Hamed, Zeina Aldallal, Sara Chrouf, Safwan AlModhayan

专题命中 评测与基准 :language model(title,abstract);small language model(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02039 2025-08-22 cs.CL cs.AI 86%

An Investigation into Value Misalignment in LLM-Generated Texts for Cultural Heritage

Fan Bu, Zheng Wang, Siyi Wang, Ziyao Liu

机构 * Department of Archeology and Museology, Shanghai University(考古与博物馆学系,上海大学) National Collaborative Research Center for Revolutionary Cultural Heritage at Memorial of the First CPC National Congress & Shanghai University(革命文化遗产国家联合研究中心,中共一大会址纪念馆与上海大学) School of Management, Shanghai University(管理学院,上海大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13092 2025-08-22 cs.CR cs.AI 85%

VerilogLAVD: LLM-Aided Rule Generation for Vulnerability Detection in Verilog

Xiang Long, Yingjie Xia, Xiyuan Chen, Li Kuang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14716 2025-08-22 cs.LG 85%

Pairwise or Pointwise? Evaluating Feedback Protocols for Bias in LLM-Based Evaluation

Tuhina Tripathi, Manya Wadhwa, Greg Durrett, Scott Niekum

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments Published at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15526 2025-08-22 cs.CL 85%

SafetyFlow: An Agent-Flow System for Automated LLM Safety Benchmarking

Xiangyang Zhu, Yuan Tian, Chunyi Li, Kaiwei Zhang, Wei Sun, Guangtao Zhai

机构 * Shanghai AI Lab(上海人工智能实验室) East China Normal University(东华大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Code and dataset are available at https://github.com/yangyangyang127/SafetyFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15429 2025-08-22 cs.CL 85%

Pub-Guard-LLM: Detecting Retracted Biomedical Articles with Reliable Explanations

Lihu Chen, Shuojie Fu, Gabriel Freedman, Cemre Zor, Guy Martin, James Kinross, Uddhav Vaghela, Ovidiu Serban, Francesca Toni

机构 * Imperial College London(伦敦帝国学院) Amazon Web Services(亚马逊网络服务) National Health Service(国家健康服务)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments long paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11060 2025-08-22 cs.CV 82%

BannerAgency: Advertising Banner Design with Multimodal LLM Agents

Heng Wang, Yotaro Shimose, Shingo Takamatsu

机构 * Sony Group Corporation(索尼集团)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

Comments Accepted as a main conference paper at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15928 2025-08-22 cs.AI cs.CL cs.HC 82%

Exploring Big Five Personality and AI Capability Effects in LLM-Simulated Negotiation Dialogues

Myke C. Cohen, Zhe Su, Hsien-Te Kao, Daniel Nguyen, Spencer Lynch, Maarten Sap, Svitlana Volkova

机构 * Aptima, Inc.(Aptima公司) Human Systems Engineering, Arizona State University(亚利桑那州立大学人类系统工程系) Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

Comments Presented at the KDD 2025 Workshop on Evaluation and Trustworthiness of Agentic and Generative AI Models under the title "Evaluating the LLM-simulated Impacts of Big Five Personality Traits and AI Capabilities on Social Negotiations" (https://kdd-eval-workshop.github.io/genai-evaluation-kdd2025/assets/papers/Submission%2036.pdf)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15407 2025-08-22 cs.CL cs.AI 81%

When Audio and Text Disagree: Revealing Text Bias in Large Audio-Language Models

Cheng Wang, Gelei Deng, Xianglin Yang, Han Qiu, Tianwei Zhang

机构 * National University of Singapore(国立新加坡大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01619 2025-08-22 cs.SE cs.AI cs.CL cs.LG 80%

Learning to Generate Unit Tests for Automated Debugging

Archiki Prasad, Elias Stengel-Eskin, Justin Chih-Yao Chen, Zaid Khan, Mohit Bansal

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to COLM 2025. Dataset and Code: https://github.com/archiki/UTGenDebug

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19675 2025-08-22 cs.CL cs.AI cs.DL cs.IR cs.LG 80%

Annif at SemEval-2025 Task 5: Traditional XMTC augmented by LLMs

Osma Suominen, Juho Inkinen, Mona Lehtinen

机构 * National Library of Finland, University of Helsinki(芬兰国家图书馆,赫尔辛基大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 6 pages, 4 figures, published at SemEval-2025 workshop Task 5: LLMs4Subjects: https://aclanthology.org/2025.semeval-1.315/

Journal ref Proceedings of the 19th International Workshop on Semantic Evaluation (SemEval-2025), 2424--2431

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15392 2025-08-22 cs.LG cs.CL 79%

CITE: A Comprehensive Benchmark for Heterogeneous Text-Attributed Graphs on Catalytic Materials

Chenghao Zhang, Qingqing Long, Ludi Wang, Wenjuan Cui, Jianjun Yu, Yi Du

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments 23 pages, 4 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15481 2025-08-22 cs.IR 78%

On Evaluating the Adversarial Robustness of Foundation Models for Multimodal Entity Linking

Fang Wang, Yongjie Wang, Zonghao Yang, Minghao Hu, Xiaoying Bai

专题命中 评测与基准 :foundation model(title);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12910 2025-08-22 cs.CR cs.AI cs.AR 77%

SecFSM: Knowledge Graph-Guided Verilog Code Generation for Secure Finite State Machines in Systems-on-Chip

Ziteng Hu, Yingjie Xia, Xiyuan Chen, Li Kuang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11288 2025-08-22 cs.AI 77%

Opus: A Prompt Intention Framework for Complex Workflow Generation

Théo Fagnoni, Mahsun Altin, Chia En Chung, Phillip Kingston, Alan Tuning, Dana O. Mohamed, Inès Adnani

机构 * AppliedAI

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 39 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12710 2025-08-22 cs.CR cs.AI cs.SE 77%

Innamark: A Whitespace Replacement Information-Hiding Method

Malte Hellmeier, Hendrik Norkowski, Ernst-Christoph Schrewe, Haydar Qarawlus, Falk Howar

机构 * Fraunhofer ISST(弗劳恩霍夫研究所) Montsecure GmbH(蒙特塞cur公司) TU Dortmund(图尔恩大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted and published in the IEEE Access journal as extended version of doi:10.24251/HICSS.2025.886

Journal ref IEEE Access, Volume 13, 2025, pp. 123120 - 123135

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15232 2025-08-22 cs.CV 75%

AeroDuo: Aerial Duo for UAV-based Vision and Language Navigation

Ruipu Wu, Yige Zhang, Jinyu Chen, Linjiang Huang, Shifeng Zhang, Xu Zhou, Liang Wang, Si Liu

机构 * Beihang University(北京航空航天大学) Sangfor Technologies Inc.(深信服科技有限公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22189 2025-08-22 cs.LG cs.CL cs.MA 73%

Exploring Modularity of Agentic Systems for Drug Discovery

Laura van Weesep, Samuel Genheden, Ola Engkvist, Jens Sjölund

机构 * Chalmers University of Technology(楚德斯理工大学) University of Gothenburg(戈尔堡大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11169 2025-08-22 cs.CL cs.AI 73%

MuSeD: A Multimodal Spanish Dataset for Sexism Detection in Social Media Videos

Laura De Grazia, Pol Pastells, Mauro Vázquez Chas, Desmond Elliott, Danae Sánchez Villegas, Mireia Farrús, Mariona Taulé

机构 * University of Barcelona, CLiC-Language and Computing Center(巴塞罗那大学,CLiC语言与计算中心) University of Copenhagen, Department of Computer Science(哥本哈根大学,计算机科学系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments COLM 2025 camera-ready version: expanded Section 4.3 with an additional experiment using an extended definition-based prompt (including a definition of sexist content), and applied minor corrections

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15218 2025-08-22 cs.CL 70%

Are Checklists Really Useful for Automatic Evaluation of Generative Tasks?

Momoka Furuhashi, Kouta Nakayama, Takashi Kodama, Saku Sugawara

机构 * Tohoku University(东洋大学) Research and Development Center for Large Language Models, National Institute of Informatics(大型语言模型研究与开发中心,日本信息处理学会) National Institute of Informatics(日本信息处理学会)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted to the EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07470 2025-08-22 cs.CV 67%

AURA: A Fine-Grained Benchmark and Decomposed Metric for Audio-Visual Reasoning

Siminfar Samakoush Galougah, Rishie Raj, Sanjoy Chowdhury, Sayan Nag, Ramani Duraiswami

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15418 2025-08-22 cs.CL cs.AI cs.LG cs.MM cs.SD 67%

LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model

Yirong Sun, Yizhong Geng, Peidong Wei, Yanjun Chen, Jinghan Yang, Rongfei Chen, Wei Zhang, Xiaoyu Shen

机构 * Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Institute of Digital Twin, EIT(宁波空间智能与数字衍生关键实验室,数字孪生研究院,EIT) Logic Intelligence Technology(逻辑智能技术) BUPT(北京邮电大学) Xiamen University(厦门大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15085 2025-08-22 cs.CL cs.AI cs.IR cs.LG 67%

LongRecall: A Structured Approach for Robust Recall Evaluation in Long-Form Text

MohamamdJavad Ardestani, Ehsan Kamalloo, Davood Rafiei

机构 * Department of Computing Science University of Alberta(计算科学系阿尔伯塔大学) ServiceNow Research(ServiceNow研究)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏