arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-23 至 2025-09-23 共收录 350 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 90 篇

2502.20383 2025-09-23 cs.LG cs.CL 73%

Why Are Web AI Agents More Vulnerable Than Standalone LLMs? A Security Analysis

Jeffrey Yang Fan Chiang, Seungjae Lee, Jia-Bin Huang, Furong Huang, Yizheng Chen

机构 * University of Maryland(马里兰大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Project website: http://vulnerable-ai-agents.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21532 2025-09-23 cs.CL cs.AI cs.CY 73%

"What's Up, Doc?": Analyzing How Users Seek Health Information in Large-Scale Conversational AI Datasets

Akshay Paruchuri, Maryam Aziz, Rohit Vartak, Ayman Ali, Best Uchehara, Xin Liu, Ishan Chatterjee, Monica Agrawal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Duke University(杜克大学) University of Washington(华盛顿大学) Google(谷歌)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2025 Findings - 25 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16322 2025-09-23 cs.CL cs.AI cs.HC 73%

SouLLMate: An Application Enhancing Diverse Mental Health Support with Adaptive LLMs, Prompt Engineering, and RAG Techniques

Qiming Guo, Jinwen Tang, Wenbo Sun, Haoteng Tang, Yi Shang, Wenlu Wang

机构 * Texas A&M University - Corpus Christi(德克萨斯A&M大学-科珀斯克里斯蒂分校) University of Missouri(密苏里大学) Delft University of Technology(代尔夫特理工大学) University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德谷分校)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 26 pages, 19 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05381 2025-09-23 cs.CV 71%

Few-Shot Image Quality Assessment via Adaptation of Vision-Language Models

Xudong Li, Zihao Huang, Yan Zhang, Yunhang Shen, Ke Li, Xiawu Zheng, Liujuan Cao, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) Beijing Institute of Technology(北京理工大学) Tencent Youtu Lab, Shanghai, China(腾讯优图实验室,中国)

专题命中 评测与基准 :language model(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17855 2025-09-23 cs.CL 70%

Make Every Letter Count: Building Dialect Variation Dictionaries from Monolingual Corpora

Robert Litschko, Verena Blaschke, Diana Burkhardt, Barbara Plank, Diego Frassinelli

机构 * MaiNLP, Ludwig Maximilian University of Munich(MaiNLP,慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted at EMNLP 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17669 2025-09-23 cs.CL 70%

PG-CE: A Progressive Generation Dataset with Constraint Enhancement for Controllable Text Generation

Yan Zhuang, Yuan Sun

机构 * Minzu University of China. National Language Resource Monitoring \& Research Center Minority Languages Branch \& Institute of National Security, Minzu University of China Beijing, China zhuangyan\ Minzu University of China. National Language Resource Monitoring Research Center Minority Languages Branch \& Institute of National Security, Minzu University of China Beijing, China

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17249 2025-09-23 cs.CL 70%

Extending Automatic Machine Translation Evaluation to Book-Length Documents

Kuang-Da Wang, Shuoyang Ding, Chao-Han Huck Yang, Ping-Chun Hsieh, Wen-Chih Peng, Vitaly Lavrukhin, Boris Ginsburg

机构 * National Yang Ming Chiao Tung University(国家阳明交通大学) NVIDIA

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted for EMNLP 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16914 2025-09-23 cs.CL 70%

CUTE: A Multilingual Dataset for Enhancing Cross-Lingual Knowledge Transfer in Low-Resource Languages

Wenhao Zhuang, Yuan Sun

机构 * Minzu University of China(中国民族大学) National Language Resource Monitoring & Research Center Minority Languages Branch(国家语言资源监测与研究中心少数民族语言分中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04415 2025-09-23 cs.CL 70%

MOMENTS: A Comprehensive Multimodal Benchmark for Theory of Mind

Emilio Villa-Cueva, S M Masrur Ahmed, Rendi Chevi, Jan Christian Blaise Cruz, Kareem Elzeky, Fermin Cristobal, Alham Fikri Aji, Skyler Wang, Rada Mihalcea, Thamar Solorio

机构 * MBZUAI University of Houston(德克萨斯大学休斯顿分校) McGill University(麦吉尔大学) University of Michigan(密歇根大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11114 2025-09-23 cs.CL 70%

Beyond Pairwise: Global Zero-shot Temporal Graph Generation

Alon Eirew, Kfir Bar, Ido Dagan

机构 * Computer Science Department, Bar-Ilan University(巴伊兰大学计算机科学系) Efi Arazi School of Computer Science, Reichman University(里奇曼大学埃菲·阿拉兹计算机科学学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted to the main track of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16326 2025-09-23 cs.CL cs.CV 70%

HARE: an entity and relation centric evaluation framework for histopathology reports

Yunsoo Kim, Michal W. S. Ong, Alex Shavick, Honghan Wu, Adam P. Levine

机构 * University College London(伦敦大学学院) University of Glasgow(格拉斯哥大学) Human Technopole(人类技术极地) University College London Hospitals NHS Foundation Trust(伦敦大学学院医院国家健康服务信托)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted to EMNLP2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18831 2025-09-23 cs.CL 70%

Measuring Risk of Bias in Biomedical Reports: The RoBBR Benchmark

Jianyou Wang, Weili Cao, Longtian Bao, Youze Zheng, Gil Pasternak, Kaicheng Wang, Xiaoyue Wang, Ramamohan Paturi, Leon Bergen

机构 * Laboratory for Emerging Intelligence(新兴智能实验室) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Published at EMNLP 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15017 2025-09-23 cs.CR 67%

PsyScam: A Benchmark for Psychological Techniques in Real-World Scams

Shang Ma, Tianyi Ma, Jiahao Liu, Wei Song, Zhenkai Liang, Xusheng Xiao, Yanfang Ye

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17065 2025-09-23 cs.CV 67%

CardiacCLIP: Video-based CLIP Adaptation for LVEF Prediction in a Few-shot Manner

Yao Du, Jiarong Guo, Xiaomeng Li

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学)

专题命中 评测与基准 :language model(abstract);pretraining(abstract)

Comments Accepted by MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17044 2025-09-23 cs.CV 67%

AgriDoctor: A Multimodal Intelligent Assistant for Agriculture

Mingqing Zhang, Zhuoning Xu, Peijie Wang, Rongji Li, Liang Wang, Qiang Liu, Jian Xu, Xuyao Zhang, Shu Wu, Liang Wang

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems(多模态人工智能系统国家重点实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08399 2025-09-23 cs.SE 67%

System for systematic literature review using multiple AI agents: Concept and an empirical evaluation

Abdul Malik Sami, Zeeshan Rasheed, Kai-Kristian Kemell, Muhammad Waseem, Terhi Kilamo, Mika Saari, Anh Nguyen Duc, Kari Systä, Pekka Abrahamsson

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments 12 Pages, 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17505 2025-09-23 cs.CL cs.AI 62%

CorefInst: Leveraging LLMs for Multilingual Coreference Resolution

Tuğba Pamay Arslan, Emircan Erol, Gülşen Eryiğit

机构 * İTÜ NLP Research Group(伊斯坦布尔技术大学自然语言处理研究组)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

Comments Accepted for publication in Transactions of the Association for Computational Linguistics (TACL) (2025 August). Submission: March, 2025. Revision: July, 2025. Acceptance: August, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16804 2025-09-23 cs.CL cs.AI 62%

KuBERT: Central Kurdish BERT Model and Its Application for Sentiment Analysis

Kozhin muhealddin Awlla, Hadi Veisi, Abdulhady Abas Abdullah

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09716 2025-09-23 cs.SD cs.AI cs.CL eess.AS 62%

VStyle: A Benchmark for Voice Style Adaptation with Spoken Instructions

Jun Zhan, Mingyang Han, Yuxuan Xie, Chen Wang, Dong Zhang, Kexin Huang, Haoxiang Shi, DongXiao Wang, Tengtao Song, Qinyuan Cheng, Shimin Li, Jun Song, Xipeng Qiu, Bo Zheng

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16517 2025-09-23 cs.CV cs.AI cs.CL cs.MM 62%

Seeing Culture: A Benchmark for Visual Reasoning and Grounding

Burak Satar, Zhixin Ma, Patrick A. Irawan, Wilfried A. Mulyawan, Jing Jiang, Ee-Peng Lim, Chong-Wah Ngo

机构 * Singapore Management University(新加坡管理大学) Bandung Institute of Technology(班达理工大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2025 Main Conference, https://seeingculture-benchmark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18030 2025-09-23 cs.CL 57%

RadEval: A framework for radiology text evaluation

Justin Xu, Xi Zhang, Javid Abderezaei, Julie Bauml, Roger Boodoo, Fatemeh Haghighi, Ali Ganjizadeh, Eric Brattain, Dave Van Veen, Zaiqiao Meng, David Eyre, Jean-Benoit Delbrouck

机构 * University of Oxford(牛津大学) University of Glasgow(格拉斯哥大学) HOPPR

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 Demo track - Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17404 2025-09-23 eess.AS cs.AI cs.SD 57%

SongPrep: A Preprocessing Framework and End-to-end Model for Full-song Structure Parsing and Lyrics Transcription

Wei Tan, Shun Lei, Huaicheng Zhang, Guangzheng Li, Yixuan Zhang, Hangting Chen, Jianwei Yu, Rongzhi Gu, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17024 2025-09-23 cs.CV cs.AI 57%

When Color-Space Decoupling Meets Diffusion for Adverse-Weather Image Restoration

Wenxuan Fang, Jili Fan, Chao Wang, Xiantao Hu, Jiangwei Weng, Ying Tai, Jian Yang, Jun Li

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学) School of Electrical Engineering, Southeast University(电气工程学院,东南大学) School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院,南京大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11049 2025-09-23 cs.CL 57%

Journalism-Guided Agentic In-Context Learning for News Stance Detection

Dahyun Lee, Jonghyeon Choi, Jiyoung Han, Kunwoo Park

专题命中 评测与基准 :language model(abstract);分类 cs.CL

Comments EMNLP 2025 (24 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24456 2025-09-23 cs.CL 57%

CaMMT: Benchmarking Culturally Aware Multimodal Machine Translation

Emilio Villa-Cueva, Sholpan Bolatzhanova, Diana Turmakhan, Kareem Elzeky, Henok Biadglign Ademtew, Alham Fikri Aji, Vladimir Araujo, Israel Abebe Azime, Jinheon Baek, Frederico Belcavello, Fermin Cristobal, Jan Christian Blaise Cruz, Mary Dabre, Raj Dabre, Toqeer Ehsan, Naome A Etori, Fauzan Farooqui, Jiahui Geng, Guido Ivetta, Thanmay Jayakumar, Soyeong Jeong, Zheng Wei Lim, Aishik Mandal, Sofia Martinelli, Mihail Minkov Mihaylov, Daniil Orel, Aniket Pramanick, Sukannya Purkayastha, Israfel Salazar, Haiyue Song, Tiago Timponi Torrent, Debela Desalegn Yadeta, Injy Hamed, Atnafu Lambebo Tonja, Thamar Solorio

机构 * MBZUAI(人工智能研究所)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16989 2025-09-23 cs.CL 57%

All-in-one: Understanding and Generation in Multimodal Reasoning with the MAIA Benchmark

Davide Testa, Giovanni Bonetta, Raffaella Bernardi, Alessandro Bondielli, Alessandro Lenci, Alessio Miaschi, Lucia Passaro, Bernardo Magnini

机构 * Università di Roma La Sapienza(罗马La Sapienza大学) Fondazione Bruno Kessler (FBK)(布鲁诺·凯斯勒基金会) Free University of Bozen-Bolzano(博兹纳-博尔扎诺自由大学) Dept. of Computer Science, University of Pisa(比萨大学计算机科学系) CoLing Lab, Dept. of Philology, Literature and Linguistics, University of Pisa(比萨大学语言学、文学与语言学系CoLing实验室) Istituto di Linguistica Computazionale "A. Zampolli" (CNR-ILC), ItaliaNLP Lab, Pisa(A. Zampolli计算语言学研究所(CNR-ILC),意大利NLP实验室,比萨)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

Comments Accepted at Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17270 2025-09-23 eess.AS cs.SD 50%

Reference-aware SFM layers for intrusive intelligibility prediction

Hanlin Yu, Haoshuai Zhou, Boxuan Cao, Changgeng Mo, Linkai Li, Shan X. Wang

机构 * UBC ECE(不列颠哥伦比亚大学电子与计算机工程系) Orka Labs Inc.(Orka实验室公司) Stanford EE(斯坦福大学电气工程系)

专题命中 评测与基准 :foundation model(abstract)

Comments Preprint; submitted to ICASSP 2026. 5 pages. CPC3 system: Dev RMSE 22.36, Eval RMSE 24.98 (ranked 1st)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17022 2025-09-23 cs.MM cs.CV cs.SD eess.AS 50%

VAInpaint: Zero-Shot Video-Audio inpainting framework with LLMs-driven Module

Kam Man Wu, Zeyue Tian, Liya Ji, Qifeng Chen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 评测与基准 :LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16735 2025-09-23 cs.GR 50%

Brain Connectivity Network Structure Learning For Brain Disorder Diagnosis

Dongdong Chen, Linlin Yao, Mengjun Liu, Zhenrong Shen, Yuqi Hu, Zhiyun Song, Shengyu Lu, Qian Wang, Dinggang Shen, Lichi Zhang

专题命中 评测与基准 :pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01271 2025-09-23 cs.CE 50%

HRFT: Mining High-Frequency Risk Factor Collections End-to-End via Transformer

Wenyan Xu, Rundong Wang, Chen Li, Yonghong Hu, Zhonghua Lu

专题命中 评测与基准 :language model(abstract)

Comments Accepted at WWW 25 Industrial Track

详情

展开后加载摘要…

URL PDF HTML 收藏