arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-16 至 2025-10-16 共收录 45 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 45 篇

2510.13366 2025-10-16 cs.CL cs.AI 90%

Document Intelligence in the Era of Large Language Models: A Survey

Weishi Wang, Hengchang Hu, Zhijie Zhang, Zhaochen Li, Hongxin Shao, Daniel Dahlmeier

机构 * SAP, Singapore(新加坡SAP)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13106 2025-10-16 cs.SE cs.AI cs.CL 90%

TRUSTVIS: A Multi-Dimensional Trustworthiness Evaluation Framework for Large Language Models

Ruoyu Sun, Da Song, Jiayang Song, Yuheng Huang, Lei Ma

机构 * University of Alberta(阿尔伯塔大学) Mila - Quebec Artificial Intelligence Institute(魁北克人工智能研究所) The University of Tokyo(东京大学) Macau University of Science and Technology(澳门科学技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 4 pages, 2 figures, To appear in ASE 2025 Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02594 2025-10-16 cs.HC cs.AI cs.CL 90%

A Risk Taxonomy and Reflection Tool for Large Language Model Adoption in Public Health

Jiawei Zhou, Amy Z. Chen, Darshi Shah, Laura M. Schwab Reese, Munmun De Choudhury

机构 * Georgia Institute of Technology(佐治亚理工学院) Purdue University(普渡大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07994 2025-10-16 cs.SE cs.CL cs.LG 90%

Assessing the Latent Automated Program Repair Capabilities of Large Language Models using Round-Trip Translation

Fernando Vallecillos Ruiz, Anastasiia Grishina, Max Hort, Leon Moonen

机构 * Simula Research Laboratory(Simula研究实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments Accepted for publication in ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12813 2025-10-16 cs.CL cs.AI cs.LG 89%

Cancer Diagnosis Categorization in Electronic Health Records Using Large Language Models and BioBERT: Model Performance Evaluation Study

Soheil Hashtarkhani, Rezaur Rashid, Christopher L Brett, Lokesh Chinthala, Fekede Asefa Kumsa, Janet A Zink, Robert L Davis, David L Schwartz, Arash Shaban-Nejad

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 8 Pages

Journal ref JMIR Cancer, 2025 Oct 2:11:e72005

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12807 2025-10-16 cs.CL cs.AI 88%

Benchmarking Open-Source Large Language Models for Persian in Zero-Shot and Few-Shot Learning

Mahdi Cherakhloo, Arash Abbasi, Mohammad Saeid Sarafraz, Bijan Vosoughi Vahdat

机构 * Department of Medical Engineering(医学工程系) Electrical Engineering Department(电气工程系) Sharif University of Technology(谢里夫技术大学) Department of Electrical Engineering(电气工程系) University of Tehran(德黑兰大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26165 2025-10-16 cs.CV 88%

Human-MME: A Holistic Evaluation Benchmark for Human-Centric Multimodal Large Language Models

Yuansen Liu, Haiming Tang, Jinlong Peng, Jiangning Zhang, Xiaozhong Ji, Qingdong He, Wenbin Wu, Donghao Luo, Zhenye Gan, Junwei Zhu, Yunhang Shen, Chaoyou Fu, Chengjie Wang, Xiaobin Hu, Shuicheng Yan

机构 * Yuan-Hou(元侯)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13202 2025-10-16 cs.CL cs.AI 86%

LLM-Guided Synthetic Augmentation (LGSA) for Mitigating Bias in AI Systems

Sai Suhruth Reddy Karri, Yashwanth Sai Nallapuneni, Laxmi Narasimha Reddy Mallireddy, Gopichand G

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 11 pages, 4 figures, 1 Table, submitted to an international conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12925 2025-10-16 cs.CL cs.LG 86%

Who's Asking? Evaluating LLM Robustness to Inquiry Personas in Factual Question Answering

Nil-Jana Akpinar, Chia-Jung Lee, Vanessa Murdock, Pietro Perona

机构 * Microsoft(微软) Amazon Web Services(亚马逊网络服务)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16843 2025-10-16 cs.LG cs.AI cs.GT 86%

Do LLM Agents Have Regret? A Case Study in Online Learning and Games

Chanwoo Park, Xiangyu Liu, Asuman Ozdaglar, Kaiqing Zhang

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Maryland, College Park(马里兰大学College Park分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Camera ready version of ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13467 2025-10-16 cs.NI 85%

NetMCP: Network-Aware Model Context Protocol Platform for LLM Capability Extension

Enhan Li, Hongyang Du, Kaibin Huang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12836 2025-10-16 cs.CY 85%

BanglaMATH : A Bangla benchmark dataset for testing LLM mathematical reasoning at grades 6, 7, and 8

Tabia Tanzin Prama, Christopher M. Danforth, Peter Sheridan Dodds

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13570 2025-10-16 cs.LG 83%

Selective Adversarial Attacks on LLM Benchmarks

Ivan Dubrovsky, Anastasia Orlova, Illarion Iov, Nina Gubina, Irena Gureeva, Alexey Zaytsev

机构 * ITMO University(ITMO大学) Applied AI Institute(应用人工智能研究所)

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02477 2025-10-16 cs.RO cs.CV 82%

Multimodal Fusion and Vision-Language Models: A Survey for Robot Vision

Xiaofeng Han, Shunpeng Chen, Zenghuang Fu, Zhe Feng, Lue Fan, Dong An, Changwei Wang, Li Guo, Weiliang Meng, Xiaopeng Zhang, Rongtao Xu, Shibiao Xu

机构 * aThe State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, China [1ex] bSchool of Artificial Intelligence, University of Chinese Academy of Sciences, China [1ex] cSchool of Artificial Intelligence, Beijing University of Posts Telecommunications, China [1ex] dKey Laboratory of Computing Power Network Shandong Computer Science Center, Qilu University of Technology (Shandong Academy of Sciences), China [1ex] e Shandong Provincial Key Laboratory of Computing Power Internet Service Computing, Shandong Fundamental Research Center for Computer Science, China

专题命中 评测与基准 :language model(title,abstract);large language model(abstract)

Comments 27 pages, 11 figures. Accepted to Information Fusion. Final journal version: volume 126 (Part B), February 2026

Journal ref Information Fusion, 126 (Part B), February 2026, 103652

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13008 2025-10-16 cs.CL cs.AI 81%

CurLL: A Developmental Framework to Evaluate Continual Learning in Language Models

Pavan Kalyan, Shubhra Mishra, Satya Lokam, Navin Goyal

机构 * Microsoft Research(微软研究院) KTH Royal Institute of Technology(皇家理工学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12950 2025-10-16 cs.LG 79%

An Investigation of Memorization Risk in Healthcare Foundation Models

Sana Tonekaboni, Lena Stempfle, Adibvafa Fallahpour, Walter Gerych, Marzyeh Ghassemi

机构 * MIT Broad Institute of MIT and Harvard(MIT Broad研究所(MIT和哈佛)) Vector Institute(向量研究所) MIT Chalmers University of Technology(查尔姆斯理工大学) University of Gothenburg(哥德堡大学) University of Toronto(多伦多大学) University Health Network (UHN)(大学健康网络) Worcester Polytechnic Institute(沃思维尔理工学院) Computer Science Department(计算机科学系)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10013 2025-10-16 cs.CV cs.CL 79%

Cross-modal Associations in Vision and Language Models: Revisiting the Bouba-Kiki Effect

Tom Kouwenhoven, Kiana Shahrasbi, Tessa Verhoef

机构 * Leiden Institute of Advanced Computer Science(莱顿先进计算机科学研究所) Leiden University(莱顿大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

Comments Presented at the Thirty-Ninth Annual Conference on Neural Information Processing Systems (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19831 2025-10-16 cs.CL cs.LG 79%

Benchmarking Hindi LLMs: A New Suite of Datasets and a Comparative Analysis

Anusha Kamath, Kanishk Singla, Rakesh Paul, Raviraj Joshi, Utkarsh Vaidya, Sanjay Singh Chauhan, Niranjan Wartikar

机构 * NVIDIA

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13281 2025-10-16 eess.AS cs.CL cs.LG 79%

Two Heads Are Better Than One: Audio-Visual Speech Error Correction with Dual Hypotheses

Sungnyun Kim, Kangwook Jang, Sungwoo Cho, Joon Son Chung, Hoirin Kim, Se-Young Yun

机构 * Kim Jaechul Graduate School of AI, KAIST(金 Jaechul人工智能研究生院,韩国科学技术院) School of Electrical Engineering, KAIST(电气工程学院,韩国科学技术院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Preprint work

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13257 2025-10-16 cs.CR 78%

GRIDAI: Generating and Repairing Intrusion Detection Rules via Collaboration among Multiple LLM-based Agents

Jiarui Li, Yuhan Chai, Lei Du, Chenyun Duan, Hao Yan, Zhaoquan Gu

专题命中 评测与基准 :LLM(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13598 2025-10-16 cs.CL 77%

FreshTab: Sourcing Fresh Data for Table-to-Text Generation Evaluation

Kristýna Onderková, Ondřej Plátek, Zdeněk Kasner, Ondřej Dušek

机构 * Charles University(查理大学) Faculty of Mathematics and Physics(数学与物理学院) Institute of Formal and Applied Linguistics(形式与应用语言学研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments To be published in INLG 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04329 2025-10-16 cs.CL 77%

No Language Data Left Behind: A Comparative Study of CJK Language Datasets in the Hugging Face Ecosystem

Dasol Choi, Woomyoung Park, Youngsook Song

机构 * Yonsei University(延世大学) AIM Intelligence(AIM智能) MODULABS Sionic AI Lablup

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 MRL Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07037 2025-10-16 cs.CL 77%

KG2QA: Knowledge Graph-enhanced Retrieval-augmented Generation for Communication Standards Question Answering

Zhongze Luo, Weixuan Wan, Tianya Zhang, Dan Wang, Xiaoying Tang

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)科学与工程学院) School of Microelectronics, Xi'an Jiaotong University, China(西安交通大学微电子学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13079 2025-10-16 cs.CL cs.LG 73%

GatePro: Parameter-Free Expert Selection Optimization for Mixture-of-Experts Models

Chen Zheng, Yuhang Cai, Deyi Liu, Jin Ma, Yiyuan Ma, Yuan Yang, Jing Liu, Yutao Zeng, Xun Zhou, Siyuan Qiao

机构 * ByteDance Seed(字节跳动种子) UC Berkeley(伯克利大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12845 2025-10-16 cs.CL cs.AI cs.CV cs.RO 73%

VLURes: Benchmarking VLM Visual and Linguistic Understanding in Low-Resource Languages

Jesse Atuhurra, Iqra Ali, Tomoya Iwakura, Hidetaka Kamigaito, Tatsuya Hiraoka

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03173 2025-10-16 cs.CL cs.AI cs.CV 73%

MULTI: Multimodal Understanding Leaderboard with Text and Images

Zichen Zhu, Yang Xu, Lu Chen, Jingkai Yang, Yichuan Ma, Yiming Sun, Hailin Wen, Jiaqi Liu, Jinyu Cai, Yingzi Ma, Situo Zhang, Zihan Zhao, Liangtai Sun, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Key Laboratory of Artificial Intelligence\ of Education, Shanghai Jiao Tong University, Shanghai 200240 , China Jiangsu Key Lab of Language Computing, Suzhou 215123 , China College of Computing Data Science, Nanyang Technological University, Singapore 639798 , Singapore Suzhou Laboratory, Suzhou 215123 , China

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 24 pages, 19 figures, 10 tables. Details and access are available at: https://OpenDFM.github.io/MULTI-Benchmark/

Journal ref Sci. China Inf. Sci. 68, 200107 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13681 2025-10-16 cs.CL 70%

How Sampling Affects the Detectability of Machine-written texts: A Comprehensive Study

Matthieu Dubois, François Yvon, Pablo Piantanida

机构 * Sorbonne Université, CNRS, ISIR, Paris France(索邦大学、国家科学研究中心、ISIR、巴黎法国) CNRS, International Laboratory on Learning Systems, Montréal, Canada(国家科学研究中心、学习系统国际实验室、蒙特利尔加拿大) Mila - Québec AI Institute, Montréal, Canada(魁北克AI研究所、蒙特利尔加拿大) CentraleSupélec, Université Paris-Saclay, Gif-sur-Yvette, France(CentraleSupélec、巴黎萨克雷大学、吉夫-sur-伊夫特法国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12621 2025-10-16 cs.CL 70%

ACADATA: Parallel Dataset of Academic Data for Machine Translation

Iñaki Lacunza, Javier Garcia Gilabert, Francesca De Luca Fornaciari, Javier Aula-Blasco, Aitor Gonzalez-Agirre, Maite Melero, Marta Villegas

机构 * Barcelona Supercomputing Center (BSC)(巴塞罗那超级计算中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00893 2025-10-16 cs.CL 70%

SeLeRoSa: Sentence-Level Romanian Satire Detection Dataset

Răzvan-Alexandru Smădu, Andreea Iuga, Dumitru-Clementin Cercel, Florin Pop

机构 * National University of Science and Technology POLITEHNICA Bucharest(波兰技术大学科学与技术国家大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 9 pages, 2 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13787 2025-10-16 cs.CV 67%

Adaptive Visual Conditioning for Semantic Consistency in Diffusion-Based Story Continuation

Seyed Mohammad Mousavi, Morteza Analoui

机构 * School of Computer Engineering, Iran University of Science and Technology(伊朗科学技术大学计算机工程学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏