arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-25 至 2025-09-25 共收录 47 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 47 篇

2504.04974 2025-09-25 cs.CV cs.AI cs.CL cs.LG 91%

Towards Visual Text Grounding of Multimodal Large Language Model

Ming Li, Ruiyi Zhang, Jian Chen, Chenguang Wang, Jiuxiang Gu, Yufan Zhou, Franck Dernoncourt, Wanrong Zhu, Tianyi Zhou, Tong Sun

机构 * Adobe Research(Adobe研究院) University of Maryland(马里兰大学) University at Buffalo(布法罗大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20270 2025-09-25 cs.AI cs.CL 90%

Scan-do Attitude: Towards Autonomous CT Protocol Management using a Large Language Model Agent

Xingjian Kang, Linda Vorberg, Andreas Maier, Alexander Katzmann, Oliver Taubmann

机构 * Pattern Recognition Lab, Friedrich-Alexander Universität Erlangen-Nürnberg(模式识别实验室,弗赖堡-艾尔朗根-纽伦堡大学) Computed Tomography, Siemens Healthineers(计算机断层扫描,西门子医疗)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19314 2025-09-25 cs.CL cs.AI cs.CY 90%

Automated Item Neutralization for Non-Cognitive Scales: A Large Language Model Approach to Reducing Social-Desirability Bias

Sirui Wu, Daijin Yang

机构 * University of British Columbia(不列颠哥伦比亚大学) Northeastern University(东北大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted for publication in NCME-AIME 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18993 2025-09-25 cs.CL cs.DB 89%

MEBench: Benchmarking Large Language Models for Cross-Document Multi-Entity Question Answering

Teng Lin, Yuyu Luo, Honglin Zhang, Jicheng Zhang, Chunlin Liu, Kaishun Wu, Nan Tang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) China Mobile Information Technology Company Limited(中国移动信息技术有限公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments EMNLP2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23601 2025-09-25 cs.CV 89%

EndoBench: A Comprehensive Evaluation of Multi-Modal Large Language Models for Endoscopy Analysis

Shengyuan Liu, Boyun Zheng, Wenting Chen, Zhihao Peng, Zhenfei Yin, Jing Shao, Jiancong Hu, Yixuan Yuan

机构 * Chinese University of Hong Kong(中国香港大学) City University of Hong Kong(香港城市大学) University of Oxford(牛津大学) Shanghai AI Laboratory(上海人工智能实验室) The Sixth Affiliated Hospital, Sun Yat-sen University(中山大学第六附属医院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

Comments 40 pages, 22 figures; Accepted by NeurIPS 2025 Dataset and Benchmark Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20136 2025-09-25 cs.SE 89%

V-GameGym: Visual Game Generation for Code Large Language Models

Wei Zhang, Jack Yang, Renshuai Tao, Lingzheng Chai, Shawn Guo, Jiajun Wu, Xiaoming Chen, Ganqu Cui, Ning Ding, Xander Xu, Hu Wei, Bowen Zhou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14411 2025-09-25 cs.CL cs.AI 88%

Unifying Text Semantics and Graph Structures for Temporal Text-attributed Graphs with Large Language Models

Siwei Zhang, Yun Xiong, Yateng Tang, Jiarong Xu, Xi Chen, Zehao Gu, Xuezheng Hao, Zian Jia, Jiawei Zhang

机构 * Shanghai Key Laboratory of Data Science, School of Computer Science, Fudan University(上海数据科学 key laboratory,计算机科学学院,复旦大学) School of Management, Fudan University(管理学院,复旦大学) Tencent Weixin Group(腾讯微信集团) IFM Lab, University of California, Davis(加州大学戴维斯分校IFM实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19566 2025-09-25 cs.AI q-bio.GN 88%

Nano Bio-Agents (NBA): Small Language Model Agents for Genomics

George Hong, Daniel Trejo Banos

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02737 2025-09-25 cs.CL 88%

Large Language Models for Multilingual Previously Fact-Checked Claim Detection

Ivan Vykopal, Matúš Pikuliak, Simon Ostermann, Tatiana Anikina, Michal Gregor, Marián Šimko

机构 * Faculty of Information Technology, Brno University of Technology(布拉格技术大学信息学院) Kempelen Institute of Intelligent Technologies(智能技术研究所) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Centre for European Research in Trusted AI (CERTAIN)(可信人工智能欧洲研究中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted for the EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19673 2025-09-25 cs.SE 88%

Assertion Messages with Large Language Models (LLMs) for Code

Ahmed Aljohani, Anamul Haque Mollah, Hyunsook Do

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments Accepted at Proceedings of the 2025 Evaluation and Assessment in Software Engineering (EASE '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19926 2025-09-25 cs.LG 87%

MMSE-Calibrated Few-Shot Prompting for Alzheimer's Detection

Jana Sweidan, Mounim A. El-Yacoubi, Nasredine Semmar

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19369 2025-09-25 cs.CL cs.AI 86%

SLM-Based Agentic AI with P-C-G: Optimized for Korean Tool Use

Changhyun Jeon, Jinhee Park, Jungwoo Choi, Keonwoo Kim, Jisu Kim, Minji Hong

专题命中 评测与基准 :SLM(title,abstract);LLM(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10999 2025-09-25 cs.CL cs.AI 86%

TALEC: Teach Your LLM to Evaluate in Specific Domain with In-house Criteria by Criteria Division and Zero-shot Plus Few-shot

Kaiqi Zhang, Shuai Yuan, Honghan Zhao

机构 * ByteDance China(字节跳动中国) University of Electronic Science and Technology of China(电子科技大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19347 2025-09-25 cs.CL 85%

Characterizing Knowledge Graph Tasks in LLM Benchmarks Using Cognitive Complexity Frameworks

Sara Todorovikj, Lars-Peter Meyer, Michael Martin

机构 * Chemnitz University of Technology, Germany(德累斯顿技术大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments peer reviewed publication at SEMANTiCS 2025 Poster Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19329 2025-09-25 cs.CL stat.ME 85%

How Model Size, Temperature, and Prompt Style Affect LLM-Human Assessment Score Alignment

Julie Jung, Max Lu, Sina Chole Benker, Dogus Darici

机构 * Harvard Graduate School of Education(哈佛教育研究生院) Munster University(穆恩斯特大学) Institute of Anatomy and Neurobiology, University of Münster(解剖与神经生物学研究所,穆恩斯特大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments 9 pages, 4 figures, accepted at NCME AIME 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19890 2025-09-25 cs.CY 85%

DSA, AIA, and LLMs: Approaches to conceptualizing and auditing moderation in LLM-based chatbots across languages and interfaces in the electoral contexts

Natalia Stanusch, Raziye Buse Cetin, Salvatore Romano, Miazia Schueler, Meret Baumgartner, Bastian August, Alexandra Rosca

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19365 2025-09-25 cs.CL cs.LG 84%

LLM-Assisted Topic Reduction for BERTopic on Social Media Data

Wannes Janssens, Matthias Bogaert, Dirk Van den Poel

机构 * Ghent University(根特大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments 13 pages, 8 figures. To be published in the Post-Workshop proceedings of the ECML PKDD 2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19924 2025-09-25 cs.LG cs.AI 82%

Exploration with Foundation Models: Capabilities, Limitations, and Hybrid Approaches

Remo Sasso, Michelangelo Conserva, Dominik Jeurissen, Paulo Rauber

机构 * School of Electronic Engineering and Computer Science(电子工程与计算机科学学院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG;language model(comments)

Comments 16 pages, 7 figures. Accepted for presentation at the 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop on the Foundations of Reasoning in Language Models (FoRLM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19880 2025-09-25 cs.CL cs.AI 81%

Do Before You Judge: Self-Reference as a Pathway to Better LLM Evaluation

Wei-Hsiang Lin, Sheng-Lun Wei, Hen-Hsen Huang, Hsin-Hsi Chen

机构 * Department of Computer Science and Information Engineering(计算机科学与信息工程系) National Taiwan University(国立台湾大学) Institute of Information Science, Academia Sinica(学术院信息研究所) AI Research Center (AINTU)(人工智能研究中心)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

Comments Accepted as a long findings paper at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19586 2025-09-25 cs.LG cs.AI q-bio.BM 81%

A Foundation Chemical Language Model for Comprehensive Fragment-Based Drug Discovery

Alexander Ho, Sukyeong Lee, Francis T. F. Tsai

机构 * Advanced Technology Core for Macromolecular X-Ray Crystallography(宏分子X射线衍射先进技术核心) Verna and Marrs McLean Dept. of Biochemistry and Molecular Pharmacology(韦纳和玛里斯麦克莱恩生物化学与分子药理学系) Dept. of Molecular & Cellular Biology(分子与细胞生物学系) Dept. of Molecular Virology & Microbiology(分子病毒学与微生物学系) Baylor College of Medicine(贝勒医学院)

专题命中 评测与基准 :language model(title);foundation model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19364 2025-09-25 cs.CL cs.AI 81%

The Inadequacy of Offline LLM Evaluations: A Need to Account for Personalization in Model Behavior

Angelina Wang, Daniel E. Ho, Sanmi Koyejo

机构 * Cornell Tech(康奈尔科技) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(title);language model(abstract);分类 cs.CL、cs.AI

Comments forthcoming in Patterns

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19768 2025-09-25 cs.CL cs.CV 79%

CHURRO: Making History Readable with an Open-Weight Large Vision-Language Model for High-Accuracy, Low-Cost Historical Text Recognition

Sina J. Semnani, Han Zhang, Xinyan He, Merve Tekgürler, Monica S. Lam

机构 * Stanford University(斯坦福大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19453 2025-09-25 astro-ph.IM cs.LG 79%

The Platonic Universe: Do Foundation Models See the Same Sky?

UniverseTBD, :, Kshitij Duraphe, Michael J. Smith, Shashwat Sourav, John F. Wu

机构 * Independent Researcher(独立研究者) AstroAI Harvard-Smithsonian CfA(哈佛-史密松天体物理中心) University of Hertfordshire(赫特福德郡大学) Washington University St. Louis(圣路易斯华盛顿大学) Space Telescope Science Institute(空间望远镜科学研究所) Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

Comments 9 pages, 3 tables, 1 figure. Accepted as a workshop paper to Machine Learning and the Physical Sciences at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19336 2025-09-25 cs.CL cs.AI 79%

Cognitive-Level Adaptive Generation via Capability-Aware Retrieval and Style Adaptation

Qingsong Wang, Tao Wu, Wang Lin, Yueying Feng, Gongsheng Yuan, Chang Yao, Jingyuan Chen

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19856 2025-09-25 cs.LG 77%

Oversampling and Downsampling with Core-Boundary Awareness: A Data Quality-Driven Approach

Samir Brahim Belhaouari, Yunis Carreon Kahalan, Humaira Shaffique, Ismael Belhaouari, Ashhadul Islam

机构 * Hamad Bin Khalifa University(哈马德·本·卡尔法大学) Maastricht University(马斯特里赫特大学) KTH Royal Institute of Technology(皇家理工学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19965 2025-09-25 cs.CV 75%

SynchroRaMa : Lip-Synchronized and Emotion-Aware Talking Face Generation via Multi-Modal Emotion Embedding

Phyo Thet Yee, Dimitrios Kollias, Sudeepta Mishra, Abhinav Dhall

机构 * IIT Ropar(印度IIT罗帕尔) Queen Mary University of London(伦敦女王玛丽大学) Monash University(墨尔本大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments Accepted at WACV 2026, project page : https://novicemm.github.io/synchrorama

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18708 2025-09-25 cs.CL cs.AI cs.CR 73%

Evading Toxicity Detection with ASCII-art: A Benchmark of Spatial Attacks on Moderation Systems

Sergey Berezin, Reza Farahbakhsh, Noel Crespi

机构 * SAMOVAR Télécom SudParis Institut Polytechnique de Paris(巴黎高等理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Journal ref https://aclanthology.org/2025.woah-1.13/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02876 2025-09-25 cs.CV cs.LG 70%

Multimodal Reference Visual Grounding

Yangxiao Lu, Ruosen Li, Liqiang Jing, Jikai Wang, Xinya Du, Yunhui Guo, Nicholas Ruozzi, Yu Xiang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

Comments Project page with our code and dataset: https://irvlutd.github.io/MultiGrounding

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05926 2025-09-25 cs.CL 70%

LLMs Reproduce Stereotypes of Sexual and Gender Minorities

Ruby Ostrow, Adam Lopez

机构 * University of Edinburgh(爱丁堡大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 13 pages, 5 figures, 9 tables (including bibliography and appendix). Accepted to Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19861 2025-09-25 cs.CL 70%

SINAI at eRisk@CLEF 2025: Transformer-Based and Conversational Strategies for Depression Detection

Alba Maria Marmol-Romero, Manuel Garcia-Vega, Miguel Angel Garcia-Cumbreras, Arturo Montejo-Raez

机构 * Computer Science Department, SINAI, CEATIC, University of Jaen, 23071, Spain(计算机科学系、SINAI、CEATIC、杰恩大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL

Comments 16 pages, 10 figures, 8 tables. CLEF (Working Notes). 2025

Journal ref CEUR Workshop Proceedings 2025, vol. 4038, pp. 1620-1635

详情

展开后加载摘要…

URL PDF HTML 收藏