arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-30 至 2025-09-30 共收录 512 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 114 篇

2509.23510 2025-09-30 cs.AI 85%

Model Consistency as a Cheap yet Predictive Proxy for LLM Elo Scores

Ashwin Ramaswamy, Nestor Demeure, Ermal Rrapaj

机构 * Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24706 2025-09-30 cs.RO 85%

LLM-Handover:Exploiting LLMs for Task-Oriented Robot-Human Handovers

Andreea Tulbure, Rene Zurbruegg, Timm Grigat, Marco Hutter

机构 * Robotics System Lab, ETH Zürich(机器人系统实验室,苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24678 2025-09-30 cs.CL cs.AI cs.LG 85%

Reference-Free Rating of LLM Responses via Latent Information

Leander Girrbach, Chi-Ping Su, Tankred Saanum, Richard Socher, Eric Schulz, Zeynep Akata

机构 * Technical University of Munich, Munich Center for Machine Learning, MDSI(慕尼黑技术大学,慕尼黑机器学习中心,MDSI) National Yang Ming Chiao Tung University(阳明交通大学) Helmholtz Munich(海德堡慕尼黑研究所) Harvard University(哈佛大学)

专题命中 评测与基准 :LLM(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24507 2025-09-30 cs.SE 85%

SemGuard: Real-Time Semantic Evaluator for Correcting LLM-Generated Code

Qinglin Wang, Zhihong Sun, Ruyun Wang, Tao Huang, Zhi Jin, Ge Li, Chen Lyu

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted by the 40th IEEE/ACM Automated Software Engineering Conference (ASE 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23517 2025-09-30 cs.CV cs.AI 84%

Evaluating point-light biological motion in multimodal large language models

Akila Kadambi, Marco Iacoboni, Lisa Aziz-Zadeh, Srini Narayanan

机构 * Psychiatry and Biobehavioral Sciences, UCLA(乌尔拉克大学精神病学与生物行为科学系) Brain and Creativity Institute, USC(美国大学脑与创造力研究所) Google DeepMind, Zurich(谷歌深度Mind瑞士分公司)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09598 2025-09-30 cs.CL cs.AI cs.CY 84%

How to Protect Yourself from 5G Radiation? Investigating LLM Responses to Implicit Misinformation

Ruohao Guo, Wei Xu, Alan Ritter

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23417 2025-09-30 cs.CL cs.AI 84%

Retrieval-Constrained Decoding Reveals Underestimated Parametric Knowledge in Language Models

Rajaa El Hamdani, Samy Haffoudhi, Nils Holzenberger, Fabian Suchanek, Thomas Bonald, Fragkiskos D. Malliaros

机构 * Télécom Paris, Institut Polytechnique de Paris(巴黎电信学院,巴黎理工学院) Université Paris-Saclay, CentraleSupélec, Inria(巴黎萨克雷大学,中央理工-SUPÉLEC,Inria)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17127 2025-09-30 cs.CV cs.LG 83%

Pixels Versus Priors: Controlling Knowledge Priors in Vision-Language Models through Visual Counterfacts

Michal Golovanevsky, William Rudman, Michael Lepori, Amir Bar, Ritambhara Singh, Carsten Eickhoff

机构 * Brown University(布朗大学) Tel Aviv University(特拉维夫大学) University of Tübingen(图宾根大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04740 2025-09-30 cs.CV cs.AI 83%

SCRAMBLe : Enhancing Multimodal LLM Compositionality with Synthetic Preference Data

Samarth Mishra, Kate Saenko, Venkatesh Saligrama

机构 * Boston University(波士顿大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

Comments ICCV 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02910 2025-09-30 cs.CV cs.AI 83%

ImgTrojan: Jailbreaking Vision-Language Models with ONE Image

Xijia Tao, Shuai Zhong, Lei Li, Qi Liu, Lingpeng Kong

机构 * The University of Hong Kong(香港大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23827 2025-09-30 cs.CV cs.LG 83%

Assessing Visual Privacy Risks in Multimodal AI: A Novel Taxonomy-Grounded Evaluation of Vision-Language Models

Efthymios Tsaprazlis, Tiantian Feng, Anil Ramakrishna, Rahul Gupta, Shrikanth Narayanan

机构 * University of Southern California(南加州大学) Amazon AGI(亚马逊人工智能实验室)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23805 2025-09-30 cs.CL 83%

Open-DeBias: Toward Mitigating Open-Set Bias in Language Models

Arti Rani, Shweta Singh, Nihar Ranjan Sahoo, Gaurav Kumar Nayak

机构 * Mehta Family School of DS & AI, Indian Institute of Technology Roorkee(梅hta家庭数据科学与人工智能学院,印度理工学院罗里克分校) Computer Science and Engineering, Indian Institute of Technology Bombay(计算机科学与工程,印度理工学院孟买分校)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

Comments 25 pages, 3 figures, supplementary material included. To be published in EMNLP-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23088 2025-09-30 cs.CL 83%

The Geometry of Creative Variability: How Credal Sets Expose Calibration Gaps in Language Models

Esteban Garces Arias, Julian Rodemann, Christian Heumann

机构 * Department of Statistics, LMU Munich(统计系,慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) CISPA Helmholtz Center for Information Security(信息安全赫尔姆霍兹研究中心)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

Comments Accepted at the 2nd UncertaiNLP Workshop @ EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14783 2025-09-30 cs.LG cs.AI 82%

Omni-Thinker: Scaling Multi-Task RL in LLMs with Hybrid Reward and Task Scheduling

Derek Li, Jiaming Zhou, Leo Maxime Brunswic, Abbas Ghaddar, Qianyi Sun, Liheng Ma, Yu Luo, Dong Li, Mark Coates, Jianye Hao, Yingxue Zhang

机构 * Huawei Noah’s Ark Lab, Montréal, Canada(华为诺亚实验室,加拿大蒙特利尔) McGill University and Mila - Québec AI Institute(麦吉尔大学和魁北克人工智能研究所) Huawei Noah’s Ark Lab, Beijing, China(华为诺亚实验室,中国北京)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24048 2025-09-30 cs.CR 82%

Analyzing and Evaluating Unbiased Language Model Watermark

Yihan Wu, Xuehao Cui, Ruibo Chen, Heng Huang

专题命中 评测与基准 :language model(title,abstract);large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01667 2025-09-30 cs.CV 82%

EarthMind: Leveraging Cross-Sensor Data for Advanced Earth Observation Interpretation with a Unified Multimodal LLM

Yan Shu, Bin Ren, Zhitong Xiong, Danda Pani Paudel, Luc Van Gool, Begüm Demir, Nicu Sebe, Paolo Rota

机构 * University of Trento(特伦托大学) BIFOLD and Technische Universität Berlin(BIFOLD和柏林技术大学) Technical University of Munich(慕尼黑技术大学) University of Pisa(比萨大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25138 2025-09-30 cs.CL 81%

Investigating Language and Retrieval Bias in Multilingual Previously Fact-Checked Claim Detection

Ivan Vykopal, Antonia Karamolegkou, Jaroslav Kopčan, Qiwei Peng, Tomáš Javůrek, Michal Gregor, Marián Šimko

机构 * Brno University of Technology(布拉格技术大学) Kempelen Institute of Intelligent Technologies(智能技术研究所) University of Copenhagen(哥本哈根大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24086 2025-09-30 cs.AI cs.CL 81%

Do Repetitions Matter? Strengthening Reliability in LLM Evaluations

Miguel Angel Alvarado Gonzalez, Michelle Bruno Hernandez, Miguel Angel Peñaloza Perez, Bruno Lopez Orozco, Jesus Tadeo Cruz Soto, Sandra Malagon

机构 * Carreras con Impacto Aixo Lab(Impact Aixo实验室) Centro de Investigación Científica y de Educación Superior de Ensenada, Baja California, México(恩森亚达科学与高等教育研究中心,墨西哥) Facultad de Ciencias, UNAM, México(国家自治大学科学学院,墨西哥) Facultad de Matemáticas, Universidad Veracruzana, México(韦拉克鲁斯大学数学学院,墨西哥)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03859 2025-09-30 cs.ET cs.AI cs.LG cs.SI physics.soc-ph 81%

UniTraj: Learning a Universal Trajectory Foundation Model from Billion-Scale Worldwide Traces

Yuanshao Zhu, James Jianqiao Yu, Xiangyu Zhao, Xun Zhou, Liang Han, Xuetao Wei, Yuxuan Liang

机构 * Southern University of Science and Technology(南方科技大学) City University of Hong Kong(香港城市大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

Comments Accepted as a research paper by NeurIPS'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23695 2025-09-30 cs.LG cs.AI 81%

Estimating Time Series Foundation Model Transferability via In-Context Learning

Qingren Yao, Ming Jin, Chengqi Zhang, Chao-Han Huck Yang, Jun Qi, Shirui Pan

机构 * Griffith University(格里菲斯大学) Hong Kong Baptist University(香港 Baptist 大学) The Hong Kong Polytechnic University(香港理工大学) NVIDIA Research(NVIDIA 研究)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10171 2025-09-30 cs.CR cs.AI cs.CL 81%

Beyond Jailbreaking: Auditing Contextual Privacy in LLM Agents

Saswat Das, Jameson Sandler, Ferdinando Fioretto

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15367 2025-09-30 cs.CV cs.AI cs.CL 81%

Better Safe Than Sorry? Overreaction Problem of Vision Language Models in Visual Emergency Recognition

Dasol Choi, Seunghyun Lee, Youngsook Song

机构 * AIM Intelligence(AIM智能公司) Yonsei University(延世大学) Lablup Inc.(Lablup公司)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22973 2025-09-30 cs.CL cs.AI cs.LG 80%

XL-Suite: Cross-Lingual Synthetic Training and Evaluation Data for Open-Ended Generation

Vivek Iyer, Pinzhen Chen, Ricardo Rei, Alexandra Birch

机构 * University of Edinburgh(爱丁堡大学) Sword Health Queen’s University Belfast(贝尔法斯特女王大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to EMNLP 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03905 2025-09-30 cs.SE cs.AI 79%

Integrating Various Software Artifacts for Better LLM-based Bug Localization and Program Repair

Qiong Feng, Xiaotian Ma, Jiayi Sheng, Ziyuan Feng, Wei Song, Peng Liang

机构 * Nanjing University of Science and Technology(南京理工大学) State Key Lab. for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

Comments Preprint accepted for publication in ACM Transactions on Software Engineering and Methodology (TOSEM), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21262 2025-09-30 cs.CL 79%

Un-Doubling Diffusion: LLM-guided Disambiguation of Homonym Duplication

Evgeny Kaskov, Elizaveta Petrova, Petr Surovtsev, Anna Kostikova, Ilya Mistiurin, Alexander Kapitanov, Alexander Nagaev

专题命中 评测与基准 :LLM(title);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23715 2025-09-30 cs.CL cs.LG 79%

Do LLMs Understand Romanian Driving Laws? A Study on Multimodal and Fine-Tuned Question Answering

Eduard Barbu, Adrian Marius Dumitran

机构 * Faculty of Mathematics and Informatics, University of Bucharest(数学与信息学系,布加勒斯特大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Accepted@ CONSILR 2025 Bucharest Romania 9-10 October

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05991 2025-09-30 cs.CL cs.LG 79%

A Culturally-Rich Romanian NLP Dataset from "Who Wants to Be a Millionaire?" Videos

Alexandru-Gabriel Ganea, Antonia-Adelina Popovici, Adrian-Marius Dumitran

机构 * University of Bucharest Faculty of Mathematics and Computer Science(布加勒斯特大学数学与计算机科学学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24419 2025-09-30 cs.SE 78%

Unit Test Update through LLM-Driven Context Collection and Error-Type-Aware Refinement

Yuanhe Zhang, Zhiquan Yang, Shengyi Pan, Zhongxin Liu

专题命中 评测与基准 :LLM(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08900 2025-09-30 cs.CV 78%

MIRAGE: Multimodal foundation model and benchmark for comprehensive retinal OCT image analysis

José Morano, Botond Fazekas, Emese Sükei, Ronald Fecso, Taha Emre, Markus Gumpinger, Georg Faustmann, Marzieh Oghbaie, Ursula Schmidt-Erfurth, Hrvoje Bogunović

机构 * Christian Doppler Laboratory for Artificial Intelligence in Retina(人工智能视网膜实验室) Institute of Artificial Intelligence(人工智能研究所) Center for Medical Data Science(医学数据科学中心) Medical University of Vienna(维也纳医学大学) Comprehensive Center for AI in Medicine(医学人工智能综合中心) OPTIMA Lab(OPTIMA实验室) Department of Ophthalmology(眼科学系)

专题命中 评测与基准 :foundation model(title,abstract)

Comments Accepted for publication in npj Digital Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23590 2025-09-30 eess.IV eess.SP 78%

Foundation Model-Based Adaptive Semantic Image Transmission for Dynamic Wireless Environments

Fangyu Liu, Peiwen Jiang, Wenjin Wang, Chao-Kai Wen, Shi Jin, Jun Zhang

专题命中 评测与基准 :foundation model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏