arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-18 至 2025-11-18 共收录 428 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 94 篇

2508.17229 2025-11-18 cs.SD cs.AI cs.LG eess.AS 73%

Multi-Metric Preference Alignment for Generative Speech Restoration

Junan Zhang, Xueyao Zhang, Jing Yang, Yuancheng Wang, Fan Fan, Zhizheng Wu

专题命中 评测与基准 :post-training(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

Comments Accepted by AAAI 2026. Demopage: https://gensr-pref.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08098 2025-11-18 cs.SE cs.AI cs.LG 73%

What You See Is Not Always What You Get: Evaluating GPT's Comprehension of Source Code

Jiawen Wen, Bangshuo Zhu, Huaming Chen

机构 * The University of Sydney(悉尼大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments This work has been accepted at APSEC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11933 2025-11-18 cs.CL cs.LG 73%

InData: Towards Secure Multi-Step, Tool-Based Data Analysis

Karthikeyan K, Raghuveer Thirukovalluru, Bhuwan Dhingra, David Edwin Carlson

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11773 2025-11-18 cs.AI cs.LG 73%

On the Measure of a Model: From Intelligence to Generality

Ruchira Dhar, Ninell Oldenburg, Anders Soegaard

机构 * Department of Computer Science(计算机科学系) University of Copenhagen(哥本哈根大学) Centre for Philosophy of AI(人工智能哲学中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Accepted at EurIPS Workshop on "The Science of Benchmarking and Evaluating AI"

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11597 2025-11-18 cs.AI cs.CL 73%

CLINB: A Climate Intelligence Benchmark for Foundational Models

Michelle Chen Huebscher, Katharine Mach, Aleksandar Stanić, Markus Leippold, Ben Gaiarin, Zeke Hausfather, Elisa Rawat, Erich Fischer, Massimiliano Ciaramita, Joeri Rogelj, Christian Buck, Lierni Sestorain Saralegui, Reto Knutti

机构 * University of Miami(迈阿密大学) University of Zurich(苏黎世大学) Stripe(Stripe公司) ETH Zurich(苏黎世联邦理工学院) Imperial College London(伦敦帝国理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Questions, system prompt and model judge prompts available here: https://www.kaggle.com/datasets/deepmind/clinb-questions

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11576 2025-11-18 cs.LG cs.AI 73%

DAOpt: Modeling and Evaluation of Data-Driven Optimization under Uncertainty with LLMs

WenZhuo Zhu, Zheng Cui, Wenhan Lu, Sheng Liu, Yue Zhao

机构 * Zhejiang University(浙江大学) University of Toronto(多伦多大学) Peking University(北京大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13432 2025-11-18 cs.CY 71%

The Last Vote: A Multi-Stakeholder Framework for Language Model Governance

Subramanyam Sahoo, Aditi Chhawacharia

专题命中 评测与基准 :language model(title)

Comments This paper has been accepted to the NeurIPS 2025 Workshop on Algorithmic Collective Action (ACA@NeurIPS 2025). The submission is 26 pages including the appendix and includes the NeurIPS checklist. A big thanks to Avijit Ghosh

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13087 2025-11-18 cs.AI cs.CV 70%

MEGA-GUI: Multi-stage Enhanced Grounding Agents for GUI Elements

SeokJoo Kwak, Jihoon Kim, Boyoun Kim, Jung Jae Yoon, Wooseok Jang, Jeonghoon Hong, Jaeho Yang, Yeong-Dae Kwon

机构 * Samsung SDS(三星SDS)

专题命中 评测与基准 :language model(abstract);language agent(abstract);分类 cs.AI

Comments 26 pages, 7 figures. Code available at https://github.com/samsungsds-research-papers/mega-gui

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12928 2025-11-18 cs.CL 70%

Visual Room 2.0: Seeing is Not Understanding for MLLMs

Haokun Li, Yazhou Zhang, Jizhi Ding, Qiuchi Li, Peng Zhang

机构 * Tianjin University(天津大学) Shandong Institute of Petroleum and Chemical Technology(山东石油化学技术学院) Beijing Institute of Technology(北京理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12464 2025-11-18 cs.CL 70%

Probing Preference Representations: A Multi-Dimensional Evaluation and Analysis Method for Reward Models

Chenglong Wang, Yifu Huo, Yang Gan, Yongyu Mu, Qiaozhi He, Murun Yang, Bei Li, Chunliang Zhang, Tongran Liu, Anxiang Ma, Zhengtao Yu, Jingbo Zhu, Tong Xiao

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Meituan Inc.(美团公司) NiuTrans Research(牛译研所) CAS Key Laboratory of Behavioral Science, Institute of Psychology, CAS(中国科学院行为科学重点实验室) Kunming University of Science and Technology(昆明理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11347 2025-11-18 cs.CR cs.AI 70%

Privacy Challenges and Solutions in Retrieval-Augmented Generation-Enhanced LLMs for Healthcare Chatbots: A Review of Applications, Risks, and Future Directions

Shaowei Guan, Hin Chi Kwok, Ngai Fong Law, Gregor Stiglic, Harry Qin, Vivian Hui

机构 * Centre for Smart Health, School of Nursing(智能健康中心、护理学院) The Hong Kong Polytechnic University(香港理工大学) Department of Electrical and Electronic Engineering(电子与电气工程系) Faculty of Health Sciences(健康科学学院) University of Maribor(马里博大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 23 pages, 2 figures; Corrected typos and 2 references format, added a co-author

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08230 2025-11-18 cs.CL 70%

VocalBench-zh: Decomposing and Benchmarking the Speech Conversational Abilities in Mandarin Context

Heyang Liu, Ziyang Cheng, Yuhao Wang, Hongcheng Liu, Yiqi Li, Ronghua Wu, Qunshan Gu, Yanfeng Wang, Yu Wang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments This article will serve as an extension of the preceding work, "VocalBench: Benchmarking the Vocal Conversational Abilities for Speech Interaction Models" (arXiv:2505.15727). Therefore, we have chosen to withdraw to avoid potential duplicate publication. We will update the previously open-sourced paper of VocalBench in several weeks to include the content of VocalBench-zh

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04614 2025-11-18 cs.AI 70%

Look Before You Leap: A GUI-Critic-R1 Model for Pre-Operative Error Diagnosis in GUI Automation

Yuyang Wanyan, Xi Zhang, Haiyang Xu, Haowei Liu, Junyang Wang, Jiabo Ye, Yutong Kou, Ming Yan, Fei Huang, Xiaoshan Yang, Weiming Dong, Changsheng Xu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences, China(自动化研究所,中国科学院,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, China(中国科学院大学人工智能学院,中国) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18916 2025-11-18 cs.CL 70%

SCRum-9: Multilingual Stance Classification over Rumours on Social Media

Yue Li, Jake Vasilakes, Zhixue Zhao, Carolina Scarton

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted by ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12659 2025-11-18 cs.CY cs.AI 70%

The Hidden Risks of Large Reasoning Models: A Safety Assessment of R1

Kaiwen Zhou, Chengzhi Liu, Xuandong Zhao, Shreedhar Jangam, Jayanth Srinivasa, Gaowen Liu, Dawn Song, Xin Eric Wang

机构 * UC Santa Cruz(加州大学圣克ruz分校) UC Santa Barbara(加州大学圣芭芭拉分校) UC Berkeley(加州大学伯克利分校) Cisco Research(思科研究)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12155 2025-11-18 cs.LG 70%

Rethinking Deep Alignment Through The Lens Of Incomplete Learning

Thong Bach, Dung Nguyen, Thao Minh Le, Truyen Tran

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

Comments AAAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12014 2025-11-18 cs.CL cs.HC 70%

CURE: Cultural Understanding and Reasoning Evaluation - A Framework for "Thick" Culture Alignment Evaluation in LLMs

Truong Vo, Sanmi Koyejo

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11655 2025-11-18 cs.CY cs.CL 70%

Automatic generation of DRI Statements

Maurice Flechtner

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Master Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04832 2025-11-18 cs.CL 70%

Joint Evaluation of Answer and Reasoning Consistency for Hallucination Detection in Large Reasoning Models

Changyue Wang, Weihang Su, Qingyao Ai, Yiqun Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Quan Cheng Laboratory(泉城实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13333 2025-11-18 cs.CR cs.AI cs.CL cs.LG 67%

AutoMalDesc: Large-Scale Script Analysis for Cyber Threat Research

Alexandru-Mihai Apostu, Andrei Preda, Alexandra Daniela Damir, Diana Bolocan, Radu Tudor Ionescu, Ioana Croitoru, Mihaela Gaman

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at AAAI 2026 (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13248 2025-11-18 cs.CR 67%

DualTAP: A Dual-Task Adversarial Protector for Mobile MLLM Agents

Fuyao Zhang, Jiaming Zhang, Che Wang, Xiongtao Sun, Yurong Hao, Guowei Guan, Wenjie Li, Longtao Huang, Wei Yang Bryan Lim

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12393 2025-11-18 cs.SI cs.SY eess.SY 67%

Learning to Control Misinformation: a Closed-loop Approach for Misinformation Mitigation over Social Networks

Nicolo' Pagan, Andreas Philippou, Giulia De Pasquale

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12363 2025-11-18 cs.CV 67%

Explainable AI-Generated Image Detection RewardBench

Michael Yang, Shijian Deng, William T. Doan, Kai Wang, Tianyu Yang, Harsh Singh, Yapeng Tian

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Toronto(多伦多大学) University of Notre Dame(诺特大学) Stony Brook University(石溪大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12040 2025-11-18 cs.CV 67%

SRSplat: Feed-Forward Super-Resolution Gaussian Splatting from Sparse Multi-View Images

Xinyuan Hu, Changyue Shi, Chuxiao Yang, Minghao Chen, Jiajun Ding, Tao Wei, Chen Wei, Zhou Yu, Min Tan

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments AAAI2026-Oral. Project Page: https://xinyuanhu66.github.io/SRSplat/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13021 2025-11-18 cs.AI cs.CL 62%

PragWorld: A Benchmark Evaluating LLMs' Local World Model under Minimal Linguistic Alterations and Conversational Dynamics

Sachin Vashistha, Aryan Bibhuti, Atharva Naik, Martin Tutek, Somak Aditya

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

Comments 23 pages, 15 tables, 10 figures; AAAI 2026 Conference Main Track (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13684 2025-11-18 cs.CV cs.LG 57%

Training-Free Multi-View Extension of IC-Light for Textual Position-Aware Scene Relighting

Jiangnan Ye, Jiedong Zhuang, Lianrui Mu, Wenjie Zheng, Jiaqi Hu, Xingze Zou, Jing Wang, Haoji Hu

机构 * College of Information Science(信息科学学院) Electronic Engineering, Zhejiang University, Hangzhou, 310027, Zhejiang, China(电子工程系,浙江大学,杭州,310027,浙江,中国)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

Comments Submitting for Neurocomputing

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03127 2025-11-18 cs.CV cs.AI 57%

Landsat30-AU: A Vision-Language Dataset for Australian Landsat Imagery

Sai Ma, Zhuang Li, John A Taylor

专题命中 评测与基准 :language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15249 2025-11-18 cs.CL cs.CV 57%

Fooling the LVLM Judges: Visual Biases in LVLM-Based Evaluation

Yerin Hwang, Dongryeol Lee, Kyungmin Min, Taegwan Kang, Yong-il Kim, Kyomin Jung

机构 * IPAI, Seoul National University(IPAI,首尔国立大学) Dept. of ECE, Seoul National University(电子工程系,首尔国立大学) LG AI Research(LG人工智能研究)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

Comments EMNLP 2025 Main (21pgs, 12 Tables, 9 Figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12149 2025-11-18 cs.CR cs.AI cs.CV 57%

AttackVLA: Benchmarking Adversarial and Backdoor Attacks on Vision-Language-Action Models

Jiayu Li, Yunhan Zhao, Xiang Zheng, Zonghuan Xu, Yige Li, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) City University of Hong Kong(香港城市大学) Singapore Management University(新加坡管理大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06194 2025-11-18 cs.CL 57%

SceneJailEval: A Scenario-Adaptive Multi-Dimensional Framework for Jailbreak Evaluation

Lai Jiang, Yuekang Li, Xiaohan Zhang, Youtao Ding, Li Pan

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

Comments This paper has been accepted by AAAI 2026 as a poster

详情

展开后加载摘要…

URL PDF HTML 收藏