arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-04 至 2025-09-04 共收录 27 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 27 篇

2509.03331 2025-09-04 cs.SE cs.CR 90%

VulnRepairEval: An Exploit-Based Evaluation Framework for Assessing Large Language Model Vulnerability Repair Capabilities

Weizhe Wang, Wei Ma, Qiang Hu, Yao Zhang, Jianfei Sun, Bin Wu, Yang Liu, Guangquan Xu, Lingxiao Jiang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03021 2025-09-04 eess.AS cs.SD 88%

A Study on Zero-Shot Non-Intrusive Speech Intelligibility for Hearing Aids Using Large Language Models

Ryandhimas E. Zezario, Dyah A. M. G. Wisnu, Hsin-Min Wang, Yu Tsao

机构 * Academia Sinica(中国科学院) National Chengchi University(中正大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments Accepted to IEEE ICCE-TW 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02754 2025-09-04 cs.AI 87%

Do LLM Modules Generalize? A Study on Motion Generation for Autonomous Driving

Mingyi Wang, Jingke Wang, Tengju Ye, Junbo Chen, Kaicheng Yu

机构 * Autolab, Westlake University(自动化实验室,西lake大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments CoRL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12100 2025-09-04 cs.CR cs.AI 85%

LLM Embedding-based Attribution (LEA): Quantifying Source Contributions to Generative Model's Response for Vulnerability Analysis

Reza Fayyazi, Michael Zuzak, Shanchieh Jay Yang

机构 * Rochester Institute of Technology(罗切斯特技术学院) Gonzaga University(戈兹加大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02659 2025-09-04 cs.CV cs.RO 85%

2nd Place Solution for CVPR2024 E2E Challenge: End-to-End Autonomous Driving Using Vision Language Model

Zilong Guo, Yi Luo, Long Sha, Dongxu Wang, Panqu Wang, Chenyang Xu, Yi Yang

机构 * ZERON Shanghai, China(上海零点科技有限公司)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract)

Comments 2nd place in CVPR 2024 End-to-End Driving at Scale Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21376 2025-09-04 cs.AI cs.CL 84%

AHELM: A Holistic Evaluation of Audio-Language Models

Tony Lee, Haoqin Tu, Chi Heem Wong, Zijun Wang, Siwei Yang, Yifan Mai, Yuyin Zhou, Cihang Xie, Percy Liang

机构 * Stanford University(斯坦福大学) University of California, Santa Cruz(加州大学圣克ruz分校) Hitachi America, Ltd.(日立美国有限公司)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20940 2025-09-04 cs.CL 83%

Attacking Misinformation Detection Using Adversarial Examples Generated by Language Models

Piotr Przybyła, Euan McGill, Horacio Saggion

机构 * TALN Group, Universitat Pompeu Fabra(庞培法华大学TALN小组) Institute of Computer Science, Polish Academy of Sciences(波兰科学院计算机科学研究所)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

Comments Presented at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02746 2025-09-04 cs.LG cs.AI q-bio.NC 81%

Mentality: A Mamba-based Approach towards Foundation Models for EEG

Saarang Panchavati, Corey Arnold, William Speier

机构 * Department of Radiology University of California(放射科系 加州大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

Journal ref In Proceedings of the ICLR 2024 Workshop on Learning from Time Series for Health (2024). Retrieved from https://openreview.net/forum?id=O6T38rRiFp

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13037 2025-09-04 eess.IV cs.AI cs.CV 79%

Towards Cardiac MRI Foundation Models: Comprehensive Visual-Tabular Representations for Whole-Heart Assessment and Beyond

Yundi Zhang, Paul Hager, Che Liu, Suprosanna Shit, Chen Chen, Daniel Rueckert, Jiazhen Pan

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11667 2025-09-04 cs.LG 79%

INCPrompt: Task-Aware incremental Prompting for Rehearsal-Free Class-incremental Learning

Zhiyuan Wang, Xiaoyang Qu, Jing Xiao, Bokui Chen, Jianzong Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院) Ping An Technology (Shenzhen) Co., Ltd., Shenzhen, China(平安科技(深圳)有限公司) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室)

专题命中 评测与基准 :prompting(title,abstract);分类 cs.LG

Comments Accepted by the 49th IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02751 2025-09-04 cs.AI cs.DB cs.LG cs.MA 79%

Deep Research is the New Analytics System: Towards Building the Runtime for AI-Driven Analytics

Matthew Russo, Tim Kraska

机构 * MIT(麻省理工学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 6 pages, 2 figures, submitted to CIDR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12553 2025-09-04 cs.CV 78%

ViDDAR: Vision Language Model-Based Task-Detrimental Content Detection for Augmented Reality

Yanming Xiu, Tim Scargill, Maria Gorlatova

机构 * Duke University(杜克大学)

专题命中 评测与基准 :language model(title,abstract)

Comments The paper has been accepted to the 2025 IEEE Conference on Virtual Reality and 3D User Interfaces (IEEE VR), and selected for publication in the 2025 IEEE Transactions on Visualization and Computer Graphics (TVCG) special issue

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02820 2025-09-04 cs.LG 77%

Unlearning That Lasts: Utility-Preserving, Robust, and Almost Irreversible Forgetting in LLMs

Naman Deep Singh, Maximilian Müller, Francesco Croce, Matthias Hein

机构 * University of Tübingen & Tübingen AI Center, Germany(图宾根大学及图宾根人工智能中心) EPFL, Switzerland(瑞士联邦理工学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19988 2025-09-04 cs.DB 75%

Automatic Metadata Extraction for Text-to-SQL

Vladislav Shkapenyuk, Divesh Srivastava, Theodore Johnson, Parisa Ghane

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02708 2025-09-04 cs.LG cs.AI cs.CL 75%

Exploring Response Uncertainty in MLLMs: An Empirical Evaluation under Misleading Scenarios

Yunkai Dang, Mengxi Gao, Yibo Yan, Xin Zou, Yanggan Gu, Jungang Li, Jingyu Wang, Peijie Jiang, Aiwei Liu, Jia Liu, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) Ant Group(蚂蚁集团) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03093 2025-09-04 cs.SE cs.AI 74%

Are We SOLID Yet? An Empirical Study on Prompting LLMs to Detect Design Principle Violations

Fatih Pehlivan, Arçin Ülkü Ergüzen, Sahand Moslemi Yengejeh, Mayasah Lami, Anil Koyuncu

机构 * Bilkent University, Turkey(巴伊肯大学)

专题命中 评测与基准 :prompting(title);分类 cs.AI

Comments Accepted to ASE2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03329 2025-09-04 cs.CY cs.CL 70%

SESGO: Spanish Evaluation of Stereotypical Generative Outputs

Melissa Robles, Catalina Bernal, Denniss Raigoso, Mateo Dulce Rubio

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03162 2025-09-04 cs.CL 70%

SinhalaMMLU: A Comprehensive Benchmark for Evaluating Multitask Language Understanding in Sinhala

Ashmari Pramodya, Nirasha Nelki, Heshan Shalinda, Chamila Liyanage, Yusuke Sakai, Randil Pushpananda, Ruvan Weerasinghe, Hidetaka Kamigaito, Taro Watanabe

机构 * Nara Institute of Science and Technology (NAIST)(奈良科学技术研究所) University of Colombo School of Computing (UCSC)(科伦坡大学计算学院) Informatics Institute of Technology (IIT)(信息技术研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 19 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03385 2025-09-04 cs.CV 67%

Human Preference-Aligned Concept Customization Benchmark via Decomposed Evaluation

Reina Ishikawa, Ryo Fujii, Hideo Saito, Ryo Hachiuma

机构 * Keio University(庆应大学) NVIDIA(英伟达)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments Accepted to ICCV Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02807 2025-09-04 cs.CV 67%

PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?

Mennatullah Siam

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments Work under review in NeurIPS 2025 with the title "Are we using Motion in Referring Segmentation? A Motion-Centric Evaluation"

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19493 2025-09-04 cs.CR cs.CV 67%

Mind the Third Eye! Benchmarking Privacy Awareness in MLLM-powered Smartphone Agents

Zhixin Lin, Jungang Li, Shidong Pan, Yibo Shi, Yue Yao, Dongliang Xu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15800 2025-09-04 cs.IR 67%

FinDER: Financial Dataset for Question Answering and Evaluating Retrieval-Augmented Generation

Chanyeol Choi, Jihoon Kwon, Jaeseon Ha, Hojun Choi, Chaewoon Kim, Yongjae Lee, Jy-yong Sohn, Alejandro Lopez-Lira

专题命中 评测与基准 :large language model(abstract);language model(abstract)

Comments 10 pages, 3 figures, ICLR 2025 Workshop Advances in Financial AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17137 2025-09-04 cs.CL cs.AI 62%

Cog-TiPRO: Iterative Prompt Refinement with LLMs to Detect Cognitive Decline via Longitudinal Voice Assistant Commands

Kristin Qi, Youxiang Zhu, Caroline Summerour, John A. Batsis, Xiaohui Liang

机构 * Computer Science, University of Massachusetts, Boston, MA, USA(计算机科学,马萨诸塞大学,波士顿,马萨诸塞州,美国) School of Medicine, University of North Carolina, Chapel Hill, NC, USA(医学院,北卡罗来纳大学,夏洛特,北卡罗来纳州,美国)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

Comments IEEE Global Communications Conference (GlobeCom) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05225 2025-09-04 cs.CL 57%

QualBench: Benchmarking Chinese LLMs with Localized Professional Qualifications for Vertical Domain Evaluation

Mengze Hong, Wailing Ng, Chen Jason Zhang, Di Jiang

机构 * Hong Kong Polytechnic University(香港理工大学) AI Group, WeBank Co., Ltd(WeBank公司人工智能部)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

Comments Accepted by EMNLP 2025 Main Conference. Homepage: https://github.com/mengze-hong/QualBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03037 2025-09-04 cs.CR cs.ET cs.SE 50%

TraceLLM: Security Diagnosis Through Traces and Smart Contracts in Ethereum

Shuzheng Wang, Yue Huang, Zhuoer Xu, Yuming Huang, Jing Tang

专题命中 评测与基准 :LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01275 2025-09-04 cs.CV 50%

Novel Category Discovery with X-Agent Attention for Open-Vocabulary Semantic Segmentation

Jiahao Li, Yang Lu, Yachao Zhang, Fangyong Wang, Yuan Xie, Yanyun Qu

专题命中 评测与基准 :language model(abstract)

Comments Accepted by ACMMM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09600 2025-09-04 cs.SD 50%

OSUM-EChat: Enhancing End-to-End Empathetic Spoken Chatbot via Understanding-Driven Spoken Dialogue

Xuelong Geng, Qijie Shao, Hongfei Xue, Shuiyuan Wang, Hanke Xie, Zhao Guo, Yi Zhao, Guojian Li, Wenjie Tian, Chengyou Wang, Zhixian Zhao, Kangxiang Xia, Ziyu Zhang, Zhennan Lin, Tianlun Zuo, Mingchen Shao, Yuang Cao, Guobin Ma, Longhao Li, Yuhang Dai, Dehui Gao, Dake Guo, Lei Xie

专题命中 评测与基准 :language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏