arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-09-24 至 2025-09-24 共收录 202 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 56 篇

2509.16516 2025-09-24 cs.LG 85%

LLM-Guided Co-Training for Text Classification

Md Mezbaur Rahman, Cornelia Caragea

机构 * Computer Science University of Illinois Chicago(计算机科学伊利诺伊大学芝加哥分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15260 2025-09-24 cs.CL 85%

Toxicity Red-Teaming: Benchmarking LLM Safety in Singapore's Low-Resource Languages

Yujia Hu, Ming Shan Hee, Preslav Nakov, Roy Ka-Wei Lee

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Mohamed bin Zayed University of Artificial Intelligence(马尔代夫 bin Zayed 人工智能大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments 9 pages, EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18965 2025-09-24 cs.HC 85%

Benchmarking PDF Accessibility Evaluation A Dataset and Framework for Assessing Automated and LLM-Based Approaches for Accessibility Testing

Anukriti Kumar, Tanushree Padath, Lucy Lu Wang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09468 2025-09-24 cs.LG cs.AI 84%

DeepFeatIoT: Unifying Deep Learned, Randomized, and LLM Features for Enhanced IoT Time Series Sensor Data Classification in Smart Industries

Muhammad Sakib Khan Inan, Kewen Liao

机构 * School of Information Technology, Deakin University(信息科技学院,德肯大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Accepted for publication at IJCAI 2025

Journal ref Proceedings of the Thirty-Fourth International Joint Conference on Artificial Intelligence (IJCAI-25), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15389 2025-09-24 cs.CL cs.CR cs.CV 83%

Are Vision-Language Models Safe in the Wild? A Meme-Based Benchmark Study

DongGeon Lee, Joonwon Jang, Jihae Jeong, Hwanjo Yu

机构 * Pohang University of Science and Technology (POSTECH)(釜山科学技术大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18405 2025-09-24 cs.CV cs.AI 83%

Check Field Detection Agent (CFD-Agent) using Multimodal Large Language and Vision Language Models

Sourav Halder, Jinjun Tong, Xinyu Wu

机构 * U.S. Bank(美国银行)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

Comments 12 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18641 2025-09-24 cs.HC cs.IR 82%

BloomIntent: Automating Search Evaluation with LLM-Generated Fine-Grained User Intents

Yoonseo Choi, Eunhye Kim, Hyunwoo Kim, Donghyun Park, Honggu Lee, Jinyoung Kim, Juho Kim

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

Comments Accepted to UIST 2025; 34 pages (including 18 pages of Appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08019 2025-09-24 cs.CL cs.AI cs.LG stat.AP stat.ME stat.ML 82%

Language Models as Causal Effect Generators

Lucius E. J. Bynum, Kyunghyun Cho

机构 * New York University(纽约大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19070 2025-09-24 cs.CV cs.CL 80%

ColorBlindnessEval: Can Vision-Language Models Pass Color Blindness Tests?

Zijian Ling, Han Zhang, Yazhuo Zhou, Jiahao Cui

机构 * Apply U United Kingdom(英国Apply大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL;foundation model(comments)

Comments Accepted at the Open Science for Foundation Models (SCI-FM) Workshop at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19274 2025-09-24 cs.CL cs.MM 79%

DRISHTIKON: A Multimodal Multilingual Benchmark for Testing Language Models' Understanding on Indian Culture

Arijit Maji, Raghvendra Kumar, Akash Ghosh, Anushka, Nemil Shah, Abhilekh Borah, Vanshika Shah, Nishant Mishra, Sriparna Saha

机构 * Indian Institute of Technology Patna(印度理工学院帕纳巴分校) Banasthali Vidyapeeth University(班纳萨利大学) Pandit Deendayal Energy University(德英德能源大学) Manipal University Jaipur(马哈拉施特拉邦大学贾伊普尔分校) Dwarkadas J. Sanghvi College of Engineering(德瓦尔卡斯J.桑格维工程学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

Comments EMNLP MAINS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01346 2025-09-24 cs.CV cs.CL 79%

Large Vision-Language Model Alignment and Misalignment: A Survey Through the Lens of Explainability

Dong Shu, Haiyan Zhao, Jingyu Hu, Weiru Liu, Ali Payani, Lu Cheng, Mengnan Du

机构 * Northwestern University(西北大学) New Jersey Institute of Technology(新泽西理工学院) University of Bristol(布里斯托大学) Cisco Research(思科研究) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18058 2025-09-24 cs.LG cs.AI cs.CR 79%

Strategic Dishonesty Can Undermine AI Safety Evaluations of Frontier LLMs

Alexander Panfilov, Evgenii Kortukov, Kristina Nikolić, Matthias Bethge, Sebastian Lapuschkin, Wojciech Samek, Ameya Prabhu, Maksym Andriushchenko, Jonas Geiping

机构 * ELLIS Institute Tübingen & MPI for Intelligent Systems(图宾根ELLIS研究所与智能系统马克斯·普朗克研究所) Tübingen AI Center(图宾根人工智能中心) Fraunhofer HHI(弗劳恩霍夫高精尖研究所) ETH Zurich & ETH AI Center(苏黎世联邦理工学院与苏黎世人工智能中心) University of Tübingen(图宾根大学) TU Dublin(都柏林技术大学) TU Berlin & BIFOLD(柏林技术大学与BIFOLD)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18316 2025-09-24 cs.CL cs.AI 79%

Brittleness and Promise: Knowledge Graph Based Reward Modeling for Diagnostic Reasoning

Saksham Khatwani, He Cheng, Majid Afshar, Dmitriy Dligach, Yanjun Gao

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校) University of Colorado Anschutz(科罗拉多大学安舒茨分校) University of Wisconsin - Madison(威斯康星大学麦迪逊分校) Loyola University Chicago(芝加哥洛约拉大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18181 2025-09-24 cs.AI cs.LG 79%

Synthesizing Attitudes, Predicting Actions (SAPA): Behavioral Theory-Guided LLMs for Ridesourcing Mode Choice Modeling

Mustafa Sameen, Xiaojian Zhang, Xilei Zhao

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18207 2025-09-24 q-bio.GN 78%

Securing the Language of Life: Inheritable Watermarks from DNA Language Models to Proteins

Zaixi Zhang, Ruofan Jin, Le Cong, Mengdi Wang

专题命中 评测与基准 :language model(title,abstract)

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17660 2025-09-24 cs.CV 78%

Development and validation of an AI foundation model for endoscopic diagnosis of esophagogastric junction adenocarcinoma: a cohort and deep learning study

Yikun Ma, Bo Li, Ying Chen, Zijie Yue, Shuchang Xu, Jingyao Li, Lei Ma, Liang Zhong, Duowu Zou, Leiming Xu, Yunshi Zhong, Xiaobo Li, Weiqun Ding, Minmin Zhang, Dongli He, Zhenghong Li, Ye Chen, Ye Zhao, Jialong Zhuo, Xiaofen Wu, Lisha Yi, Miaojing Shi, Huihui Sun

机构 * Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University, China. Department of Gastroenterology, Tongji Institute of Digestive Disease, Tongji Hospital Affiliated to Tongji University, Medicine of Tongji University, China. College of Electronic Information Engineering, Tongji University, China. Department of Gastroenterology Endoscopy, Huashan Hospital Affiliated to Fudan University, China. Department of Gastroenterology, Ruijin Hospital Affiliated to Shanghai Jiao Tong University School of Medicine, China. Department of Gastroenterology, Xinhua Hospital Affiliated to Shanghai Jiao Tong University School of Medicine, China. Endoscopy Center Endoscopy Research Institute, Zhongshan Hospital Affiliated to Fudan University, China. Hepatology, Key Laboratory Gastroenterology Hepatology, Renji Hospital affiliated to Shanghai Jiao Tong University School of Medicine, China. Department of Information Center, Tongji Hospital Affiliated to Tongji University, China. Department of Gastroenterology, Zhangzhou Affiliated Hospital of Fujian Medical University, China.

专题命中 评测与基准 :foundation model(title,abstract)

Comments Accepted to eClinicalMedicine, Part of The Lancet Discovery Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18167 2025-09-24 cs.CL 77%

SIRAG: Towards Stable and Interpretable RAG with A Process-Supervised Multi-Agent Framework

Junlin Wang, Zehao Wu, Shaowei Lu, Yanlan Li, Xinghao Huang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments 5 pages,2 figures, IRAC under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12543 2025-09-24 cs.CL 77%

Disambiguation in Conversational Question Answering in the Era of LLMs and Agents: A Survey

Md Mehrab Tanjim, Yeonjun In, Xiang Chen, Victor S. Bursztyn, Ryan A. Rossi, Sungchul Kim, Guang-Jie Ren, Vaishnavi Muppala, Shun Jiang, Yongsung Kim, Chanyoung Park

机构 * Adobe Research(Adobe研究部) KAIST(韩国科学技术院) Adobe Inc.(Adobe公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments 14 pages, 2 figures, Accepted at EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19209 2025-09-24 cs.IR 75%

A Knowledge Graph and a Tripartite Evaluation Framework Make Retrieval-Augmented Generation Scalable and Transparent

Olalekan K. Akindele, Bhupesh Kumar Mishra, Kenneth Y. Wertheim

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

Comments 25 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18108 2025-09-24 cs.LG cs.AI 73%

Solve it with EASE

Adam Viktorin, Tomas Kadavy, Jozef Kovac, Michal Pluhacek, Roman Senkerik

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments EASE framework landing paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17998 2025-09-24 cs.LG cs.AI 73%

Adaptive Kernel Design for Bayesian Optimization Is a Piece of CAKE with LLMs

Richard Cornelius Suwandi, Feng Yin, Juntao Wang, Renjie Li, Tsung-Hui Chang, Sergios Theodoridis

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Athens(雅典大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Accepted as Poster at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09558 2025-09-24 eess.AS cs.AI cs.LG cs.MM cs.SD 73%

WavReward: Spoken Dialogue Models With Generalist Reward Evaluators

Shengpeng Ji, Tianle Liang, Yangzhuo Li, Jialong Zuo, Minghui Fang, Jinzheng He, Yifu Chen, Zhengqing Liu, Ziyue Jiang, Xize Cheng, Siqi Zheng, Jin Xu, Junyang Lin, Zhou Zhao

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05401 2025-09-24 cs.CL cs.AI cs.CY cs.SI 73%

Post-hoc Study of Climate Microtargeting on Social Media Ads with LLMs: Thematic Insights and Fairness Evaluation

Tunazzina Islam, Dan Goldwasser

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted at Findings of 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05930 2025-09-24 cs.CL cs.CV cs.LG 73%

WebLINX: Real-World Website Navigation with Multi-Turn Dialogue

Xing Han Lù, Zdeněk Kasner, Siva Reddy

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23577 2025-09-24 cs.CL 70%

T-Detect: Tail-Aware Statistical Normalization for Robust Detection of Adversarial Machine-Generated Text

Alva West, Luodan Zhang, Liuliu Zhang, Minjun Zhu, Yixuan Weng, Yue Zhang

机构 * School of Engineering, Westlake University(西拉丘学院,西湖大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18661 2025-09-24 cs.IR cs.CL cs.HC 70%

Agentic AutoSurvey: Let LLMs Survey LLMs

Yixin Liu, Yonghui Wu, Denghui Zhang, Lichao Sun

机构 * Lehigh University(莱文大学) University of Florida(佛罗里达大学) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 评测与基准 :LLM(abstract);RLHF(abstract);分类 cs.CL

Comments 29 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15335 2025-09-24 cs.CL 70%

PolBiX: Detecting LLMs' Political Bias in Fact-Checking through X-phemisms

Charlott Jakob, David Harbecke, Patrick Parschan, Pia Wenzel Neves, Vera Schmitt

机构 * Quality & Usability Lab, Technische Universität Berlin(柏林技术大学质量与可用性实验室) German Research Center for Artificial Intelligence (DFKI), Berlin(德国人工智能研究中心(DFKI)) Department of Media and Communication, Ludwig-Maximilians-Universität München(慕尼黑路德维希-马克西米利安大学媒体与传播系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted at Findings of EMNLP 2025, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19813 2025-09-24 cs.CL 70%

T2R-bench: A Benchmark for Generating Article-Level Reports from Real World Industrial Tables

Jie Zhang, Changzai Pan, Kaiwen Wei, Sishi Xiong, Yu Zhao, Xiangyu Li, Jiaxin Peng, Xiaoyan Gu, Jian Yang, Wenhan Chang, Zhenhe Wu, Jiang Zhong, Shuangyong Song, Yongxiang Li, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所) Chongqing University(重庆大学) Beihang University(北航大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15273 2025-09-24 cs.RO 67%

Embodied Arena: A Comprehensive, Unified, and Evolving Evaluation Platform for Embodied AI

Fei Ni, Min Zhang, Pengyi Li, Yifu Yuan, Lingfeng Zhang, Yuecheng Liu, Peilong Han, Longxin Kou, Shaojin Ma, Jinbin Qiao, David Gamaliel Arcos Bravo, Yuening Wang, Xiao Hu, Zhanguang Zhang, Xianze Yao, Yutong Li, Zhao Zhang, Ying Wen, Ying-Cong Chen, Xiaodan Liang, Liang Lin, Bin He, Haitham Bou-Ammar, He Wang, Huazhe Xu, Jiankang Deng, Shan Luo, Shuqiang Jiang, Wei Pan, Yang Gao, Stefanos Zafeiriou, Jan Peters, Yuzheng Zhuang, Yingxue Zhang, Yan Zheng, Hongyao Tang, Jianye Hao

机构 * Tianjin University(天津大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Shanghai Jiao Tong University(上海交通大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Sun Yat-sen University(中山大学) PengCheng Laboratory(鹏城实验室) Tongji University(同济大学) University College London(伦敦大学学院) Peking University(北京大学) Tsinghua University(清华大学) Imperial College London(伦敦帝国学院) King’s College London(伦敦国王学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Manchester(曼彻斯特大学) Nanjing University(南京大学) TU Darmstadt(图宾根大学)

专题命中 评测与基准 :LLM(abstract);foundation model(abstract)

Comments 32 pages, 5 figures, Embodied Arena Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02495 2025-09-24 cs.LG cs.AI cs.CL 67%

Union of Experts: Adapting Hierarchical Routing to Equivalently Decomposed Transformer

Yujiao Yang, Jing Lian, Linhui Li

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏