arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-17 至 2025-11-17 共收录 46 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 46 篇

2511.11438 2025-11-17 cs.CV 91%

VP-Bench: A Comprehensive Benchmark for Visual Prompting in Multimodal Large Language Models

Mingjie Xu, Jinpeng Chen, Yuzhi Zhao, Jason Chun Lok Li, Yue Qiu, Zekang Du, Mengyang Wu, Pingping Zhang, Kun Li, Hongzheng Yang, Wenao Ma, Jiaheng Wei, Qinbin Li, Kangcheng Liu, Wenqiang Lei

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract)

Comments This is the extended version of the paper accepted at AAAI 2026, which includes all technical appendices and additional experimental details

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10661 2025-11-17 cs.CL cs.LG stat.AP stat.ML 90%

Bayesian Evaluation of Large Language Model Behavior

Rachel Longjohn, Shang Wu, Saatvik Kher, Catarina Belém, Padhraic Smyth

机构 * Department of Statistics, University of California, Irvine(统计系,加州大学伊文斯分校) Department of Computer Science, University of California, Irvine(计算机科学系,加州大学伊文斯分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.LG

Comments Accepted to NeurIPS 2025 Workshop on Evaluating the Evolving LLM Lifecycle: Benchmarks, Emergent Abilities, and Scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10881 2025-11-17 cs.CL cs.AI 90%

A Multifaceted Analysis of Negative Bias in Large Language Models through the Lens of Parametric Knowledge

Jongyoon Song, Sangwon Yu, Sungroh Yoon

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

Comments Accepted to IEEE Transactions on Audio, Speech and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.08151 2025-11-17 cs.CL 89%

Benchmarking Retrieval-Augmented Large Language Models in Biomedical NLP: Application, Robustness, and Self-Awareness

Mingchen Li, Zaifu Zhan, Han Yang, Yongkang Xiao, Jiatan Huang, Rui Zhang

机构 * Division of Computational Health Sciences, Department of Surgery University of Minnesota(大学医学计算科学系,外科系) Institute for Health Informatics University of Minnesota(健康信息学研究所,明尼苏达大学) Department of Electrical and Computer Engineering University of Minnesota(电气与计算机工程系,明尼苏达大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00290 2025-11-17 cs.CL 89%

Wage Sentiment Indices Derived from Survey Comments via Large Language Models

Taihei Sone

机构 * College of Engineering(工程学院) University of Colorado Boulder(科罗拉多大学波德穆尔分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted to IEEE Big Data 2025. 10 pages, 2 tables, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11410 2025-11-17 cs.CV 89%

Q-Doc: Benchmarking Document Image Quality Assessment Capabilities in Multi-modal Large Language Models

Jiaxi Huang, Dongxu Wu, Hanwei Zhu, Lingyu Zhu, Jun Xing, Xu Wang, Baoliang Chen

机构 * South China Normal University(华南师范大学) Nanyang Technological University(南洋理工大学) City University of Hong Kong(香港城市大学) Shenzhen Academy of Inspection and Quarantine(深圳检验检疫局) Shenzhen University(深圳大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10912 2025-11-17 cs.CL cs.AI 88%

Evaluating Large Language Models on Rare Disease Diagnosis: A Case Study using House M.D

Arsh Gupta, Ajay Narayanan Sridhar, Bonam Mingole, Amulya Yadav

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11299 2025-11-17 cs.CV cs.AI 88%

AUVIC: Adversarial Unlearning of Visual Concepts for Multi-modal Large Language Models

Haokun Chen, Jianing Li, Yao Zhang, Jinhe Bi, Yan Xia, Jindong Gu, Volker Tresp

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments AAAI 2026. Code: https://github.com/HaokunChen245/AUVIC

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16926 2025-11-17 cs.CV cs.CL 88%

Res-Bench: Benchmarking the Robustness of Multimodal Large Language Models to Dynamic Resolution Input

Chenxu Li, Zhicai Wang, Yuan Sheng, Xingyu Zhu, Yanbin Hao, Xiang Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00060 2025-11-17 cs.CV cs.AI 88%

MOSABench: Multi-Object Sentiment Analysis Benchmark for Evaluating Multimodal Large Language Models Understanding of Complex Image

Shezheng Song, Chengxiang He, Shan Zhao, Chengyu Wang, Qian Wan, Tianwei Yan, Meng Wang

机构 * College of Computer, National University of Defense Technology(国防科技大学计算机学院) School of Computer and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院) CCNU(中国地质大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11257 2025-11-17 cs.AI cs.CE cs.LG 88%

AIonopedia: an LLM agent orchestrating multimodal learning for ionic liquid discovery

Yuqi Yin, Yibo Fu, Siyuan Wang, Peng Sun, Hongyu Wang, Xiaohui Wang, Lei Zheng, Zhiyong Li, Zhirong Liu, Jianji Wang, Zhaoxi Sun

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11407 2025-11-17 cs.CV 88%

MicroVQA++: High-Quality Microscopy Reasoning Dataset with Weakly Supervised Graphs for Multimodal Large Language Model

Manyu Li, Ruian He, Chenxi Ma, Weimin Tan, Bo Yan

机构 * Fudan University(复旦大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11252 2025-11-17 cs.AI 87%

UAVBench: An Open Benchmark Dataset for Autonomous and Agentic AI UAV Systems via LLM-Generated Flight Scenarios

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(计算机与网络工程系,信息科技学院,阿联酋大学) Khalifa University of Science and Technology(科技大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 18 pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10667 2025-11-17 cs.CL cs.AI cs.LG 87%

Evaluating LLM Understanding via Structured Tabular Decision Simulations

Sichao Li, Xinyue Xu, Xiaomeng Li

机构 * City University of Macau(澳门城市大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10860 2025-11-17 cs.DC cs.AI cs.SE 85%

HPCAgentTester: A Multi-Agent LLM Approach for Enhanced HPC Unit Test Generation

Rabimba Karanjai, Lei Xu, Weidong Shi

机构 * University Of Houston(德克萨斯大学休斯顿分校) Kent State University(肯特州立大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Accepted in AIWare 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10949 2025-11-17 cs.MA cs.AI 83%

Exposing Weak Links in Multi-Agent Systems under Adversarial Prompting

Nirmit Arora, Sathvik Joel, Ishan Kavathekar, Palak, Rohan Gandhi, Yash Pandya, Tanuja Ganu, Aditya Kanade, Akshay Nambi

机构 * Microsoft Research(微软研究院)

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract);分类 cs.AI

Comments 10 pages, 3 figures. Code available at https://github.com/microsoft/SafeAgents

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00765 2025-11-17 cs.CL 83%

Decomposing and Revising What Language Models Generate

Zhichao Yan, Jiaoyan Chen, Jiapu Wang, Xiaoli Li, Ru Li, Jeff Z. Pan

机构 * School of Computer and Information Technology, Shanxi University, Taiyuan, China(计算机与信息科技学院,山西大学,太原,中国) Department of Computer Science, University of Manchester, Manchester, England(计算机科学系,曼彻斯特大学,曼彻斯特,英国) Beijing University of Technology, Beijing, China(北京理工大学,北京,中国) Singapore University of Technology and Design(新加坡科技与设计大学) ILCC, School of Informatics, University of Edinburgh, Edinburgh, England(ILCC,信息学院,爱丁堡大学,爱丁堡,英国)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08954 2025-11-17 cs.CY cs.HC 80%

Should you use LLMs to simulate opinions? Quality checks for early-stage deliberation

Terrence Neumann, Maria De-Arteaga, Sina Fazelpour

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Accepted to AAAI AI for Social Impact (AISI), 2026. This version includes Appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10689 2025-11-17 cs.CL cs.AI 80%

Equilibrium Dynamics and Mitigation of Gender Bias in Synthetically Generated Data

Ashish Kattamuri, Arpita Vats, Harshwardhan Fartale, Rahul Raja, Akshata Kishore Moharir, Ishita Prasad

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

Comments Accepted to AAAI Workshop on Shaping Responsible Synthetic Data in the Era of Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09956 2025-11-17 cs.LG cs.AI cs.CV cs.ET 79%

DeepSeek-Inspired Exploration of RL-based LLMs and Synergy with Wireless Networks: A Survey

Yu Qiao, Phuong-Nam Tran, Ji Su Yoon, Loc X. Nguyen, Eui-Nam Huh, Dusit Niyato, Choong Seon Hong

机构 * Kyung Hee University(韩国庆熙大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 45 pages, 12 figures

Journal ref ACM Computing Surveys, Nov. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10651 2025-11-17 cs.CL cs.AI 79%

Data Analysis and Performance Evaluation of Simulation Deduction Based on LLMs

Shansi Zhang, Min Li

机构 * Artificial Intelligence Institute(人工智能研究所) China Electronics Technology Group Corporation(中国电子科技集团有限公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10865 2025-11-17 cs.SE 78%

Towards a Human-in-the-Loop Framework for Reliable Patch Evaluation Using an LLM-as-a-Judge

Sherry Shi, Renyao Wei, Michele Tufano, José Cambronero, Runxiang Cheng, Franjo Ivančić, Pat Rondon

专题命中 评测与基准 :LLM(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25434 2025-11-17 cs.CL 77%

A Critical Study of Automatic Evaluation in Sign Language Translation

Shakib Yazdani, Yasser Hamidullah, Cristina España-Bonet, Eleftherios Avramidis, Josef van Genabith

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Submitted to the LREC 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11019 2025-11-17 cs.CR cs.SE 75%

PATCHEVAL: A New Benchmark for Evaluating LLMs on Patching Real-World Vulnerabilities

Zichao Wei, Jun Zeng, Ming Wen, Zeliang Yu, Kai Cheng, Yiding Zhu, Jingyi Guo, Shiqi Zhou, Le Yin, Xiaodong Su, Zhechao Ma

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11169 2025-11-17 cs.CV cs.AI cs.LG 73%

Refine and Align: Confidence Calibration through Multi-Agent Interaction in VQA

Ayush Pandey, Jai Bardhan, Ishita Jain, Ramya S Hebbalaguppe, Rohan Raju Dhanakshirur, Lovekesh Vig

机构 * TCS Research(塔塔咨询研究)

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

Comments 17 pages, 6 figures, 5 tables. Accepted to Special Track on AI Alignment, AAAI 2026. Project Page- https://refine-align.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10903 2025-11-17 cs.CL cs.AI 73%

Automated Analysis of Learning Outcomes and Exam Questions Based on Bloom's Taxonomy

Ramya Kumar, Dhruv Gulwani, Sonit Singh

机构 * School of Computer Science and Engineering, University of New South Wales, Sydney, Australia(计算机科学与工程学院,新南威尔士大学,悉尼,澳大利亚)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 7 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09133 2025-11-17 cs.CL cs.AI 73%

Assessing the Capabilities of LLMs in Humor:A Multi-dimensional Analysis of Oogiri Generation and Evaluation

Ritsu Sakabe, Hwichan Kim, Tosho Hirasawa, Mamoru Komachi

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11468 2025-11-17 cs.CV cs.AI 70%

Benchmarking Visual LLMs Resilience to Unanswerable Questions on Visually Rich Documents

Davide Napolitano, Luca Cagliero, Fabrizio Battiloro

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21244 2025-11-17 cs.AI 70%

VoiceAgentEval: A Dual-Dimensional Benchmark for Expert-Level Intelligent Voice-Agent Evaluation of Xbench's Professional-Aligned Series

Pengyu Xu, Shijia Li, Ao Sun, Feng Zhang, Yahan Li, Bo Wu, Zhanyu Ma, Jiguo Li, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Rui Wang, Yang Liu, Xiaobo Hu, Fan Yang, Jia Zheng, Guanghua Yao

机构 * Meituan(美团) Xbench Agora Beijing Jiaotong University(北京交通大学) BUPT(北京邮电大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Jilin University(吉林大学) Peking University(北京大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08068 2025-11-17 q-fin.PM cs.AI q-fin.CP 70%

An Adaptive Multi Agent Bitcoin Trading System

Aadi Singhi

机构 * UCL Computer Science(伦敦大学学院计算机科学系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

Comments 18 pages, 6 figures , 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏