arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32271 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32271 篇

2601.04876 2026-05-28 cs.SD 88%

ChronosAudio: A Comprehensive Long-Audio Benchmark for Evaluating Audio-Large Language Models

ChronosAudio: 用于评估音频大语言模型的综合长音频基准

Kaiwen Luo, Liang Lin, Yibo Zhang, Moayad Aloqaily, Jialiang Tao, Dexian Wang, Zhenhong Zhou, Junwei Zhang, Kun Wang, Li Sun, Qingsong Wen

机构 * Nanyang Technological University(南洋理工大学) Independent Researcher(独立研究者) United Arab Emirates University(阿联酋大学) North China Electric Power University(华北电力大学) Southwest Jiaotong University(西南交通大学) Squirrel AI Learning(Squirrel AI学习)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 提出首个针对音频大语言模型长音频理解的多任务基准ChronosAudio,包含6大任务类别和36000个测试实例,实验发现模型存在长上下文崩溃、注意力稀释等问题,现有缓解策略仅恢复50%性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09658 2026-05-26 cs.CV 88%

Measuring Epistemic Humility in Multimodal Large Language Models

测量多模态大语言模型中的认知谦逊

Bingkui Tong, Jiaer Xia, Sifeng Shang, Kaiyang Zhou

机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) Hong Kong Baptist University(香港 Baptist大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 提出HumbleBench基准,通过强制选择多项选择中引入“以上皆非”选项,评估多模态大语言模型拒绝错误选项的谦逊行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23927 2026-05-26 cs.MA 88%

TEAM-SimHRA: A Team-Based Simulation Framework for Human Reliability Analysis Using Multi-Agent Large Language Models

TEAM-SimHRA:基于团队的人因可靠性分析仿真框架——使用多智能体大语言模型

Xingyu Xiao, Jiejuan Tong, Jingang Liang, Haitao Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 提出TEAM-SimHRA框架,利用多智能体大语言模型模拟核控制室团队交互,将人因可靠性视为涌现属性,在三哩岛和切尔诺贝利事故验证中实现历史决策延迟复现和通信抑制再现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20849 2026-05-21 math.OC 88%

Large Language Models for Operations Research: A Comprehensive Survey

用于运筹学的大型语言模型:全面综述

Xianchao Xiu, Jianhao Li, Jun Fan, Wanquan Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文综述了大型语言模型在运筹学中的应用,探讨了其在模型构建、算法设计和解决方案验证中的作用,并总结了该领域的基准数据集和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19307 2026-05-20 cs.CV 88%

MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems

MetaRA: 多模态大语言模型基于视觉问答系统的元形态鲁棒性评估

Quanxing Xu, Yuhao Tian, Ling Zhou, Xian Zhong, Xiaohua Huang, Rubing Huang, Chia-Wen Lin

机构 * School of Computer Science and Engineering, Macau University of Science and Technology, Macao SAR(澳门科学技术大学计算机科学与工程学院) Hubei Key Laboratory of Transportation Internet of Things, School of Computer Science and Artificial Intelligence, Wuhan University of Technology(湖北省交通物联网重点实验室,武汉理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出MetaRA,一种基于元形态测试的框架,用于评估多模态大语言模型基于视觉问答系统的鲁棒性,通过生成受控的图像-问题输入变体,揭示模型在语言扰动、视觉线索依赖和多模态推理中的弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01608 2026-05-19 cs.CV 88%

From Pixels to Places: A Systematic Benchmark for Evaluating Image Geolocalization Ability in Large Language Models

从像素到地点:一个系统性基准,用于评估大语言模型中的图像地理定位能力

Lingyao Li, Runlong Yu, Qikai Hu, Bowei Li, Min Deng, Yang Zhou, Xiaowei Jia

机构 * University of South Florida Tampa USA University of Alabama Tuscaloosa USA University of Michigan Ann Arbor USA Texas Tech University Lubbock USA Texas A \& M University College Station USA University of Pittsburgh Pittsburgh USA University of South Florida University of Alabama University of Michigan Texas Tech University Texas A \& M University University of Pittsburgh

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出IMAGEO-Bench基准,系统评估大语言模型在图像地理定位中的准确性、距离误差、地理偏见和推理过程,揭示闭源模型在高资源区域表现优于欠代表区域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07509 2026-05-15 cs.SE 88%

MASPrism: Lightweight Failure Attribution for Multi-Agent Systems Using Prefill-Stage Signals

MASPrism:基于预填充阶段信号的轻量级多智能体系统故障归因

Yang Liu, Hongjiang Feng, Junsong Pu, Zhuangbin Chen

专题命中 评测与基准 :LLM(abstract,abstract_cn);SLM(abstract,abstract_cn);language model(abstract);small language model(abstract)

AI总结 本文提出MASPrism,通过预填充阶段信号实现多智能体系统故障归因,利用小型语言模型提取负对数似然和注意力权重,提升故障源识别效率,实验显示在Who&When和TRAIL数据集上性能优异,速度提升显著。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15616 2026-05-14 cs.CV 88%

LENS: Multi-level Evaluation of Multimodal Reasoning with Large Language Models

LENS:基于大语言模型的多级多模态推理评估

Ruilin Yao, Bo Zhang, Jirui Huang, Xinwei Long, Yifang Zhang, Tianyu Zou, Yufei Wu, Shichao Su, Yifan Xu, Wenxi Zeng, Zhaoyu Yang, Guoyou Li, Shilan Zhang, Zichan Li, Yaxiong Chen, Shengwu Xiong, Peng Xu, Jiajun Zhang, Bowen Zhou, David Clifton, Luc Van Gool

机构 * Wuhan University of Technology(武汉理工大学) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai AI Lab(上海人工智能实验室) University of Oxford(牛津大学) INSAIT, Sofia Un. St Kliment Ohridski(索菲亚大学克里门特·欧里迪斯基学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 LENS提出一个包含3.4K图像和60K+问题的多级评估基准,涵盖8个任务和12种日常场景,用于评估大语言模型在多模态推理中的表现。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11444 2026-05-14 cs.CV 88%

Leveraging Multimodal Large Language Models for All-in-One Image Restoration via a Mixture of Frequency Experts

通过混合频率专家利用多模态大语言模型实现一站式图像修复

Eunho Lee, Rei Kawakami, Youngbae Hwang

机构 * Chungbuk National University(Chungbuk国立大学) Institute of Science Tokyo(东京科学研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出一种利用多模态大语言模型指导的图像修复框架,通过混合频率专家模块提升对复合退化特征的建模能力,在多个数据集上取得优异效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12529 2026-05-14 cs.CR 88%

BackFlush: Knowledge-Free Backdoor Detection and Elimination with Watermark Preservation in Large Language Models

BackFlush:在大型语言模型中无需知识的后门检测与消除及水印保留

Jagadeesh Rachapudi, Ritali Vatsi, Pranav Singh, Praful Hambarde, Amit Shukla

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出BackFlush框架,通过旋转参数编辑技术在保留水印的同时检测并消除后门,实现近1%的攻击成功率和99%的清洁准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09904 2026-05-13 cs.CV 88%

TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models

TOC-Bench:一个用于视频大语言模型的时序物体一致性基准

Junzhe Chen, Siyuan Meng, Yuxi Chen, Man Zhao, Wenyao Gui, Xiaojie Guo

机构 * Tianjin University(天津大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 TOC-Bench旨在评估视频大语言模型的时序物体一致性,通过设计三层时序必要性过滤协议,筛选出17900个时间依赖项,构建了包含2323个高质量问答对的基准,揭示了模型在事件计数、事件排序等任务上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06969 2026-05-12 cs.CV 88%

Bringing Multimodal Large Language Models to Infrared-Visible Image Fusion Quality Assessment

将多模态大语言模型引入红外-可见图像融合质量评估

Yuchen Guo, Junli Gong, Yao Lu, Xintong Xu, Yiuming Cheung, Weifeng Su

机构 * Northwestern University(西北大学) Northeastern University(东北大学) University of Washington(华盛顿大学) Hong Kong Baptist University(香港 Baptist大学) Beijing Normal - Hong Kong Baptist University(北京师范大学-香港 Baptist大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出FuScore,利用多模态大语言模型生成连续质量评分,以更精确区分质量相近的融合图像,并结合多维子维度一致性和三重目标函数提升评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08943 2026-05-12 cs.CL cs.AI cs.LG 88%

Beyond the Singular: Revealing the Value of Multiple Generations in Benchmark Evaluation

超越单极:在基准评估中揭示多代的价值

Wenbo Zhang, Hengrui Cai, Wenyu Chen

机构 * University of California Irvine(加州大学尔湾分校) Meta Central Applied Science(Meta中央应用科学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种分层统计模型,通过整合基准特征和LLM随机性,提升基准评估准确性并减少方差,同时定义提示级难度分数并可视化提示难度与语义。

Comments 11 pages, 5 figures, accepted at the Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07709 2026-05-11 cs.SE 88%

SafeTune: Search-based Harmfulness Minimisation for Large Language Models

SafeTune: 基于搜索的大型语言模型有害性最小化

Giordano d'Aloisio, David Williams, Giusy Annunziata, Zhiwei Fei, Antinisca Di Marco, Federica Sarro

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出SafeTune方法,通过超参数调优和系统提示工程降低大型语言模型的有害性并提升响应相关性。

Comments Accepted at SSBSE 2026 Challenge Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06209 2026-05-08 cs.SE 88%

SiblingRepair: Sibling-Based Multi-Hunk Repair with Large Language Models

SiblingRepair: 基于兄弟的多补丁修复与大型语言模型

Xinyu Liu, Jiayu Ren, Yusen Wang, Qi Xin, Xiaoyuan Xie, Jifeng Xuan

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn)

AI总结 SiblingRepair利用大型语言模型进行基于兄弟的多补丁修复,通过语义相关性搜索和两种修复策略提升修复效率和准确性,优于现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08618 2026-04-28 eess.AS cs.CV cs.SD 88%

VAPO: End-to-end Slide-Enhanced Speech Recognition with Omni-modal Large Language Models

VAPO:基于多模态大语言模型的端到端幻灯片增强语音识别

Rui Hu, Delai Qiu, Yining Wang, Shengping Liu, Jitao Sang

机构 * Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence(北京交通数据挖掘与具身智能重点实验室) Unisound AI Technology Co., Ltd.(Unisound人工智能技术有限公司) State Key Laboratory of AI Safety, Beijing(人工智能安全国家重点实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 VAPO通过多目标强化学习优化多模态大语言模型,解决视觉干扰问题,提升幻灯片增强语音识别的准确率和领域专用实体识别性能。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16637 2026-04-28 cs.CL cs.AI cs.LG 88%

SSR-Zero: Simple Self-Rewarding Reinforcement Learning for Machine Translation

SSR-Zero:用于机器翻译的简单自我奖励强化学习

Wenjie Yang, Mao Zheng, Mingyang Song, Zheng Li, Sitong Wang

机构 * Tencent Hunyuan(腾讯文元) Columbia University(哥伦比亚大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SSR-Zero框架,通过自评奖励实现无参考、在线训练,优于现有MT特定LLM和通用LLM,在英中翻译任务中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06148 2026-04-27 cs.CV 88%

V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models

V-MAGE:一种用于评估多模态大语言模型视觉能力的游戏评估框架

Xiangxi Zheng, Linjie Li, Zhengyuan Yang, Ping Yu, Alex Jinpeng Wang, Rui Yan, Yuan Yao, Lijuan Wang

机构 * Nanjing University(南京大学) Microsoft Research(微软研究院) Central South University(中南大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 V-MAGE通过游戏化评估框架系统评估多模态大语言模型在动态交互环境中的视觉推理能力,揭示其在复杂场景中的性能局限,为提升模型视觉与推理能力提供改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19758 2026-04-23 cs.AI cs.CL cs.LG 88%

ThermoQA: A Three-Tier Benchmark for Evaluating Thermodynamic Reasoning in Large Language Models

ThermoQA:一个用于评估大语言模型热力学推理能力的三级基准测试

Kemal Düzkar

机构 * Olivenet Kyrenia, Cyprus(奥利文特基尔尼亚,塞浦路斯)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 ThermoQA通过293个热力学问题测试大语言模型的热力学推理能力,揭示记忆属性与推理能力的差异,提供开放源代码的评估工具。

Comments 17 pages, 8 figures, open-source dataset and code

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18596 2026-04-23 physics.soc-ph cs.GT 88%

Large language models converge on competitive rationality but diverge on cooperation across providers and generations

大语言模型在竞争理性上趋同但在合作上跨提供商和代际分化

Felipe M. Affonso

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 研究通过51906次博弈试验揭示大语言模型在竞争与协调行为上趋同,但合作行为在不同提供商和代际间显著分化,且受训练流程影响显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18272 2026-04-21 cs.CE 88%

MFMDQwen: Multilingual Financial Misinformation Detection Based on Large Language Model

MFMDQwen:基于大语言模型的多语言金融虚假信息检测

Zhiwei Liu, Yuyan Wang, Yuechen Jiang, Yupeng Cao, Tianlei Zhu, Xiaorui Guo, Zhiyang Deng, Zhiyuan Yao, Xiao-Yang Liu, Jimin Huang, Sophia Ananiadou

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn)

AI总结 本文提出MFMDQwen,首个开源多语言金融虚假信息检测模型,构建MFMD4Instruction指令数据集和MFMDBench基准数据集,验证模型在多语言金融信息检测中的优越性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17873 2026-04-21 cs.CV 88%

Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models

时空趋炎附势:基于否定的欺骗性在视频大语言模型中的表现

Ziyao Tang, Pengkun Jiao, Bin Zhu, Huiyan Qi, Jingjing Chen, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University Shanghai Key Laboratory of Multimodal Embodied AI(可信具身人工智能研究所,复旦大学上海多模态具身人工智能重点实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文研究视频大语言模型在面对否定性欺骗时的脆弱性,揭示其在时空推理中的错误修正机制,并提出GasVideo-1000基准测试集以评估模型的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14804 2026-04-21 cs.SD eess.AS 88%

Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages

面向低资源语言多任务理解的语音大语言模型构建

Mingchen Shao, Bingshen Mu, Chengyou Wang, Hai Li, Ying Yan, Zhonghua Fu, Lei Xie

机构 * McShao(麦世超)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出XLSR-Thai和U-Align方法,解决低资源语言语音大语言模型的多任务理解问题,构建首个超过1000小时的泰语spoken language理解数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17329 2026-04-21 cs.SE 88%

A Pilot Study on Detecting Software Design Patterns with Large Language Models: An Empirical Evaluation

基于大语言模型检测软件设计模式的初步研究:实证评估

Oishik Chowdhury, Bastin Tony Roy Savarimuthu, Sherlock A. Licorish

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文评估了四种大语言模型和两种集成方法在检测五种设计模式(单例、适配器、桥接、组合和装饰器)中的性能,发现NextCoder和Gemma 3在准确性上表现更优,集成方法提升了整体效率。

Comments The paper has been accepted for ENASE 2026 and will be published post proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16415 2026-04-21 cs.CY 88%

Using Large Language Models for Emotional Support of Bulgarian Users: A Survey

利用大型语言模型为保加利亚用户提供情感支持:一项调查

Melania Berbatova

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文通过调查100名保加利亚用户,探讨他们对聊天机器人提供情感支持的态度和使用情况,发现约一半用户使用ChatGPT,主要应对人际关系和工作学习压力,但存在数据安全和技术可靠性担忧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15602 2026-04-17 cs.CV 88%

TennisTV: Do Multimodal Large Language Models Understand Tennis Rallies?

TennisTV: 多模态大语言模型能否理解网球发球?

Zhongyuan Bao, Lejun Zhang

机构 * New York University(纽约大学) Tandon School of Engineering(坦顿工程学院) Shanghai, China(上海,中国) New York, USA(纽约,美国)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 TennisTV是首个全面评估网球视频理解的基准,通过模拟发球过程中的连续击球事件,评估17种大语言模型在网球视频理解中的表现,发现帧采样密度需平衡且需提升时间定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13282 2026-04-16 physics.med-ph 88%

Agentic MR sequence development: leveraging LLMs with MR skills for automatic physics-informed sequence development

代理MR序列开发:利用LLM与MR技能进行自动物理引导的序列开发

Moritz Zaiss, Amr Aly, Jonathan Endres, Tobias Dornstetter, Simon Weinmüller, Andreas Maier

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Agent4MR框架,利用LLM和物理验证报告自动生成并优化PyPulseq序列,减少交互次数,实现高效序列开发。

Comments Word count abstract/body: 223 / 4303

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12851 2026-04-15 cs.CY 88%

Can Persona-Prompted LLMs Emulate Subgroup Values? An Empirical Analysis of Generalisability and Fairness in Cultural Alignment

基于人物提示的LLM能否模拟子群体价值观?对文化契合性一般性和公平性的实证分析

Bryan Chen Zhengyu Tan, Zhengyuan Liu, Xiaoyuan Yi, Jing Yao, Xing Xie, Nancy F. Chen, Roy Ka-Wei Lee

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文探讨LLM在细粒度价值观对齐中的挑战,通过新加坡案例研究发现,即使使用GPT-4.1等先进模型,预测子群体偏好准确率仅57.4%,但通过结构化数值偏好微调可提升17.4%,但存在预存的公平性偏见。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11772 2026-04-14 cs.CR 88%

Towards Automated Pentesting with Large Language Models

向大型语言模型迈进的自动化渗透测试

Ricardo Bessa, Rui Claro, João Trindade, João Lourenço

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出RedShell框架,利用微调的LLM生成针对Windows漏洞的恶意PowerShell代码,实现高效隐私保护的渗透测试自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18073 2026-04-14 cs.CV 88%

FPBench: A Comprehensive Benchmark of Multimodal Large Language Models for Fingerprint Analysis

FPBench: 多模态大语言模型在指纹分析中的综合基准测试

Ekta Gavas, Sudipta Banerjee, Chinmay Hegde, Nasir Memon

机构 * New York University(纽约大学) University of Wyoming(怀俄明大学)

专题命中 评测与基准 :large language model(title);language model(title);foundation model(abstract);prompting(abstract)

AI总结 本文提出FPBench基准测试,评估20种多模态大语言模型在7个真实和合成数据集上的8项生物识别任务,发现微调视觉和语言编码器可提升性能7%-39%。

Comments Revised version with additional experiments and code release

详情

展开后加载摘要…

URL PDF HTML 收藏