arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2997 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2997 篇

2607.03091 2026-07-07 cs.AI cs.CL cs.CY cs.MA stat.ME 新提交 79%

Silicon Sampling via Cross-Survey Transfer

通过跨调查转移进行硅采样

Chan-Tung Ku, Chan Hsu, Pei-Cing Huang, Frank Cheng-shan Liu, I-Ling Cheng, Yihuang Kang

机构 * National Sun Yat-sen University(国立中山大学) National Chung Hsing University(中国台湾国立中兴大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究提出跨调查转移评估框架,用大语言模型根据部分问题答案预测同调查中其他不同问题答案。利用2024年台湾选举与民主化研究数据等,发现零样本大语言模型精度及不同结构可预测性层级等,明确硅采样前景与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20659 2026-07-07 cs.AI cs.LG cs.SE 新提交 79%

Skill Coverage: A Test Adequacy Metric for Agent Skills

技能覆盖率:一种用于智能体技能的测试充分性度量

Boyin Tan, Xiaowei Huang, Youcheng Sun

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Liverpool(利物浦大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出技能覆盖率度量,通过提取技能文档中的行为约束并评估智能体轨迹是否提供足够证据来测试技能,发现现有基准仅覆盖39.90%-43.98%的约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01305 2026-07-03 cs.CR cs.AI cs.LG 新提交 79%

Generative AI and Federated Learning for Intrusion Detection Systems: A Survey

生成式人工智能与联邦学习在入侵检测系统中的应用:综述

Jiefei Liu, Abu Saleh Md Tayeen, Pratyay Kumar, Qixu Gong, Wenbin Jiang, Huiping Cao, Satyajayant Misra, Jayashree Harikumar

机构 * Department of Computer Science, New Mexico State University(新墨西哥州立大学计算机科学系) University of Hartford(哈特福德大学) DEVCOM Analysis Center(DEVCOM分析中心)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了生成式AI和联邦学习在入侵检测中的应用,涵盖模型分类、任务目标及集成方法,并讨论了数据质量、对抗风险等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23884 2026-07-02 cs.CL cs.AI 新提交 79%

One Year Later...The Harms Persist, But So Do We!

一年后...伤害持续,但我们仍在!

Annika Marie Schoene, Cansu Canca, Gautham Vijay Kumar, Anson Antony

机构 * Northeastern University(东北大学) Florida International University(佛罗里达国际大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究评估六种商用大语言模型在16种DSM-5条件下的安全性,发现除自杀和自伤外,其他精神障碍(如进食障碍、物质使用障碍、重度抑郁障碍)的防护失败率高达100%,呼吁按临床条件定义伤害类别并实施防护。

Comments 20 pages, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32004 2026-07-01 cs.AI cs.LG cs.LO cs.SC 新提交 79%

PolicyGuard: From Organizational Policies to Neuro-SymbolicCompliance Review Engines

PolicyGuard: 从组织策略到神经符号合规审查引擎

Sameer Malik, Ayush Singh, Amar Prakash Azad

机构 * Fujitsu Research India Private Limited, Bengaluru, India(富士通研究印度私人有限公司,印度班加罗尔)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 提出PolicyGuard框架,将组织策略转化为可执行的神经符号审查引擎,通过分离策略形式化、局部文档解释和符号合规评估,实现显式、可维护且可系统测试的文档合规审查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31464 2026-07-01 cs.CL cs.AI 新提交 79%

Team MKC at CLPsych 2026: Capturing and Characterizing Mental Health Changes through Social Media Timeline Dynamics

Team MKC 在 CLPsych 2026:通过社交媒体时间线动态捕捉和表征心理健康变化

Kyomin Hwang, Hyeonjin Kim, Hyunho Lee, Nojun Kwak

机构 * Seoul National University(首尔大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于大语言模型的流水线,通过分析用户按时间排序的帖子,实现帖子级评估和用户级时间建模,以支持心理健康的早期检测和持续监测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31435 2026-07-01 cs.AI cs.CL 新提交 79%

CDR-Bench: Evaluating Faithful Execution of Compositional, Order-Sensitive Data Refinement Recipes

CDR-Bench:评估组合式、顺序敏感数据精炼配方的忠实执行

Yuchen Huang, Xiang Li, Zhenqing Ling, Sijia Li, Qianli Shen, Daoyuan Chen, Yi R. Fung, Yaliang Li

机构 * HKUST(香港科技大学) NUS(新加坡国立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出CDR-Bench基准,包含3462个高质量任务,评估LLM在组合式和顺序敏感设置下直接执行数据精炼配方的能力,发现当前LLM缺乏程序忠实性。

Comments 29 pages, 20 figures. Corresponding authors: Daoyuan Chen and Yi R. Fung

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22166 2026-06-23 cs.DL cs.AI cs.LG 新提交 79%

Rebuttals Move Peer-Review Scores, but Initial-Review Structure Bounds the Movement

反驳会改变同行评审分数,但初始评审结构限制了变化幅度

Mathieu Louis, Tibo Vanleke, Vincent Ginis, Andres Algaba

机构 * Data Analytics Lab, Vrije Universiteit Brussel(自由大学布鲁塞尔数据分析实验室) imec-SMIT, Vrije Universiteit Brussel(imec-SMIT,自由大学布鲁塞尔) School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI、cs.LG

AI总结 利用ICLR 2024-2025的73,000条评审轨迹,结合LLM分析,发现反驳能改变分数,但初始评审结构已预测大部分变化,且可测量的交换信号多为反驳失败模式。

Comments 26 pages, 7 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09178 2026-06-23 cs.CL cs.AI 新提交 79%

Culturally-Adapted Red-Teaming Across East and Southeast Asian Contexts: A Methodological and Comparative Analysis

跨东亚和东南亚语境的文化适应红队测试:方法论与比较分析

Hyeji Choi, Yongtaek Lim, Minwoo Kim

机构 * University of California, Berkeley(加州大学伯克利分校) Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型的多语言安全评估,通过构建直接翻译与文化适应数据集,发现文化适应提示的攻击成功率平均提升9.3个百分点,直接翻译低估风险,且文化深度评分显著低于文化适应版本,表明适应文化语境对有效评估至关重要。

Comments Accepted to ICML 2026 Workshop on Culture X AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19595 2026-06-19 cs.LG cs.AI 新提交 79%

IHBench: Evaluating Post-Interruption Recovery in Voice Agents with Structured Workflows

IHBench:评估语音代理在结构化工作流中的中断后恢复能力

Ahmad Salimi, Wentao Ma, Yuzhi Tang, Dongming Shen, Mu Li, Alex Smola

机构 * Boson AI

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出IHBench基准,评估语音代理在结构化工作流中处理中断后的恢复能力,涵盖任务完成和恢复质量两个维度,实验表明闭源模型比开源模型更鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18782 2026-06-18 cs.CL cs.AI 新提交 79%

RedactionBench

RedactionBench:基于上下文完整性的隐私保护基准测试

Sean Brynjólfsson, Shashvat Jayakrishnan, Esha Sali, Diptanshu Purwar, Madhav Aggarwal

机构 * A10 Networks, Inc.(A10网络公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);small language model(abstract);分类 cs.CL、cs.AI

AI总结 RedactionBench通过200个跨11个领域的文档,评估红actions的上下文隐私问题,提出R-Score指标,揭示红actions的主观性,推动隐私保护系统的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18193 2026-06-17 cs.CR cs.AI cs.CL 新提交 79%

A Red-Team Study of Anthropic Fable 5 & Opus 4.8 Models

Anthropic Fable 5 与 Opus 4.8 模型的红队研究

Nicola Franco

机构 * AI4I

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过 HackAgent 框架对两个前沿大语言模型进行自动化越狱攻击,发现尽管模型抵抗大部分攻击,但自适应迭代攻击仍能成功,且残差表面比总体框架更大。

Comments White paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13802 2026-06-15 cs.SE cs.AI cs.HC cs.LG 新提交 79%

A Benchmark and Framework for Evaluating Next Action Predictions in Spreadsheets

电子表格中下一步动作预测的基准测试与框架

Tejas Agrawal, Vu Le, Sumit Gulwani, Gust Verbruggen

机构 * University of Waterloo(多伦多大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);SLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 针对电子表格缺乏自动补全功能的问题,提出一个基准测试,通过人工整理动作序列和在线评估方法,比较多种预测模型,分析动作保存、误报、效率等特性。

Comments Accepted at ICML 2026. Code and benchmark: https://github.com/Tej-55/NAPE

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12754 2026-06-12 cs.CL cs.AI 新提交 79%

LLMs Can Better Capture Human Judgments--With the Right Prompts

LLMs 能更好地捕捉人类判断——使用合适的提示

Danica Dillion, Chen Cecilia Liu, Baihui Wang, Daniele Barolo, Tanmay Rajore, Niket Tandon, Pranathi Ravikumar, Kurt Gray

机构 * Complexity Science Hub, Vienna(维也纳复杂科学中心) The Ohio State University(俄亥俄州立大学) University of Cambridge(剑桥大学) University of Chicago(芝加哥大学) Microsoft Research(微软研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 通过简单提示策略,LLMs 能恢复人类反应的完整分布,并减少对措辞变化的敏感性,提升 AI-人类对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24691 2026-08-26 cs.AI cs.CL cs.LG 新提交 78%

Confident at the moment of action: belief miscalibration in LLM play under hidden information

行动时刻的自信:隐藏信息下大语言模型博弈中的信念校准偏差

Bhushan Kashinath Joshi

专题命中 评测与基准 :LLM(title);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究在隐藏信息国际象棋变体中发现,大语言模型的高置信度行动存在严重信念校准偏差,传统评估指标与信念质量脱节,仅结果评估无法检测此问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24513 2026-08-26 cond-mat.mtrl-sci 新提交 78%

Structure-Agnostic Prediction of the Electronic Density of States with a Chemical Language Model

基于化学语言模型的电子态密度的结构无关预测

Ivan D. Rubtsov, Ivan V. Dudakov, Vadim V. Korolev

专题命中 评测与基准 :language model(title,abstract)

AI总结 该研究提出化学语言模型DOSSIER,无需晶体结构即可直接由元素组成预测电子态密度,在基准测试及合金筛选中表现出良好性能,为未合成化合物的DOS预测提供了结构无关的新方法。

Comments 8 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22659 2026-08-25 stat.ME stat.AP 新提交 78%

Statistical Methods for Multiple Language Model Comparison on a Shared Evaluation

用于共享评估下多语言模型比较的统计方法

Juan Francisco Mandujano Reyes

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出适用于共享评估的多语言模型比较统计方法,构建含模型固定效应、问题随机效应的随机效应模型,经模拟与真实数据验证,为多模型评估结果报告提供建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21916 2026-08-25 cs.CE 新提交 78%

GenomeHarness: Harnessing Al Agents for Reliable Adaptation of Genome Language Models

GenomeHarness:利用AI智能体实现基因组语言模型的可靠适配

Weicai Long, Yusen Hou, Houcheng Su, Junning Feng, Yanlin Zhang

专题命中 评测与基准 :language model(title,abstract)

AI总结 GenomeHarness是一种智能体式工具,通过受控搜索微调方案适配基因组语言模型,在52个模型-任务设置中多数提升了测试MCC,使下游适配更可靠可审计。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21837 2026-08-25 cs.CV cs.MM 新提交 78%

Towards Bitstream-corrupted Harsh Visual Understanding: Through Bitstream Language Modeling as Robust Semantic Priors

面向比特流损坏的恶劣视觉理解:以比特流语言建模作为鲁棒语义先验

Chaoran Huang, Fangcheng Li, Tianyi Liu, Wenyang Liu, Kejun Wu

专题命中 评测与基准 :language model(title,abstract)

AI总结 针对比特流损坏的恶劣视觉理解问题,提出BLMSP框架,构建CHP数据集,通过VBBM提取比特流语义先验注入视觉模型,显著提升视频恢复、字幕及姿态估计性能。

Comments 9 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21180 2026-08-24 eess.IV cs.CV 新提交 78%

Toward Vision Language Model-based Assessment of Clinical Quality and Usability of LGE-MR Images for Cardiac Ablation Planning

面向基于视觉语言模型的LGE-MR图像临床质量与可用性评估以用于心脏消融规划

Bipasha Kundu, Abhishek Chaturvedi, Axel W. E. Wismueller, Richard Simon, Cristian A. Linte

专题命中 评测与基准 :language model(title,abstract)

AI总结 本研究提出两阶段VLM框架用于左心房LGE-MRI的临床导向图像质量评估,在60个图像切片-文本对数据集上,InternVL2的标准级准确率最高,DeepSeek实现完美临床可用性一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20167 2026-08-21 cs.SE 新提交 78%

BreakGuard: Towards Detecting Dependency Breaking Changes with LLM-Generated Tests

BreakGuard:基于大语言模型生成的测试检测依赖项破坏性变更

Rachna Raj, Benoit Baudry, Diego Elias Costa

专题命中 评测与基准 :LLM(title,abstract)

AI总结 BreakGuard是一种基于大语言模型生成测试的方法,可静态提取客户端焦点方法生成测试,在89个真实破坏性变更上检测到30.3%的变更,对崩溃型破坏性变更检测可靠性更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18595 2026-08-20 cs.SE 新提交 78%

OdinEval: A Reproducible Benchmark for LLM-Based Program Repair in the Odin Programming Language

OdinEval:用于基于大语言模型的Odin编程语言程序修复的可复现基准测试

Bang Xie, Hao Liu, Zhiyuan Peng, Xin Yin, Senjian Zhang, Yuan Luo, Chenhao Ying, Haiming Jin, Wei Chen, Shaocong Long, Zhenyu Shi

专题命中 评测与基准 :LLM(title);language model(abstract)

AI总结 针对Odin语言程序修复的空白,本文构建可复现基准OdinEval,评估6个语言模型,Kimi-K3解决率66.7%、Qwen3.8-Max复现率96.4%,发布配套多类资源。

Comments 8 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18588 2026-08-20 cs.SE 新提交 78%

AppEval: A Unified Benchmark for LLM-Based Mobile Application Repair in ArkTS, Swift, and Kotlin

AppEval:面向基于大语言模型的ArkTS、Swift及Kotlin移动应用修复的统一基准

Bang Xie, Hao Liu, Zhenyu Shi, Yonghao Zhang, Senjian Zhang, Zhiyuan Peng, Xin Yin, Chenhao Ying, Yuan Luo, Wei Chen, Haiming Jin, Shaocong Long, Xu Liu, Zhe Peng

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本研究提出AppEval基准框架,评估基于大语言模型的移动应用修复智能体在ArkTS、Swift、Kotlin平台的表现,发现其性能因智能体而异,且运行时感知的接受标准对有意义的比较至关重要。

Comments 9 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18184 2026-08-20 cs.CV 新提交 78%

Human-Centric Intelligence in the Era of Foundation Models: A Survey

基础模型时代的以人为中心的智能:一项综述

Yang Chen, Tianqi Wang, Xiaorui Jiang, Yilei Man, Yihua Shao, Mengyuan Liu, Zhi Chen, Xiaofeng Cao, Qibin Zhao, Chi Harold Liu, Albert Y. Zomaya, Nicu Sebe, Jingren Zhou, Dacheng Tao, Song Guo, Jingcai Guo

机构 * The Hong Kong Polytechnic University(香港理工大学) Peking University(北京大学) University of Southern Queensland(南昆士兰大学) Tongji University(同济大学) RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心) Beijing Institute of Technology(北京理工大学) The University of Sydney(悉尼大学) University of Trento(特伦托大学) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文针对基础模型时代以人为中心的智能进展碎片化问题,提出全谱人类上下文分类法,梳理其方法基础、相关方法与资源,探讨挑战方向,为该领域推进提供参考。

Comments GitHub Repo: https://github.com/cseeyangchen/Human-Centric-AI; Project Page: https://cseeyangchen.github.io/Human-Centric-AI/homepage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16263 2026-08-18 cs.CV 新提交 78%

Seeing Before Answering: Training-Free Visual Layer Profiling for Vision-Language Models

先见后答:面向视觉语言模型的无训练视觉层分析

Ruchen Liu, Yi Yang, Yiming Xu, Michael Ying Yang, Monika Sester, Bodo Rosenhahn

机构 * Leibniz Universität Hannover(汉诺威莱布尼茨大学) University of Bath(巴斯大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 该研究提出无需训练的视觉数据集熵(VDE)方法,可预测视觉语言模型的最优视觉层,缩小搜索范围,相比GW距离更具实用性。

Comments ECCVW'26 eXCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16081 2026-08-18 cs.CV 新提交 78%

SafeGesture: Evaluating Fine-Grained Hand Gesture Understanding in Vision-Language Models through Scenario-Conditioned Safety Interpretation

SafeGesture:通过场景条件安全解释评估视觉语言模型的细粒度手势理解能力

Taegang Kim, Saleh Afroogh, Junfeng Jiao

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Urban Information Lab, The University of Texas at Austin(德克萨斯大学奥斯汀分校城市信息实验室)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出SafeGesture基准,评估5款视觉语言模型的细粒度手势安全理解能力,发现模型存在感知与推理脱节,瓶颈为场景条件安全推理而非手势识别。

Comments 14 pages, 22 tables, 2 figures. Code and benchmark resources available at https://github.com/The-Responsible-AI-Initiative/SafeGesture

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15539 2026-08-18 cs.CV 新提交 78%

CrossView: Can Vision-Language Models Reason Across Cameras?

CrossView:视觉-语言模型能否跨相机进行推理?

Sahil Shah, S P Sharan, Harsh Goel, Manvik Pasula, Adithya Hebbalae, Minkyu Choi, Sandeep P. Chinchali

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出CrossView多相机视频问答基准,评估发现GPT-5.2等模型跨相机推理准确率低,开源模型表现更差,该基准可用于测试模型联合处理多视角的能力。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15456 2026-08-18 cs.CV 新提交 78%

AlignJEPA: Predictive Vision-Language Alignment for Remote Sensing Foundation Models

AlignJEPA:面向遥感基础模型的预测性视觉-语言对齐

Md Aminur Hossain, Omkumar Vaghasiya, Rajeev Ranjan Dwivedi, Vinod Kurmi, Biplab Banerjee

机构 * Space Applications Centre, ISRO(印度空间研究组织空间应用中心) Indian Institute of Science Education and Research (IISER) Bhopal(印度科学教育与研究学院(博帕尔)) Indian Institute of Technology Bombay(印度理工学院孟买分校)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 该研究针对遥感基础模型与自然语言对齐不足的问题,提出受JEPA启发的AlignJEPA框架,采用轻量级预测对齐网络,结合语义预测与双向对比检索,实现了参数高效的视觉-语言对齐。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14260 2026-08-17 eess.IV cs.MM 新提交 78%

Personalized Digital Semantic Communication for Image Transmission with Vision-Language Models

基于视觉语言模型的图像传输个性化数字语义通信

Nan Li, Li Zhou, Haijun Wang, Jun Xiong, Haitao Zhao, Jibo Wei

专题命中 评测与基准 :language model(title,abstract)

AI总结 针对现有语义通信方案忽略接收端依赖语义的问题,提出整合VLM与LDM的PDSC框架,构建容量受限的个性化语义率失真问题,实验证实其在带宽受限场景下的源语义一致性与个性化表现优于CDDM、MoS等基线。

Comments Accepted by IEEE GLOBECOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14262 2026-08-17 cs.CV 新提交 78%

On the Robustness of Temporal Vision-Language Models for Surgical Endoscopy Videos

手术内窥镜视频的时间视觉语言模型的鲁棒性研究

Darakshan Rashid, Raza Imam, Ufaq Khan, Muhammad Bilal, Shazad Ashraf, Dwarikanath Mahapatra, Mohammad Yaqub, Muhammad Haris Khan, Imran Razzak, Brejesh Lall, Lena Maier-Hein, Yutong Xie

机构 * Indian Institute of Technology Delhi(印度理工学院德里分校) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Birmingham City University(伯明翰城市大学) University Hospitals Birmingham(伯明翰大学医院) Khalifa University(哈利法大学) German Cancer Research Center (DKFZ)(德国癌症研究中心)

专题命中 评测与基准 :language model(title,abstract)

AI总结 该研究针对手术内窥镜视频的时间视觉语言模型,构建Endo-C6基准测试其鲁棒性,提出RobustEndoCLIP,可提升模型在内窥镜损坏下的性能与鲁棒性。

Comments Accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏