arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-24 至 2026-08-24 共收录 310 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 92 篇

2608.20344 2026-08-24 cs.CL cs.CY 新提交 87%

Beyond Raw Transcripts: Structured Persona Extraction for LLM-Based Digital Twins

超越原始文本记录:面向基于大语言模型的数字孪生的结构化角色提取

Iris Ye, Tianze Deng, Ozan Candogan

机构 * University of Chicago(芝加哥大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 本研究针对基于LLM的数字孪生,提出结构化角色提取方法,发现信息结构是性能关键,固定结构难通用,自动结构发现流水线可恢复性能并提升准确率。

Comments Preprint. Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21095 2026-08-24 cs.SE cs.AI cs.CL cs.CR cs.IR 新提交 87%

Trustworthy RAG: An Evaluation Agent for Detecting Misinformation and Knowledge Poisoning in Generative AI Systems

可信检索增强生成:用于检测生成式人工智能系统中错误信息和知识投毒的评估智能体

Balkrishna Giri, Md Toufique Hasan, Jussi Rasku, Muhammad Waseem, Pekka Abrahamsson

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究针对RAG系统的安全-可靠性鸿沟,提出结合NLI验证、五信号投毒检测器及可信指数的评估智能体,在TruthfulQA等数据集上实现高检测性能,可阻止RAG系统的不安全指令注入。

Comments 7 pages, 1 figure. Accepted for publication in the Main Research Track of the Twenty-First International Conference on Software Engineering Advances (ICSEA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21069 2026-08-24 cs.SE 新提交 87%

Spike-Killer: Evidence-Gated LLM Assistance for Safe Performance Diagnosis on a Real Windows Workstation

Spike-Killer:面向真实Windows工作站安全性能诊断的证据门控大语言模型辅助方案

Baocheng Zeng, Jinhao Yang

专题命中 评测与基准 :LLM(title,summary_cn)

AI总结 该研究提出Spike-Killer,一种人在环的证据门控工作流,用于安全诊断Windows工作站的帧时间问题,以CS2为目标应用验证了其可审计性,为LLM辅助智能体提供了可信操作模式。

Comments 6 pages. Experience report; no causal CS2 frame-time improvement or autonomous-safety claim is made

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20658 2026-08-24 cs.CR cs.ET 新提交 87%

The Claws in Plain Sight: Unauthorized Context Disclosure through LLM Agent Tool Calls

显而易见的爪痕:通过大语言模型智能体工具调用实现未授权的上下文信息泄露

Ben Dong, Zhonghao Guo, Tianyi Lu, Qian Wang

专题命中 评测与基准 :LLM(title,summary_cn)

AI总结 该研究提出Claw in Plain Sight攻击方法,通过构造任务相关内容框架诱导LLM智能体泄露上下文信息,实验显示其在多种模型上的会话级泄露率达20.8%-75.0%,提示需在工具参数执行前进行目的与目的地感知检查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20960 2026-08-24 cs.AI 新提交 86%

Can Scientific Claims Be Removed from Large Language Models? A Systematic Evaluation of Claim-Level Unlearning

能否从大型语言模型中移除科学主张?主张级遗忘的系统评估

Snigdha Paul, Manasi Patwardhan, Arman Cohan

机构 * TCS Research(塔塔咨询服务研究部) Yale University(耶鲁大学)

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.AI

AI总结 本文针对大型语言模型中过时科学主张的传播风险,提出科学主张遗忘任务并构建基准SciUnlearn,发现现有遗忘方法无法有效消除主张级知识,需专门的结构化知识移除方法。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20688 2026-08-24 cs.AI physics.optics 新提交 86%

VortexChat: An agentic framework for autonomous multi-objective integrated photonic design

VortexChat:面向自主多目标集成光子设计的智能体框架

Faqian Chong, Yulun Wu, Shilong Li, Andrew Forbes, Hongsheng Chen, Song Han

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 VortexChat是结合LLM决策智能体与电磁仿真的自主设计框架,可从自然语言规格端到端设计集成光子器件,在Vortex100基准测试中无需人工介入即可生成达标器件,成功设计制备出高性能太赫兹涡旋光束复用器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20896 2026-08-24 cs.SE cs.HC 新提交 86%

Beyond the Traceback: Using LLMs for Adaptive Explanations of Programming Errors

超越回溯:利用大语言模型(LLMs)实现编程错误的自适应解释

Alexandru-Radu Moraru, Shreyan Biswas, Ujwal Gadiraju

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究通过103人众包实验,探究LLM生成的两类编程错误解释对调试的影响,发现LLM提升主观评价但未显著改善客观调试性能,提出自适应AI反馈系统需转向动态调整。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20822 2026-08-24 cs.CY 新提交 86%

Interaction Effects Between Learner Characteristics and Dialogue Format in TTS Dialogue-Based Lessons

基于TTS对话课程的学习者特征与对话形式间的交互效应

Fumie Watanabe, Tota Suko, Takashi Ishida, Yuko Kuma, Manabu Kobayashi, Shigeichi Hirasawa, Gendo Kumoi

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本研究以222名高一学生为对象,用LLM与TTS生成三类对话课程,发现学习者特征与对话形式对ARCS动机有显著交互效应,提示需结合学习者特征选对话形式,结果为个性化学习设计提供初步证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20853 2026-08-24 cs.AI 新提交 84%

MGAL: A Multilingual Granularity-Aware Long-Context Benchmark

MGAL:一个多语言粒度感知的长基准测试集

Chunhan Li, Chenglin Xu, Zongyang Zhang, Jiale Liu, Zhuoxi Rao, Xudong Jia, Junxiu He, Menglin Yang, Wenjuan Gong, Zhengzhe Liu, Chengwei Qin

机构 * China University of Petroleum (East China)(中国石油大学(华东)) Northeastern University at Qinhuangdao(东北大学秦皇岛分校) Lingnan University, Hong Kong(香港岭南大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MGAL是首个多语言粒度位置感知长基准,以联合国6种官方语言报告构建,含4种粒度及位置分层,实验发现LLM粗粒度任务表现差、闭源模型低资源语言占优,还识别出语义拥挤等新挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20844 2026-08-24 cs.AI 新提交 84%

TRACE: Agentic Catalog Enrichment with Multi-source Evidence Grounding

TRACE:基于多源证据锚定的智能体式商品目录丰富

Rohan Kumar, Steven Xu, Kyle MacDonald, Matthew Long, Bernice Chow, Mac VanRenterghem, Sudeep Das

机构 * DoorDash(多闸道科技(DoorDash))

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对电商商品目录属性稀疏问题,提出基于LLM的TRACE框架,经离线评估、生产部署及在线实验验证,可高效提升目录属性丰富的准确率、覆盖率及结账转化率。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20388 2026-08-24 cs.CL cs.DC 新提交 84%

Intent Engine: Natural-Language Intent Translation for Intent-Driven Orchestration in the Compute Continuum

意图引擎:面向计算连续体中意图驱动编排的自然语言意图翻译

Koushikur Islam, Rodrigo N. Calheiros

机构 * Western Sydney University(西悉尼大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出Intent Engine架构,可将自然语言意图转换为计算连续体服务部署的经验证SLO制品,在多款大语言模型上均优于基线,能显著减少幻觉与部署失败率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18423 2026-08-24 cs.AI 版本更新 84%

FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents

FM-Bench:用于多智能体竞争的长周期管理基准

Tianyou Wang, Chongyang Gao, Kezhen Chen, Dong Chen, Yinghao He, Donghan Li, Wangcheng Xu, Hongjiu Zhang, Chi Li

机构 * AnalogyAI

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出FM-Bench基准,通过足球管理任务评估15个前沿LLM智能体的长周期决策能力,发现模型管理行为而非计算能力决定得分,排名与模型规模、价格或供应商无关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28645 2026-08-24 cs.HC cs.AI 版本更新 84%

Looks Right, Works Right: A Project-Level Benchmark for Multi-Screen Mobile App Generation

看起来对,运行起来对:面向多屏移动应用生成的项目级基准测试

Fan Wu, Cuiyun Gao, Yiming Huang, Yang Xiao, Yujia Chen, Qing Liao

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有设计转代码基准的局限,提出首个项目级多屏移动应用生成基准MobileForge,通过五轴评估及两种测试方法,发现前沿多模态LLM构建的应用存在导航、保真度和可维护性问题。

Comments Accepted by EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02760 2026-08-24 cs.CL cs.AI 版本更新 84%

Efficient Self-Evaluation for Diffusion Language Models via Sequence Regeneration

通过序列再生实现扩散语言模型的高效自评

Linhao Zhong, Linyu Wu, Wen Wang, Yuling Xi, Chenchen Jing, Jiaheng Zhang, Hao Chen, Chunhua Shen

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Zhejiang University of Technology(浙江工业大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DiSE方法,通过序列再生概率实现扩散语言模型的高效自评,提升质量评估的效率和可靠性。

Comments accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20607 2026-08-24 cs.CL cs.AI cs.LG 新提交 83%

JuryProbe: An Empirical Consensus-Risk Diagnostic for Routing Reference-Free Factuality Judge Panels to Grounded Verification

JuryProbe:用于将无参考事实性评判小组路由至基于事实的验证的经验共识风险诊断方法

Tianxin Zhou, Ruixi Lin

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对无参考事实性LLM评判小组的共识风险诊断方法JuryProbe,通过校准路由策略减少假阴性盲区导致的错误,在FEVER数据上验证了其有效性,可降低假接受并减少参考获取。

Comments 22 pages, 1 figure, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06607 2026-08-24 cs.CR 版本更新 83%

Your Harness is Not Secure: Benchmarking Real-world Threat of Command Line Interface Agent

你的工具不安全:评测命令行界面智能体的现实威胁

Weidi Luo, Qiming Zhang, Tianyu Lu, Xiaogeng Liu, Bin Hu, Hung-Chun Chiu, Siyuan Ma, Yizhe Zhang, Xusheng Xiao, Yinzhi Cao, Zhen Xiang, Chaowei Xiao

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 该研究针对CLI智能体滥用风险,推出与MITRE ATT&CK对齐的AdvCLI基准测试,评估7款CLI智能体后发现其常越过拒绝边界,可完成部分恶意OS级任务,为开发安全机制提供测试平台。

Comments Accepted by EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21208 2026-08-24 cs.SE cs.AI cs.LO 新提交 83%

Specification Portability Across LLM Development Agents: Cross-Agent Compatibility in Specification-Driven Software Migration

跨大语言模型开发智能体的规范可移植性:规范驱动软件迁移中的跨智能体兼容性

Oleg Grynets, Oleksii Ilchuk, Dariia Zatulna, Vasyl Lyashkevych

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 本文以Oracle到PostgreSQL的软件迁移为任务,评估了Amazon Kiro等多个LLM开发智能体在规范驱动迁移中的表现,发现跨智能体迁移存在性能下降,提出需重视规范可移植性等问题。

Comments 11 pages, 4 figures, 7 tables, 27 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21097 2026-08-24 cs.AI 新提交 83%

When Trust Meets Truth: Trust-Truth Separability in LLM-as-Judge

当信任遭遇真相:大模型作为评判者中的信任-真相可分性

Xin Sun, Di Wu, Yuchen Guo, Jiahuan Pei, Isao Echizen, Abdallah El Ali, Saku Sugawara

机构 * National Institute of Informatics (NII)(信息学研究所(NII)) University of Amsterdam(阿姆斯特丹大学) University of Tokyo(东京大学) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) Centrum Wiskunde & Informatica (CWI)(数学和计算机科学中心(CWI)) Utrecht University(乌得勒支大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 该研究针对大模型作为评判者系统,发现其信任评分与真相判决的分离性弱于人类,来源线索会同时影响信任评分与真相判决,因此不应将信任评分视为真相判断的独立证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20361 2026-08-24 cs.CL cs.AI 新提交 82%

Toward Auto-Research: Mining Falsifiable Research Ideas from Paper Knowledge Graphs with Categorical Structure

迈向自动研究:利用具有分类结构的论文知识图谱挖掘可证伪的研究思路

Yuchen Wang, Zhongzhi Luan

机构 * Sino-German Joint Software Institute(中德软件联合研究所) Beihang University(北京航空航天大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLMs构建的自动研究思路生成系统的结构缺陷,提出基于范畴论的三层算法,可高效过滤跨领域研究思路候选,兼具高过滤比与高可证伪率,且支持日志记录。

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20755 2026-08-24 cs.AI 新提交 81%

Natural-Language-Guided Generator-Agnostic Shortlisting for Protein Binder Design

自然语言引导的、与生成器无关的蛋白结合剂筛选

Gyubok Lee, Kiwoong Yoo, Jimin Seo, Kyunghoon Hur, Edward Choi

机构 * Kim Jaechul Graduate School of AI, Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院金在哲人工智能研究生院) LG AI Research(LG人工智能研究院) Seoul National University(首尔大学) Korea Electronics Technology Institute (KETI)(韩国电子技术研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究提出用LLM生成排序策略,从已生成的蛋白结合剂池中筛选候选,在10目标和3目标测试中均优于基线,为蛋白结合剂筛选提供了可解释的后处理方法。

Comments Accepted at ICML 2026 Workshop on Generative and Agentic AI for Biology

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20357 2026-08-24 cs.IR cs.AI 新提交 81%

Clarify-Then-Search: A Clarification Benchmark for Deep Search with End-to-End Nugget Restoration

先澄清再搜索:面向端到端 nugget 恢复的深度搜索澄清基准

Deqiang Huang, Jingbo Zhou, Xinjiang Lu, Tong Xu, Hua Wu, Enhong Chen

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究提出 Clarify-Then-Search 基准,评估 LLM 生成的澄清问题对深度搜索效用的提升,实验显示 k=1 时澄清优于基线,GPT-5.2 和 ERNIE-4.5-Turbo-128K 分别在 k=1、k=3 时表现最佳。

Comments Accepted to KDD 2026 Datasets and Benchmarks Track. 12 pages, 4 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03262 2026-08-24 cs.SE cs.CL 版本更新 81%

Is Vibe Coding Safe? Benchmarking Vulnerability of Agent-Generated Code in Real-World Tasks

Vibe 编程是否安全?在现实任务中对代理生成代码的漏洞基准测试

Songwen Zhao, Danqing Wang, Kexun Zhang, Jiaxuan Luo, Zhuo Li, Lei Li

机构 * Carnegie Mellon University Language Technologies Institute(卡内基梅隆大学语言技术研究所) Columbia University(哥伦比亚大学) Johns Hopkins University(约翰霍普金斯大学) HydroX AI

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过基准测试发现,Vibe 编程在现实任务中生成的代码安全性不足,尽管功能正确但存在安全漏洞,警示其在安全敏感领域应用的风险。

Comments Accepted in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14227 2026-08-24 cs.AI cs.CE cs.LG 版本更新 81%

Attributing Preprocessing Invariance in Spectral Foundation Models

归因于光谱基础模型中的预处理不变性

Dongjun Wei, Hongyi Wu, Yinuo Zou

机构 * ESCP Business School(ESCP商学院) OpluxCare Co., Ltd.(欧普乐康护理有限公司) The University of Hong Kong(香港大学) Nanjing University(南京大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究以拉曼光谱基础模型为例,指出其声称的预处理不变性多源于归一化而非学习,多数系统的归一化已消除相关变换,训练编码器未带来显著增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20983 2026-08-24 cs.SI cs.HC 新提交 80%

Beyond Truth Discovery: A Two-Stage Framework to Assess the Severity of False Claim during Disasters

超越真相发现:一种评估灾害期间虚假声明严重程度的两阶段框架

Ruichen Yao, Tejna Dasari, Gulshat Baispay, Aizhan Zaurbek, Yifan Liu, Yaokun Liu, Zelin Li, Dong Wang

专题命中 评测与基准 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 该研究针对灾害中社交媒体虚假声明严重程度评估问题,提出两阶段框架,结合可信度与危害性维度构建基准,发现LLMs及上下文学习与人工判断对齐度更强。

Comments The 2026 ACM Conference on Human-AI Complementarity and Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21060 2026-08-24 cs.AI cs.CV 新提交 79%

CellPath-Bench: A Multidimensional Benchmark for Whole-Slide Cellular Representations in Pathology Foundation Models

CellPath-Bench:面向病理学基础模型的全片细胞表示多维基准

Bokai Zhao, Yiyang Zhang, Hanqing Chao, Yawei Ma, Long Bai, Tai Ma, Minfeng Xu, Ming Song, Tianzi Jiang

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 CellPath-Bench是评估冻结病理学基础模型全片细胞表示能力的多维基准,通过对30款模型的测试揭示了细胞类型可解码性的模型差异,为相关审计提供标准化框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20763 2026-08-24 cs.CV cs.AI 新提交 79%

CARD: Diagnosing Belief to Action Routing Failures in Vision Language Models

CARD:诊断视觉语言模型中从信念到行动的路由故障

Souptik Kumar Majumdar, Fabian Kögel, Andreas Bulling

机构 * Universität Stuttgart(斯图加特大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出跨轴路由诊断(CARD)方法,在新型协作网格世界基准Relay Chain上诊断发现视觉语言模型(VLMs)存在未将信念表征纳入下一次行动预测的关键路由故障,相关成果为改进VLMs的信念-行动路由提供了依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20414 2026-08-24 cs.AI cs.CV 新提交 79%

StateSight: Benchmarking Latent Spatial-State Reconstruction in Vision-Language Models

StateSight:评测视觉语言模型中的潜在空间状态重建能力

Michelle Lin

机构 * Thomas Jefferson High School for Science and Technology(托马斯·杰斐逊科学技术高中)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本研究推出StateSight基准及配套数据集StateSight-Steps,评估视觉语言模型的潜在空间状态重建能力,发现GPT-5.5、Claude Sonnet 5的表现均逊于人类基线,格式正确的响应可能掩盖空间结构恢复失败的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27984 2026-08-24 cs.AI 版本更新 79%

Share the Judge, Learn the Deferral: Where Specialization Helps LLM Evaluation

共享评判,学习弃权:专业化在大语言模型评估中的作用

Ye Chen, Weining Zhang

机构 * Cheung Kong Graduate School of Business(长江商学院)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 该研究探讨大语言模型评估中领域专业化的架构设计,发现将专业化置于弃权而非评判环节,通过共享学习与级联路由可提升评估准确率并降低计算量。

Comments 18 pages, 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25497 2026-08-24 cs.CV cs.AI 版本更新 79%

A Distributional Robustness Margin For Pathology Foundation Models

超越计数:病理学基础模型的分布稳健性余量

Clément Grisi, Jeroen van der Laak, Geert Litjens

机构 * Radboud University Medical Center(拉德堡德大学医学中心)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 研究病理学基础模型受非生物学变异影响的问题,提出交叉混杂稳健性余量(CRoMa),通过直接比较距离评估模型稳健性,将其重塑为队列范围的余量分布,为模型选择和稳健性评估提供原则基础。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21180 2026-08-24 eess.IV cs.CV 新提交 78%

Toward Vision Language Model-based Assessment of Clinical Quality and Usability of LGE-MR Images for Cardiac Ablation Planning

面向基于视觉语言模型的LGE-MR图像临床质量与可用性评估以用于心脏消融规划

Bipasha Kundu, Abhishek Chaturvedi, Axel W. E. Wismueller, Richard Simon, Cristian A. Linte

专题命中 评测与基准 :language model(title,abstract)

AI总结 本研究提出两阶段VLM框架用于左心房LGE-MRI的临床导向图像质量评估,在60个图像切片-文本对数据集上,InternVL2的标准级准确率最高,DeepSeek实现完美临床可用性一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏