arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-18 至 2026-08-18 共收录 115 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 40 篇

2608.16293 2026-08-18 cs.HC cs.GT cs.SY eess.SY 新提交 50%

Principled Authority Switching for Shared Autonomy in Human-Robot Teams

人机协作团队中共享自主的原则性权限切换

Sandeep Banik, Naira Hovakimyan

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出一种合作博弈论框架,用于解决人机共享自主中的权限切换问题,推导了线性二次系统下最优切换策略的闭式递推式,验证了其在不同系统场景下的有效性,揭示了人类适应性与自主效率的权衡。

Comments 8 pages, 7 figures, accepted at IEEE RO-MAN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16071 2026-08-18 cs.CL cs.IR 新提交 50%

Skill2Query: Exploiting Skill Structure to Generate Pseudo-Queries for Agent Skill Retrieval

Skill2Query:利用技能结构生成智能体技能检索的伪查询

Lihui Ding, Zihan Guo, Bingwei Lu, Chenyu Zhou, Yuanjian Zhou, Weinan Zhang, Jianghao Lin, Dongdong Ge

机构 * Fudan University(复旦大学) Sun Yat-sen University(中山大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 Skill2Query是利用技能知识图谱生成伪查询的框架,可提升多类检索性能,生成的训练数据表现最优,还能提高智能体任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15931 2026-08-18 cs.CL 新提交 50%

PLSQLBench: Benchmarking LLM Systems for Executable Procedural Database Programming

PLSQLBench:面向可执行过程式数据库编程的大语言模型系统基准测试

Marianne Menglin Liu, Leonid Boytsov, Daniel W. Peterson, Pramuditha Perera, Rongguang Wang, Sai Ashish Somayajula, Syed Hamza Rafique, Rohit Saini, Shubham Pathak, Sujeeth Bharadwaj, Tao Sheng, Graham Horwood, Fahad Shah, Ankan Bansal, Sujith Ravi, Dan Roth

机构 * Oracle AI, Turing Enterprise Inc(Oracle AI 图灵企业公司)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究提出首个过程式数据库编程基准PLSQLBench,含2865个任务实例,经8个LLM实验发现其在多方面存在困难,工具增强智能体性能有提升但仍有差距,凸显了传统基准未覆盖的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16311 2026-08-18 cs.HC cs.GT cs.SY eess.SY math.DS 新提交 50%

$\texttt{Flip-Team}$: Cooperative Takeover Games with Stochastic Human Override

Flip-Team:带随机人工干预的协作接管游戏

Sandeep Banik, Naira Hovakimyan

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出带随机人工干预的协作博弈论框架,将共享自主系统的控制切换问题建模为利益一致的动态博弈,推导线性二次系统的最优切换策略闭式递推式,验证了其在不同系统下的有效性,揭示人类适应性与自主效率的权衡。

Comments 8 pages, 7 figures, accepted at IEEE CDC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12951 2026-08-18 cs.SD 版本更新 50%

VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching

VoxAudio:基于多奖励自回归流匹配的发声音频合成

Wenxiang Guo, Changhao Pan, Ziyue Jiang, Zhou Zhao, Fei Wu

机构 * Zhejiang University(浙江大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 VoxAudio是一种多奖励自回归流匹配模型,通过架构、偏好、数据层面的优化,解决现有T2A系统发声控制不足的问题,在多基准上验证了有效性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24861 2026-08-18 cond-mat.stat-mech cs.IT math.IT 版本更新 50%

First-Order Recoverability Collapse in Self-Referential Information Decoders: The Operating Loop of an AI System as a Driven Nonequilibrium Steady State

自指信息解码器中的一阶可恢复性崩溃

Pieter van Rooyen

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究自适应系统在持续非平衡驱动下耦合推理与不可逆动作的可恢复性,发现容量饱和导致可恢复性丧失和诊断发散,反馈使转变变为一阶,出现双稳态区域和滞后现象。

Comments 27 pages, 7 figures, 3 tables. v3: specification-map roadmap figure and classification-audit table; prior-identifications and literature bridges; fleet-limit N-scaling measurement; bootstrapped empirical spinodal; title updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24312 2026-08-18 cs.CR 版本更新 50%

Five Queries Are Enough: Query-Efficient and Surrogate-Free Membership Inference Attacks on RAG via Entailment

五个查询就足够了:基于蕴含的查询高效且无替代模型的RAG成员推断攻击

Nguyen Linh Bao Nguyen, Wanlun Ma, Viet Vo, Alsharif Abuadbba, Minghong Fang, Jun Zhang, Yang Xiang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出MEntA攻击方法,利用自然语言蕴含在少量查询下高效推断RAG系统中的文档成员关系,无需替代模型,成本低且难以检测。

Comments Accepted by USENIX Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 5 篇

2608.16484 2026-08-18 cs.CV 新提交 91%

Remote-Sensing City Layout Extraction with MLLM

基于多模态大语言模型(MLLM)的遥感城市布局提取

Zigan Zhou, Kai Li, Yupeng Deng

机构 * City University of Hong Kong(香港城市大学) University of Chinese Academy of Sciences(中国科学院大学) Aerospace Information Research Institute(空天信息创新研究院)

专题命中 文档图表理解 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本研究提出Code-as-City方法,利用MLLM将遥感顶视图图像转化为含平面与3D输出的可编辑城市布局,在CityLayout-100数据集上取得41.1%、48.3%的交并比,验证了视觉观测转城市代码的可行性。

Comments 4 pages, 2 figures, 4 tables. Accepted to IEEE APGARSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23694 2026-08-18 cs.CL 版本更新 78%

ChartFI: Benchmarking Faithfulness and Insightfulness of Chart Descriptions from Multimodal Large Language Models

ChartFI: 多模态大语言模型图表描述的忠实性与洞察力基准测试

Fen Wang, Zekai Shao, Qiman Kang, Chunran Hu, Zhixuan Zhang, Lexu Xie, Chao Liu, Siming Chen

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Zhengzhou Zhongke Institute of Integrated Circuit and System Application(郑州中凯集成电路与系统应用研究院) School of Computer Science, Fudan University(复旦大学计算机科学学院)

专题命中 文档图表理解 :multimodal large language model(title,abstract)

AI总结 提出ChartFI-Bench基准,包含896个复杂图表-描述对,并设计四个评估指标(忠实性、覆盖率、信息量、敏锐度),系统评估多模态大语言模型生成图表描述的质量。

Comments Accepted by VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16763 2026-08-18 cs.AI 新提交 77%

LAVA: Logic-Aware Validation and Augmentation Framework for Large-Scale Financial Document Auditing

LAVA:面向大规模财务文档审计的逻辑感知验证与增强框架

Ruoqi Shu, Xuhui Wang, Isaac Wang, Yanming Mai, Bo Wan

机构 * BMO Financial Group(蒙特利尔银行金融集团)

专题命中 文档图表理解 :grounding(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 针对财务文档验证的异构性与业务规则处理难题,提出基于多模态大语言模型的LAVA框架,通过四阶段设计提升幻觉控制与边缘案例处理能力,适用于高风险财务审计场景。

Journal ref Proceedings of The 10th Workshop on Financial Technology and Natural Language Processing (FinNLP 2025), Association for Computational Linguistics, pp. 75-92, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15698 2026-08-18 cs.CV cs.IR 新提交 57%

ConceptFormer: Learning Adaptive Latent Concepts for Query-Document Alignment in Visual Document Retrieval

ConceptFormer:学习自适应潜在概念以实现视觉文档检索中的查询-文档对齐

Peng Chunyi, Xu Zhipeng, Yan Yukun, Liu Zhenghao, Yu Shi, Mei Sen, Sun Yubo, Zhang Yongheng, Zhou Jie, Gu Yu, Yu Ge, Sun Maosong

机构 * Northeastern University(东北大学) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 针对视觉文档检索中现有监督信号的局限,本文提出ConceptFormer框架,以自适应潜在概念为中间表示衔接语义鸿沟,在基准测试中较最强基线实现了16.7%、22.1%的NDCG@10相对提升,性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21333 2026-08-18 cs.CV 版本更新 57%

MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios

MME-VideoOCR:评估多模态大语言模型在视频场景中基于OCR的能力

Yang Shi, Huanqian Wang, Wulin Xie, Huanyao Zhang, Lijie Zhao, Yi-Fan Zhang, Xinfeng Li, Chaoyou Fu, Zhuoer Wen, Wenting Liu, Zhuoran Zhang, Xinlong Chen, Bohan Zeng, Sihan Yang, Yushuo Guan, Zhang Zhang, Liang Wang, Haoxuan Li, Zhouchen Lin, Yuanxing Zhang, Pengfei Wan, Haotian Wang, Wenjing Yang

机构 * Kling Team(Kling团队) PKU(北京大学) THU(清华大学) CASIA(中国科学院自动化研究所) CUHKSZ(香港科技大学) NTU(国立台湾大学) NJU(南京大学) XJTU(吉林大学)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文推出MME-VideoOCR视频OCR基准,评估18个最先进MLLMs的视频OCR能力,发现现有模型在需视频整体理解的任务中表现有限,最优模型准确率仅73.7%,明确了高分辨率输入等对视频OCR的重要性。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 3 篇

2506.02917 2026-08-18 cs.RO 版本更新 83%

Language-Guided Generation for Personalized Inspection Planning

语言引导的个性化巡检规划生成

Xingpeng Sun, Zherong Pan, Xifeng Gao, Kui Wu, Aniket Bera

机构 * Faculty of Electrical Engineering, Mathematics and Computer Science, University of Twente(代尔夫特理工大学电子工程、数学和计算机科学学院) Department of Electrical Engineering, Wright State University(电气工程系,怀特州立大学)

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(abstract)

AI总结 该研究提出一种无训练的VLM引导方法,针对已知场景高效生成符合文本指令的巡检轨迹,可应用于多领域,经多环境验证效果良好。

Comments 8 pages, 6 figures

Journal ref IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16703 2026-08-18 cs.RO 82%

VLM-Empowered Multi-Mode System for Efficient and Safe Planetary Navigation

Sinuo Cheng, Ruyi Zhou, Wenhao Feng, Huaiguang Yang, Haibo Gao, Zongquan Deng, Liang Ding

机构 * State Key Laboratory of Robotics and System, Harbin Institute of Technology(机器人系统国家重点实验室,哈尔滨工业大学)

专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract)

Comments accepted by IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21862 2026-08-18 cs.RO cs.AI 版本更新 81%

EvoScene-VLA: Evolving Scene Beliefs Inside the Action Decoder for Chunked Robot Control

EvoScene-VLA: 在动作解码器中进化场景信念用于分块机器人控制

Chushan Zhang, Ruihan Lu, Jinguang Tong, Xuesong Li, Yikai Wang, Hongdong Li

机构 * Australian National University(澳大利亚国立大学) The University of Queensland(昆士兰大学) Beijing Normal University(北京师范大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract,abstract_cn);VLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出EvoScene-VLA,通过在动作解码器中维护更新的场景状态,改进分块机器人控制中的多步控制预测,提升了场景信念的持续性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 10 篇

2608.16690 2026-08-18 cs.CV 新提交 91%

AnchorScore: A CLIP-Based Diagnostic of MLLM Annotation Difficulty

AnchorScore:一种基于CLIP的多模态大语言模型(MLLM)标注难度诊断方法

Yan Ma, Lizhuo Zhang

机构 * School of Foreign Studies, Changsha University of Science and Technology(长沙理工大学外国语学院) School of Education, Hunan Agricultural University(湖南农业大学教育学院) School of Information and Intelligence, Hunan Agricultural University(湖南农业大学信息与智能科学学院)

专题命中 幻觉与鲁棒性 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出基于CLIP的AnchorScore,可低成本预先对类别按MLLM标注难度排名,在课堂行为、动作识别等数据上与MLLM准确率相关性高,可用于混合路由、提示消歧等场景。

Comments 37 pages, 7 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06223 2026-08-18 cs.CV 89%

RedDiffuser: Auditing Multimodal Safety Failures in Vision-Language Models via Reinforced Diffusion

RedDiffuser:通过强化扩散审计多模态安全故障

Ruofan Wang, Xingjun Ma

机构 * Fudan University(复旦大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract,abstract_cn);LLaVA(abstract,abstract_cn);分类 cs.CV

AI总结 研究多模态系统在有害上下文暴露下的安全审计,提出RedDiffuser框架通过扩散模型生成视觉输入,揭示隐藏的安全漏洞,实验显示VLMs在部分有毒文本与视觉上下文结合时存在广泛安全问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16081 2026-08-18 cs.CV 新提交 85%

SafeGesture: Evaluating Fine-Grained Hand Gesture Understanding in Vision-Language Models through Scenario-Conditioned Safety Interpretation

SafeGesture:通过场景条件安全解释评估视觉语言模型的细粒度手势理解能力

Taegang Kim, Saleh Afroogh, Junfeng Jiao

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Urban Information Lab, The University of Texas at Austin(德克萨斯大学奥斯汀分校城市信息实验室)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出SafeGesture基准,评估5款视觉语言模型的细粒度手势安全理解能力,发现模型存在感知与推理脱节,瓶颈为场景条件安全推理而非手势识别。

Comments 14 pages, 22 tables, 2 figures. Code and benchmark resources available at https://github.com/The-Responsible-AI-Initiative/SafeGesture

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18094 2026-08-18 cs.CV cs.AI cs.DB 版本更新 76%

OODBench: Out-of-Distribution Benchmark for Large Vision-Language Models

OODBench: 用于大型视觉-语言模型的分布外基准

Ling Lin, Yang Bai, Heng Su, Congcong Zhu, Yaoxing Wang, Yang Zhou, Huazhu Fu, Jingrun Chen

机构 * University of Science and Technology of China Suzhou Institute for Advanced Research, USTC Key Laboratory of the Ministry of Education for Mathematical Foundations Unmanned System Research Institute, Northwestern Polytechnical University

专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV、cs.AI

AI总结 OODBench提出了一种自动化方法,用于构建评估大型视觉-语言模型处理分布外数据能力的基准,并展示了当前模型在面对此类数据时的性能下降。

Comments 54 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14854 2026-08-18 cs.CV 新提交 70%

Zero-MELO: Test-Time Evidence Calibration with Multimodal LLMs for Zero-Shot Micro-Gesture Recognition

Zero-MELO:基于多模态大语言模型的测试时证据校准用于零样本微手势识别

Chengyan Wang, Hanliang Xie, Yueyi Yang, Haoyu Chen

机构 * University of Oulu(奥卢大学) Peking University(北京大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract,abstract_cn);分类 cs.CV

AI总结 该研究针对多模态大语言模型在微手势识别中局部证据不足、分数偏差的瓶颈,提出Zero-MELO框架,结合树搜索、测试时校准与多线索融合,在iMiGUE和MA-52数据集上显著优于Qwen2.5-VL基线。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04484 2026-08-18 cs.CV 版本更新 70%

TrustCLIP: Learning Private Visual Features via Adversarial Reconstruction

TrustCLIP:通过对抗性重建学习隐私视觉特征

Nikos Athanasiou, Ilya A. Petrov, Angela Yao, Shugao Ma, Eric Sauser, Edoardo Remelli, Shreyas Hampali, Johannes Schönberger, Fadime Sener, Bugra Tekin

机构 * Meta Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) University of Tübingen(图宾根大学) National University of Singapore(新加坡国立大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 研究视觉和视觉语言模型中视觉特征隐私问题,提出TrustCLIP框架,以特征条件生成器为隐私对手,优化编码器特征与下游模块投影,降低生成式反演保真度并保持下游任务性能。

Comments https://atnikos.github.io/trustclip/ Update affiliations

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01503 2026-08-18 cs.CV 版本更新 70%

Disentangling Pictorial Cue Understanding from Language Bias in VLMs via Depth Ordering Task

通过深度排序任务解构视觉语言模型中的图像线索理解与语言偏差

Yiqian Liu, Iuliia Kotseruba, John K. Tsotsos

机构 * York University(约克大学) University of Guelph(圭尔夫大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出深度排序与异常检测任务,结合控制图像线索和语言表达,量化视觉语言模型的深度感知能力,发现模型对深度线索利用不足且存在语言偏差。

Comments 15 pages, 7 figures, accepted to ECCV 2026 (30 pages, 13 figures, supplementary materials included)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16663 2026-08-18 cs.DB cs.AI 新提交 57%

Bounded Semantic Planning and Deterministic Compilation for Reliable Enterprise Text-to-SQL

用于可靠企业级文本到SQL的有界语义规划与确定性编译

Yi Ai

专题命中 幻觉与鲁棒性 :grounding(abstract_cn);分类 cs.AI

AI总结 提出语义路径编译(SPC)系统,在ACME保险基准测试中,其文本到SQL任务正确率达97.4%,显著优于基线系统,且鲁棒性更强。

Comments 10 sections, 2 figures, 6 tables. Preprint. Code and research artifacts are described in the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15115 2026-08-18 cs.CV 新提交 57%

Perspective-Invariant Attack with Enhanced Transferability of Adversarial Examples

具有增强对抗样本迁移性的视角不变攻击

Kaisheng Liang, Yiming Cao, Bin Xiao

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 针对对抗样本跨模型迁移性带来的安全威胁,提出视角不变攻击(PIA)及其扩展PIA-Mix,通过多自由度顶点采样策略提升对抗样本迁移性,实验显示其性能优于当前最优基于迁移的攻击方法。

Journal ref IEEE Transactions on Information Forensics and Security, vol. 21, pp. 6818-6831, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11603 2026-08-18 cs.CL cs.AI 版本更新 57%

DR.GAP: Mitigating Bias in Large Language Models using Gender-Aware Prompting with Decoupled Reasoning

DR.GAP:采用解耦推理的性别感知提示缓解大语言模型中的偏见

Hongye Qiu, Yue Xu, Yi Wang, Meikang Qiu, Wenjie Wang

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

AI总结 该研究针对大语言模型的性别偏见问题,提出DR.GAP方法,通过生成无性别推理轨迹作为上下文示例,在不修改模型参数的情况下缓解偏见,且可扩展至视觉语言模型,经多任务多模型实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 27 篇

2608.15605 2026-08-18 cs.CV 新提交 93%

AlloEgo-VLM: Disambiguating Allocentric and Egocentric Reference Frames in Vision-Language Models

AlloEgo-VLM:在视觉语言模型中消除 allocentric( allocentric 即 allocentric 参考框架,又称 allocentric 坐标系,指以环境为中心的参考框架)与 egocentric( egocentric 即 egocentric 参考框架,又称自我中心坐标系,指以观察者自身为中心的参考框架)参考框架的歧义

Kuan-Lin Chen, Tzu-Ti Wei, Chao-Chi Liao, Yu-Chee Tseng, Jen-Jee Chen

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Institute of Computer Science and Engineering(工程与计算机科学学院) College of Artificial Intelligence(人工智能学院)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(title,abstract);分类 cs.CV

AI总结 针对VLMs理解空间语义时 allocentric 与 egocentric 参考框架的歧义问题,构建数据集AlloEgo-View并开发框架AlloEgo-VLM,经NVIDIA Isaac Sim平台验证其在具身机器人开放式物体搜索任务中的有效性。

Comments 28 pages, 9 figures. Project page and code available at https://github.com/CKL9001/AlloEgo-VLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15516 2026-08-18 cs.LG 新提交 93%

UniFed-VLM: Federated Instruction Tuning for Vision-Language Models with Multiple Heterogeneity

UniFed-VLM:面向多异质性视觉语言模型的联邦指令调优

Pengyu Wang, Baochen Xiong, Xiaoshan Yang, Yifan Xu, Zhang Qimeng, Haifeng Chen, Changsheng Xu

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(title,abstract);分类 cs.LG

AI总结 UniFed-VLM是解决任务、模态、模型架构联合异质性的VLM联邦指令调优框架,含FedCSA与TCoD组件,在多基准数据集上优于现有FL方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16513 2026-08-18 cs.CV cs.AI 新提交 91%

MLLM-Guided Semantic Correction for Text-to-Video Generation

基于多模态大语言模型(MLLM)的文本到视频生成语义修正

Junhao Chen, Zheqi Lv, Keting Yin, Shengyu Zhang, Zhou Zhao, Feiyang Chen, Xinyu Duan, Baoxing Huai, Fei Wu

机构 * Zhejiang University(浙江大学) Huawei Cloud Computing Technology Co., Ltd.(华为云计算技术有限公司)

专题命中 VLM训练与架构 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出一种无需训练的MLLM引导文本到视频生成语义修正框架,通过两个关键模块在生成中修正语义偏差,提升了生成内容的语义对齐度等性能,经多基准实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15580 2026-08-18 cs.AI cs.CV 新提交 91%

From Generalist to Specialist: A Context-Fusion Framework for Endoscopic Polyp Reporting with a Frozen VLM

从通用到专用:基于冻结视觉语言模型(VLM)的内窥镜息肉报告上下文融合框架

Ruijie Yang, Yan Zhu, Peiyao Fu, Siyuan Li, Te Luo, Zhihua Wang, Quanlin Li, Pinghong Zhou, Xian Yang, Shuo Wang

机构 * Zhejiang University(浙江大学) Shanghai Institute for Advanced Study, Zhejiang University(浙江大学上海高等研究院) Shanghai Key Laboratory of MICCAI(上海市MICCAI重点实验室) Digital Medical Research Center, School of Basic Medical Sciences, Fudan University(复旦大学基础医学院数字医学研究中心) Endoscopy Center and Endoscopy Research Institute, Zhongshan Hospital, Fudan University(复旦大学附属中山医院内镜中心及内镜研究所) Shanghai Collaborative Innovation Center of Endoscopy(上海市内镜协同创新中心) Alliance Manchester Business School, The University of Manchester(曼彻斯特大学联盟曼彻斯特商学院)

专题命中 VLM训练与架构 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本研究针对内窥镜息肉报告需求,提出一种不修改预训练权重的上下文融合框架,通过隐式指令与显式转换上下文对冻结通用VLM专用化,在2056张标注图像实验中实现最优性能且参数量仅为冻结VLM的0.006%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16263 2026-08-18 cs.CV 新提交 89%

Seeing Before Answering: Training-Free Visual Layer Profiling for Vision-Language Models

先见后答:面向视觉语言模型的无训练视觉层分析

Ruchen Liu, Yi Yang, Yiming Xu, Michael Ying Yang, Monika Sester, Bodo Rosenhahn

机构 * Leibniz Universität Hannover(汉诺威莱布尼茨大学) University of Bath(巴斯大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);LLaVA(abstract,abstract_cn);分类 cs.CV

AI总结 该研究提出无需训练的视觉数据集熵(VDE)方法,可预测视觉语言模型的最优视觉层,缩小搜索范围,相比GW距离更具实用性。

Comments ECCVW'26 eXCV

详情

展开后加载摘要…

URL PDF HTML 收藏