arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 546 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 546 篇

2608.07920 2026-08-11 cs.CV 新提交 77%

Forged Peer Judgments Mislead Multimodal LLM Judge Panels: Source-Blind Anchoring and Panel-Consensus Verification

伪造的同行判断会误导多模态大语言模型(LLM)评判小组:无来源锚定与小组共识验证

Yang Shu

机构 * Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 研究发现多模态LLM评判小组存在无来源锚定的文本攻击面,伪造同行判断可误导判决,提出的小组共识验证方法能有效阻断此类攻击并降低损害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06745 2026-08-10 cs.AI 新提交 77%

MemPrism: Task-Conditioned Relational Memory Views for Long-Horizon Agents

MemPrism:面向长程智能体的任务条件关系记忆视图

Zhisheng Chen, Bingfan Zeng, Bangde Cao, Zhengwei Xie, Yuxuan Li, Jinhan Li, Zheng Lu, Xiangchen Guan, Zikai Xiao, Rui Qian, Jingwei Song

机构 * Nanyang Technological University(南洋理工大学) South China University of Technology(华南理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) Zhejiang University(浙江大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 该研究针对长程智能体记忆系统的表示不匹配问题,提出MemPrism任务条件关系记忆框架,经实验验证可提升长程任务性能、减少记忆消耗且视图策略可跨VLM迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05592 2026-08-07 cs.CV 新提交 77%

Beyond Frame Selection: Rethinking Long-Video Understanding with MLLMs

超越帧选择:用多模态大语言模型重新思考长视频理解

Ziling Huang, Shin'ichi Satoh

机构 * National Institute of Informatics(信息学研究所)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 针对 MLLMs 长视频理解的帧选择策略难以兼顾全局与局部信息的问题,提出 VideoRouter 模型,通过时间层次结构和验证引导路由器协调全局与局部推理,在 VideoMME 数据集上实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04554 2026-08-06 cs.CL cs.CV 新提交 77%

Representing Visual Evidence for Item Difficulty Prediction: Visual Textualization and Image-Native Modeling

为题目难度预测表征视觉证据:视觉文本化与原生图像建模

Han Chen, Ming Li, Hong Jiao, Tianyi Zhou

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Maryland(马里兰大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文针对题目难度预测的视觉证据表征问题,对比仅用文本、视觉文本化与原生图像建模三种方式,发现原生图像建模是有竞争力的替代方案,其有效性取决于VLMs的适配方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03632 2026-08-05 cs.AI 新提交 77%

When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation

当教师误导时:感知虚假信号的在线策略蒸馏

Yinuo Jiang, Yongjie Ye, Zhou Tao, Xiang Zhuang, Qiang Zhang, Huajun Chen, Tiankai Li

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI

AI总结 针对在线策略蒸馏中存在的虚假信号问题,提出SA-OPD框架,通过输入接地性代理过滤误导性token级监督,实验表明其性能优于普通OPD及其他选择性方法。

Comments 21 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02218 2026-08-04 cs.AI 新提交 77%

PosterMELD: Multi-Agent Paper-to-Poster Generation for Controllable Design Diversity with Editable Print-Ready Outputs

PosterMELD:面向可编辑打印就绪输出的可控设计多样性多智能体论文转海报生成

Haojie Hu, Chenhao Dang, Yaojia Liu, Hengrui Kang, Conghui He, Weijia Li

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI

AI总结 PosterMELD是模板条件化多智能体海报生成流水线,可导出可编辑PPTX和PNG,在621篇论文实验中PRR达81.3%,成本仅为Codex+Skill的3.5%,性能优于P2P、PosterGen等方法。

Comments 9 pages, 5 figures, and 4 tables. Code and resources are available at https://github.com/Shannon4Science/PosterMELD

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01635 2026-08-04 cs.CV 新提交 77%

Mitigating Visual Degradation in MLLMs via Spatial-Spectral Visual Anchor Learning

通过空间-光谱视觉锚学习缓解多模态大语言模型(MLLMs)中的视觉退化

Qianlong Yang, Bowen Ye, Xianda Guo, Yanlun Peng, Wenke Huang, Hongyuan Zhang, Yulei Jia

机构 * China University of Petroleum (East China)(中国石油大学(华东)) Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) Great Wall Motor(长城汽车) Nanyang Technological University(南洋理工大学) The University of Hong Kong(香港大学)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 针对MLLMs推理时的视觉表示退化问题,提出SSVAL方法,通过VAPI及辅助对齐损失实现稳定视觉锚,性能优于现有方法。

Comments This paper has been accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01201 2026-08-04 cs.RO cs.CV 新提交 77%

PRISM: Privileged Probabilistic Latent Supervision for End-to-End Autonomous Driving Motion Planning

PRISM:面向端到端自动驾驶运动规划的特权概率潜在监督

Volodymyr Havrylov, Faris Janjoš, Andreas Look, Jürgen Mathes, Andreas Geiger

机构 * University of Tübingen(蒂宾根大学) Bosch Center for Artificial Intelligence(博世人工智能中心) Coburg University(科堡大学) Tübingen AI Center(蒂宾根人工智能中心)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 该研究针对端到端自动驾驶模型梯度微弱问题,提出基于真实值的概率潜在监督框架,在 nuScenes 数据集上实现规划 L2 误差降 8%、碰撞率降 3%,且计算开销可忽略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27700 2026-07-31 cs.CV 新提交 77%

Calibrate Before Reason: Robust Visual Token Reduction against Semantic Drift in VLMs

推理前校准:针对视觉语言模型中语义漂移的鲁棒视觉令牌缩减

Jiasheng Li, Zhong Ji, Yan Zhang, Huihui Li

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 该研究针对VLMs的语义漂移问题,提出无训练的CaRe框架,通过两个互补模块校准视觉表示,在剪枝94.4%视觉令牌时保留96.4%原性能,使推理速度提升最高2.30倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27597 2026-07-31 cs.RO cs.AI cs.SY eess.SY 新提交 77%

A Systems Engineering Framework for Vision-Language-Enabled UAV Triage and Disaster Response

面向视觉语言赋能的无人机分类与灾害响应的系统工程框架

Swapnil Saha, Bhuvan Rajanasiriyur Jagadeesha, Karishma Patnaik, Neelakshi Majumdar

机构 * University of Arkansas(阿肯色大学) University of Michigan-Dearborn(密歇根大学迪尔伯恩分校)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.AI

AI总结 该研究提出将视觉语言模型(VLMs)作为协同智能体嵌入人-无人机回路的系统工程框架,经评估可降低人因负担、提升AI信任度,推进了高风险灾害响应的人-自主系统协同。

Comments 10 pages, 8 figures. Author accepted manuscript of AIAA Paper 2026-4010, published in the AIAA AVIATION 2026 Forum

Journal ref AIAA AVIATION 2026 Forum, AIAA Paper 2026-4010, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26582 2026-07-30 cs.CV 新提交 77%

Level, Sharpness, and Corpus: Why Zero-Shot OOD Detector Rankings Do Not Transfer

水平、锐度与语料:为何零样本分布外检测器的排名无法迁移

Ignacio M. De la Jara, Cristian Rodriguez-Opazo, Stephen Gould, Damith Ranasinghe

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文通过审计证明零样本OOD检测器排名无法跨域迁移,提出CEG封装器,可降低检测器敏感性并提升GL-MCM与MCM的族平衡FPR95。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22293 2026-07-27 cs.CV 新提交 77%

RadSight: Towards Perceptually Reliable Multimodal Radiology Image Understanding

RadSight:迈向感知可靠的多模态放射学图像理解

Jianqin Liu, Weiwei Cao, Wanxing Chang, Ruifeng Yuan, Bowen Shi, Zhilin Zheng, Xianjie Zhang, Ling Zhang, Peng Wang, Jianpeng Zhang

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(湖畔实验室) University of Electronic Science and Technology of China(电子科技大学)

专题命中 VLM训练与架构 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 该研究针对医学多模态大语言模型视觉解释可靠性低的问题,引入Perception-Bench基准分析问题。提出基于双2D/3D编码器架构的RadSight模型,经渐进课程学习训练,在多维度评估中优于现有模型,凸显低级视觉感知对可靠临床理解的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20900 2026-07-24 cs.CV 新提交 77%

DINO-VPT: Hierarchical Visual Prompt Tuning for Joint Physical-Digital Face Anti-Spoofing

DINO-VPT:用于联合物理-数字人脸反欺骗的分层视觉提示调整

Pierre Gallin-Martel, Mika Feng, Koichi Ito, Takafumi Aoki

机构 * Graduate School of Information Sciences, Tohoku University(东北大学信息科学研究生院)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 研究针对人脸反欺骗需求,提出DINO-VPT轻量级仅视觉框架,利用分层视觉提示调整,通过提示路由网络动态注入提示,无需多模态融合,在基准测试中比现有方法准确率更高,证明合理架构能达最优性能。

Comments accepted to IJCB2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20462 2026-07-24 cs.AI 新提交 77%

Marking the Wrong Symptoms: Evaluating LLM Watermarks in Medical Texts

标记错误症状:评估医学文本中的大语言模型水印

Melanie Rieff, Robin Staab, Thibaud Gloaguen, Stefan Hegselmann, Martin Vechev

机构 * ETH Zurich(苏黎世联邦理工学院) Berlin Institute of Health at Charité – Universitätsmedizin Berlin(柏林夏里特医学院柏林健康研究所) Deutsches Herzzentrum der Charité – Medical Heart Center of Charité and German Heart Institute Berlin(柏林夏里特医学院德国心脏中心与柏林德国心脏研究所)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 研究LLM水印对医学性能的影响,在11个LLM和7个VLM上对5种水印方案进行多任务基准测试,引入人类专家验证管道补充评估,发现水印会致多种退化,特定领域评估是医学中水印模型安全部署的前提。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19889 2026-07-23 cs.CV 新提交 77%

LAVIFT: Latent-Action-Guided Vision Fine-Tuning for Surgical Interaction Recognition

LAVIFT:用于手术交互识别的潜在动作引导视觉微调

Jiajun Cheng, Subarna Tripathi, Sainan Liu, Xiaofan Yu, Shan Lin

机构 * Arizona State University(亚利桑那州立大学) University of California, Merced(加州大学默塞德分校) Intel Corporation(英特尔公司)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);grounding(abstract);分类 cs.CV

AI总结 研究针对手术交互识别中预训练模型适应细粒度交互的挑战,提出LAViFiT框架,通过逆动力学模型、前向世界模型及补丁级SIG正则化器,实现视觉语言微调,提升了识别率和图像-文本对齐,增强了特征基础和空间连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18236 2026-07-21 cs.RO cs.LG 新提交 77%

Patch Policy: Efficient Embodied Control via Dense Visual Representations

补丁策略:通过密集视觉表示实现高效具身控制

Gaoyue Zhou, Zichen Jeff Cui, Ada Langford, Bowen Tan, Yann LeCun, Lerrel Pinto

机构 * Courant Institute, New York University(纽约大学柯朗数学科学研究所) Meta-FAIR(Meta FAIR) AMI Labs(AMI 实验室)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.LG

AI总结 研究利用预训练密集视觉特征,提出补丁策略,通过块因果注意力掩码等实现高效具身控制。该策略轻量级、快速且高效,在模拟和真实环境中相比其他策略有显著提升,为机器人社区利用视觉表示学习提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16326 2026-07-21 cs.CV 新提交 77%

CRISP: Pre-LLM Yet Text-Driven Visual Token Pruning for Efficient LVLM Inference

CRISP:用于高效LVLM推理的预LLM文本驱动视觉令牌剪枝

Xu Li, Yi Zheng, Mengyang Zhao, Yuxuan Liang, Zhe Liu, Rui Zhu, Xiaolei Chen, Wei Zhou, Baoquan Zhao, Juncen Guo

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院) School of Artificial Intelligence, Sun Yat-sen University(中山大学人工智能学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 针对大型视觉语言模型推理开销大的问题,提出CRISP框架,通过文本驱动在预LLM阶段剪枝视觉令牌,分两阶段工作,实验表明其在激进剪枝率下能保持高性能,降低推理成本和延迟,是高效LVLM推理的实用方案。

Comments Accepted by the 2026 IEEE International Conference on Multimedia and Expo (ICME 2026) as Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13429 2026-07-16 cs.RO cs.CV 新提交 77%

Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment

通过表示锚定和语言-动作对齐实现可泛化的视觉语言动作微调

Dwip Dalal, Shivansh Patel, Chahit Jain, Jeonghwan Kim, Utkarsh Mishra, Alex Baratian, Hyeonjeong Ha, Heng Ji, Svetlana Lazebnik, Unnat Jain

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Texas A&M University(德州农工大学) University of California, Irvine(加州大学欧文分校)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 研究针对VLA策略微调中存在的问题提出Anchor-Align方法,通过视觉语言锚定和语言-动作对齐两个目标增强BC,在物理机器人和模拟测试中均有效果提升,表明保留预训练表示与有效动作学习可兼顾。

Comments Code: https://github.com/dwipddalal/Anchor-Align

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11030 2026-07-14 cs.IR cs.LG cs.MM 新提交 77%

MMRM: A Multiplex Multimodal Representation Model for Product Ranking in E-commerce Search

MMRM:一种用于电子商务搜索中产品排名的多重多模态表示模型

Zhen-Lin Chen, Maosen Sheng, Peng Lin, Jianmin Chen, Zhuojian Xiao, Dongyue Wang, Xiwei Zhao

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.LG

AI总结 针对电子商务搜索排名中多模态信息利用的局限,提出MMRM框架,通过共享主干从多信号学习生成多重商品表示,引入多重用户表示策略,并经实验验证其有效性,已成功应用于京东搜索引擎提升性能。

Comments Accepted by SIGIR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04694 2026-07-07 cs.CV 新提交 77%

Solve the Missing First Step: Can VLMs Standardize Raw Heterogeneous Medical Data?

解决缺失的第一步:视觉语言模型能否标准化原始异构医学数据?

Xin Chen, Dongliang Xu, Cunhao Zhu, Xudong Luo, Haoyang Lyu, Xiaoxiao Sun, Serena Yeung-Levy, Yue Yao

机构 * Shandong University(山东大学) Stanford University(斯坦福大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 研究视觉语言模型应用于医学AI时原始医学数据标准化问题,通过构建基准测试,让模型处理原始数据集文件夹,评估其多种能力,发现即使最佳模型端到端成功率也低,凸显该环节是医学AI诊断关键瓶颈。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02674 2026-07-07 cs.CV 新提交 77%

EmoteGPT: 3D Human Facial Expressions from Natural Language Descriptions

EmoteGPT:从自然语言描述生成3D人类面部表情

Haoran Wang, Mohit Mendiratta, Christian Theobalt, Adam Kortylewski

机构 * Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息研究所,萨尔兰信息学园区) CISPA Helmholtz Center for Information Security(亥姆霍兹信息安全中心)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 研究如何从文本精确控制3D面部表情,将其转化为3D可变形模型解缠参数空间中的回归问题。引入Txt2Emote数据集,提出EmoteGPT框架,经大规模数据增强训练,在表情识别等方面超越现有方法。

Comments Project page: https://genintel.github.io/EmoteGPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01737 2026-07-03 cs.CV 新提交 77%

ReQuest: Rethinking-based Question-Aware Frame Selection for Long-Form Video QA

ReQuest:基于重新思考的问题感知帧选择用于长视频问答

Minkuk Kim, Suyong Yun, Young Tae Kim, Jinyoung Moon, Jinwoo Choi, Seong Tae Kim

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 提出ReQuest,一种不确定性驱动的、问题自适应的关键帧选择方法,通过轻量级选择器、重新思考路由和不确定性引导的NMS,在固定token预算下提升长视频问答准确率。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23041 2026-07-03 cs.CV 新提交 77%

SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models

SPAR: 语义-像素自对齐与自适应路由的统一多模态模型

Hongxiang Li, Hongxu Chen, Chenyang Zhu, Xiaoshuang Huang, Jiayin Cai, Xiaolong Jiang, Yao Hu, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Xiaohongshu Inc.(小红书公司)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 提出SPAR框架,通过非对称双流统一分词器协调语义感知与像素重建,利用自对齐生成范式消除外部依赖,并引入动态令牌路由实现灵活多模态交互,在统一架构中达到生成、重建与视觉理解的最优性能。

Comments ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00816 2026-07-02 cs.CV 新提交 77%

Towards High-Resolution Visual Perception via Hierarchical Entity Exploration

通过层次化实体探索实现高分辨率视觉感知

Ziyu Ma, Shidong Yang, Yuxiang Ji, Yiming Hu, Tongwen Huang, Yong Wang, Jianfei Cai, Xiangxiang Chu

机构 * AMAP, Alibaba Group, China(阿里巴巴集团高德地图,中国) Monash University, Australia(莫纳什大学,澳大利亚)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 提出无训练、模型无关的层次化实体探索框架HEE,通过动态查询引导、双评分机制和置信度回溯,解决高分辨率图像中细粒度细节丢失问题,在多个基准上超越现有方法。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00338 2026-07-02 cs.CV 新提交 77%

DroneFINE: Domain-Aware Parameter-Efficient Fine-Tuning of Vision-Language Detectors for Drone Images

DroneFINE: 面向无人机图像的视觉-语言检测器的域感知参数高效微调

Ke Wu, Yanan Zhang, Yingjie Gao, Wenhao Li, Chenyu Zhou, XinZhu Ma, Jiaxin Chen, Di Huang

机构 * National College for Excellent Engineers, Beihang University, Beijing, China(北京航空航天大学优秀工程师学院) School of Computer Science and Engineering, Beihang University, Beijing, China(北京航空航天大学计算机科学与工程学院) School of Computer Science and Information Engineering, Hefei University of Technology, Hefei, China(合肥工业大学计算机科学与信息工程学院) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室) Innovation Center for Intelligent System Cognition and Decision-Making, Beijing, China(智能系统认知与决策创新中心) Information Science Academy of China Electronics Technology Group Corporation, Beijing, China(中国电子科技集团有限公司信息科学研究院)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 针对无人机图像与视觉语言模型预训练数据之间的域差异,提出包含HyperAdapter和SemanticGate的域感知参数高效微调方法,在减少可训练参数的同时达到与全微调相当的性能。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31924 2026-07-01 cs.CV 新提交 77%

InstanceControl: Controllable Complex Image Generation without Instance Labeling

InstanceControl: 无需实例标注的可控复杂图像生成

Xiaoyu Liu, Huan Wang, Fan Li, Zhixin Wang, Jiaqi Xu, Ming Liu, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) HUAWEI Noah’s Ark Lab(华为诺亚方舟实验室)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出InstanceControl方法,利用视觉语言模型自动建立文本与视觉条件间的实例对应,无需人工标注,通过自适应掩码细化策略实现复杂多实例场景的精确可控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21222 2026-06-23 cs.RO cs.AI 新提交 77%

FleetAgent: Teleoperation Assistant for Autonomous Fleets via Vectorized V2N Messages

FleetAgent: 通过向量化V2N消息实现自主车队远程操作助手

Juntong Peng, Qi Chen, Deyuan Qu, Takayuki Shimizu, Yaobin Chen, Ziran Wang

机构 * College of Engineering, Purdue University(普渡大学工程学院) Toyota InfoTech Labs(丰田信息技术实验室)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 提出FleetAgent,一种基于多模态大语言模型的云端助手,通过紧凑的向量化V2N消息实现高效远程操作监控,显著降低上行负载和内存占用,并提升操作员优先级判断与干预效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18780 2026-06-18 cs.CV cs.CL cs.MM 新提交 77%

SAMA: Semantic Anchor-aligned Augmentation for Unified Low-Resource Multimodal Information Extraction

SAMA:面向统一低资源多模态信息抽取的语义锚定对齐增强

Quanjiang Guo, Chong Mu, Jiazhou Pan, Ming Jia, Ling Tian, Hui Gao, Zhao Kang

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 提出语义锚定对齐增强框架SAMA,通过构建结构化语义锚引导多专家多模态大模型生成高保真文本,并利用锚保留扩散机制合成图像,结合双约束过滤模块,在低资源多模态信息抽取任务中显著提升性能。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14277 2026-06-15 cs.CV 新提交 77%

One Layer's Trash is Another Layer's Treasure: Adaptive Layer-wise Visual Token Selection in LVLMs

一层的垃圾是另一层的宝藏:LVLMs中自适应逐层视觉标记选择

Yongru Chen, Kai Zhang, Zeliang Zong, Yuchen Lu, Wenming Tan, Ye Ren, Jilin Hu

机构 * Hikvision Research Institute(海康威视研究院) Peking University(北京大学) East China Normal University(华东师范大学)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出自适应逐层视觉标记选择(ALVTS),通过轻量级选择器为不同层路由重要标记,实现高效压缩,在89%压缩率下保留96.7%精度。

Comments Accepted by CVPR 2026 (highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12072 2026-06-11 cs.CV 新提交 77%

World Model Self-Distillation: Training World Models to Solve General Tasks

世界模型自蒸馏:训练世界模型以解决通用任务

Sebastian Stapf, Pablo Acuaviva Huertos, Aram Davtyan, Paolo Favaro

机构 * Department of Computer Science(计算机科学系)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出结合自蒸馏与强化学习的框架,从预训练视频生成器中提取任务解决能力,无需配对任务视频,在基准测试中超越原始模型。

详情

展开后加载摘要…

URL PDF HTML 收藏