arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5095 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5095 篇

2505.10946 2026-07-10 cs.IT cs.AI cs.LG eess.SP math.IT 版本更新 73%

ToDMA: Large Model-Driven Massive Token Communications for Semantic Multiple Access

ToDMA:用于语义多址接入的大模型驱动海量令牌通信

Li Qiao, Mahdi Boloursaz Mashhadi, Zhen Gao, Robert Schober, Deniz Gündüz

机构 * The University of Hong Kong(香港大学) Beijing Institute of Technology(北京理工大学) University of Surrey(Surrey大学) Friedrich-Alexander-University Erlangen-Nurnberg(埃森哲-亚琛工业大学) Imperial College London(伦敦帝国理工学院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ToDMA,一种大模型驱动的语义多址接入方案,将无源随机接入与上下文感知令牌处理结合,用于海量令牌通信。通过压缩感知检测令牌及估计信道状态信息,利用上下文模型恢复冲突令牌,能降低接入延迟并保持令牌恢复与语义重建质量。

Comments Submitted to IEEE journals

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04179 2026-07-07 cs.CV cs.AI 新提交 73%

CritiqueDriveVLM: From Verifier-Guided Reinforcement Learning to Latent Thought Distillation for Autonomous Driving

CritiqueDriveVLM:从验证器引导的强化学习到自动驾驶的潜在思想蒸馏

Zhaohong Liu, Hao Ye, Xianlin Zhang, Mengshi Qi

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) School of Digital Media & Design Arts(数字媒体与设计艺术学院) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 提出CritiqueDriveVLM框架解决自动驾驶中推理幻觉等问题,先通过验证器引导的强化学习培养强大教师模型,再用潜在思想蒸馏压缩能力到学生模型,提升性能并大幅降低推理延迟。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03143 2026-07-07 cs.CV cs.AI 新提交 73%

Text as Partial Constraint: Core-Residual Alignment for Robust Vision-Language Learning

文本作为部分约束:用于稳健视觉语言学习的核心-残差对齐

Chengzhen Yu, Canran Xiao, Siyuan Ma, Yang Liu

机构 * Nanyang Technological University (NTU)(南洋理工大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)

专题命中 VLM训练与架构 :LLaVA(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 针对自然字幕不明确致视觉语言对齐脆弱的问题,提出文本作为部分约束框架,以多视图字幕为不完全监督,提炼共识语义核心,降低相似度对未提及残差的依赖,提升视觉语言表征可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02542 2026-07-07 cs.AI cs.CV 新提交 73%

iFLYTEK-Embodied-Omni Technical Report

科大讯飞-具身全能技术报告

Yuan Zhang, Jingfei Ni, Guanchen Lu, Shiqi Zhang, Qingshan Xu, Chi Liu, Xin Nie, Wenjie Xu, Lin Gao, Zhiyuan Cheng, Mingxin Zhou, Jiajia Wu, Diyuan Liu, Jia Pan, Chao Ji

机构 * iFLYTEK LindenBot University of Science and Technology of China(中国科学技术大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 研究通用具身智能体,提出统一多模态基础模型iFLYTEK-Embodied-Omni,通过共享多模态自注意力联合建模视觉、语言和动作,结合多种数据构建数据集并采用四阶段策略训练,实现脑-小脑协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01813 2026-07-03 cs.CV cs.AI 新提交 73%

MMBench-Live: A Continuously Evolving Benchmark for Multimodal Models

MMBench-Live:一个持续演进的多模态模型基准

Yuanzhi Liu, Shousheng Zhao, Bo Zhou, Kongming Liang, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) PRIS-CV

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出MMBench-Live,一个通过多智能体自动化流水线构建的持续演进多模态基准,解决静态基准的时效性、数据污染和维护成本问题,采用分布一致性更新策略,每次更新成本约30美元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02546 2026-07-03 cs.CV cs.LG 版本更新 73%

RGB-Pointmap Pretraining for Unified 3D Scene Understanding

对比语言-彩色点图预训练用于统一3D场景理解

Ye Mao, Weixun Luo, Ranran Huang, Junpeng Jing, Krystian Mikolajczyk

机构 * Imperial College London(帝国理工学院伦敦分校)

专题命中 VLM训练与架构 :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.LG

AI总结 提出UniScene3D,一种基于Transformer的编码器,通过多视图彩色点图联合建模外观和几何,并引入跨视图几何对齐和接地视图对齐,在少样本和任务特定微调中达到SOTA。

Comments 19 Pages, ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00434 2026-07-02 cs.CV cs.LG 新提交 73%

Information-Regularized Attention for Visual-Centric Reasoning

信息正则化注意力用于以视觉为中心的推理

Guohao Sun, Xiaofang Wang, Yash Patel, Mengchen Liu, Zhiqiang Tao, Praveen Krishnan

机构 * FAIR at Meta(Meta 的 FAIR 部门) Rochester Institute of Technology(罗切斯特理工学院)

专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.LG

AI总结 针对视觉语言模型中的对象幻觉、视觉基础弱和灾难性遗忘问题,提出信息正则化注意力机制,通过随机注意力显式调控视觉信息注入,改善表示学习稳定性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31054 2026-07-01 cs.CV cs.AI cs.CL cs.MM 新提交 73%

ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs

ADAPT: 通过偏好调优实现注意力动态对齐以增强多模态大模型的忠实性

Zhiyuan Yao, Zheren Fu, Zhixiao Zheng, Jiajun Li, Yi Tu, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Technologies Ltd.(华为技术有限公司) State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民网传播内容认知国家重点实验室)

专题命中 VLM训练与架构 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 针对多模态大模型生成中的幻觉问题,提出ADAPT框架,通过跨注意力视觉锚点、注意力监督推理和视觉注意力引导DPO直接干预文本到图像的跨注意力动态,在多个基准上将幻觉率降低40%-60%。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23885 2026-06-24 cs.CV cs.AI cs.CL cs.MM 新提交 73%

Mind the Heads: Topological Representation Alignment for Multimodal LLMs

注意头:多模态大语言模型的拓扑表示对齐

Davide Caffagni, Alberto Compagnoni, Federico Melis, Sara Sarto, Pier Luigi Dovesi, Mark Granroth-Wilding, Marcella Cornia, Lorenzo Baraldi

机构 * University of Modena and Reggio Emilia(摩德纳和雷焦艾米利亚大学) University of Pisa(比萨大学) AMD Silo AI

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出头级表示对齐(HeRA)方法,在注意力头级别强制跨模态对齐,通过对比目标匹配局部拓扑结构,选择对齐最差的头进行训练,有效提升视觉任务性能并减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20506 2026-06-19 cs.CV cs.AI 新提交 73%

FreeStyle: Free Control of Style-Content Dual-Reference Generation from Community LoRA Mining

FreeStyle: 从社区LoRA挖掘中实现风格-内容双参考生成的自由控制

Jinghong Lan, Wei Cheng, Yunuo Chen, Ziqi Ye, Peng Xing, Yixiao Fang, Rui Wang, Yufeng Yang, Xuanyang Zhang, Xianfang Zeng, Difan Zou, Gang Yu, Chi Zhang

机构 * Fudan University(复旦大学) StepFun Westlake University(西湖大学) University of Hong Kong(香港大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出FreeStyle框架,利用社区LoRA作为锚点,通过两阶段课程学习(注意力级约束和频率感知RoPE调制)解决双参考生成中的内容泄露问题,并引入新基准和评估指标,实现风格对齐、内容保持与泄露抑制的平衡。

Comments 35 pages, 26figures. Project page: https://github.com/Blue2Giant/FreeStyle

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11615 2026-06-18 cs.CV cs.CR cs.LG 新提交 73%

Adv-TGD: Adversarial Text-Guided Diffusion for Face Recognition Impersonation Attacks

Adv-TGD:面向人脸识别冒充攻击的对抗性文本引导扩散

Omid Ahmadieh, Nima Karimian

机构 * University of South Florida, Bellini College of Artificial Intelligence, Cybersecurity and Computing(南佛罗里达大学贝利尼人工智能、网络安全与计算学院)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 提出Adv-TGD框架,利用Stable Diffusion和LoRA微调生成逼真对抗人脸,在保持视觉质量的同时实现高成功率身份冒充攻击,平均ASR达85.90%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17678 2026-06-17 cs.CV cs.AI 新提交 73%

See First, Answer Later: Visual Evidence Pre-Alignment via Sufficiency-Driven RL

先看后答:基于充分性驱动的强化学习实现视觉证据预对齐

Yilian Liu, Sicong Leng, Guoshun Nan, Junyi Zhu, Jiayu Huang, Minghao Sun, Xuancheng Zhu, Yisong Chen, Zexian Wei, Xiaofeng Tao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学) China Telecom(中国电信)

专题命中 VLM训练与架构 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出视觉证据预对齐(VEPA)方法,在预训练与后训练之间引入充分性驱动的GRPO优化,以增强多模态大模型对细粒度视觉证据的利用,显著提升视觉密集型任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16633 2026-06-16 cs.CV cs.AI 新提交 73%

DCP-Prune: Ultra-Low Token Pruning with Distribution Consistency Preservation

DCP-Prune:基于分布一致性保持的超低令牌剪枝

Xifeng Xue, Xiaokang Wang, Zirui Li, Ming-Ming Cheng, Guolei Sun

机构 * College of Computer Science, Nankai University(南开大学计算机学院) Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出DCP-Prune框架,通过锚点-上下文图恢复和文本感知令牌聚类选择,在超低令牌预算下保持分布一致性,实现稳定高性能。

Comments The code will be released at: https://github.com/EMVision-NK/DCP-Prune

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16353 2026-06-16 cs.CV cs.AI 新提交 73%

What Should a Streaming Video Model Remember?

流式视频模型应该记住什么?

Haonan Ge, Yiwei Wang, Hang Wu, Yujun Cai

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) University of California, Merced(加州大学默塞德分校) The University of Queensland(昆士兰大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 针对流式视频理解中固定记忆预算下的长程历史利用问题,提出选择性潜在记忆框架SelectStream,通过惊喜驱动自适应窗口、优先级保持合并和查询条件图推理三个机制,实现高效在线推理,在多个基准上取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16082 2026-06-16 cs.CV cs.AI 新提交 73%

Tool-IQA: Augmenting Image Quality Assessment with Simple Tools

Tool-IQA: 利用简单工具增强图像质量评估

Guanyi Qin, Junjie Zhang, Chunming He, Yibing Fu, Jie Liang, Tianhe Wu, Lei Zhang

机构 * National University of Singapore(新加坡国立大学) OPPO Research Institute(OPPO研究院) Nanyang Technical University(南洋理工大学) Duke University(杜克大学) City University of Hong Kong(香港城市大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出Tool-IQA,通过为视觉语言模型配备放大镜和伽马校正器等简单工具,将被动评分转变为工具增强的工作流程,显著提升图像质量评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13769 2026-06-16 cs.RO cs.CV cs.LG 新提交 73%

$μ_0$: A Scalable 3D Interaction-Trace World Model

$\mu_0$: 一种可扩展的3D交互轨迹世界模型

Seungjae Lee, Yoonkyo Jung, Jusuk Lee, Jonghun Shin, Amir Hossein Shahidzadeh, Yao-Chih Lee, H. Jin Kim, Jia-Bin Huang, Furong Huang

机构 * University of Maryland, College Park(马里兰大学帕克分校) Seoul National University(首尔大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 提出基于3D轨迹的可扩展世界模型$\mu_0$,通过预测交互点轨迹实现跨本体机器人学习,无需动作标签,性能媲美有监督模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14703 2026-06-15 cs.CV cs.CL cs.LG 新提交 73%

Gaze Heads: How VLMs Look at What They Describe

注视头:视觉语言模型如何观察它们所描述的内容

Rohit Gandikota, David Bau

机构 * Northeastern University(东北大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 发现视觉语言模型的语言骨干中存在一组“注视头”,其注意力跟踪当前描述的图像区域,通过干预这些头可精确控制模型描述内容,准确率达83.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04976 2026-06-15 cs.CV cs.AI 版本更新 73%

3D-RFT: Reinforcement Fine-Tuning for Video-based 3D Scene Understanding

3D-RFT:基于视频的3D场景理解的强化微调

Xiongkun Linghu, Jiangyong Huang, Baoxiong Jia, Siyuan Huang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 VLM训练与架构 :grounding(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 提出3D-RFT框架,将可验证奖励的强化学习(RLVR)扩展到视频3D感知与推理,通过直接优化评估指标(如3D IoU和F1分数)提升性能,4B模型超越8B模型。

Comments Accepted at ICML 2026. Project page: https://3d-rft.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12925 2026-06-12 cs.CV cs.LG 新提交 73%

Multi-Label Test-Time Adaptation with Bayesian Conditional Priors

基于贝叶斯条件先验的多标签测试时自适应

Qiru Li, Ao Zhou, Zhiwei Jiang, Zifeng Cheng, Cong Wang, Yafeng Yin, Qing Gu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.LG

AI总结 提出贝叶斯条件先验估计(BCP),一种无梯度的测试时自适应方法,通过在线估计锚定条件先验注入标签依赖性,提升冻结视觉语言模型在多标签识别中的分布偏移鲁棒性。

Comments accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12590 2026-06-12 cs.CV cs.AI 新提交 73%

Analyzing and Improving Fine-grained Preference Optimization in Medical LVLMs

分析与改进医学LVLMs中的细粒度偏好优化

Shayan Mohammadizadehsamakosh, Pritam Sarkar, Leonid Sigal, Ali Etemad, Elham Dolatabadi

机构 * York University(约克大学) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Queen’s University(女王大学)

专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 针对医学大视觉语言模型在事实一致性、视觉定位和临床对齐方面的不足,提出一种结合双向令牌级KL正则化和视觉对比定位目标的细粒度在线偏好优化框架,通过最小编辑模型输出构建偏好对,仅修正临床错误片段,显著提升诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11792 2026-06-12 cs.CV cs.AI cs.CL 新提交 73%

MultiToP: Learning to Patch Visual Tokens to Mitigate Hallucinations in Video Large Multimodal Models

MultiToP:学习修补视觉令牌以减轻视频大型多模态模型中的幻觉

Yuansheng Gao, Wenbin Xing, Jiahao Yuan, Kaiwen Zhou, Han Bao, Zonghui Wang, Wenzhi Chen

机构 * Zhejiang University(浙江大学) Sun Yat-sen University(中山大学) East China Normal University(华东师范大学)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出MultiToP框架,通过轻量级视觉令牌修补器动态替换不可靠视觉令牌,结合信息引导排名校准和稀疏正则化,在不修改原模型情况下减少视频多模态模型幻觉,显著提升F1分数和问答准确率。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12402 2026-06-11 cs.RO cs.AI cs.CV 新提交 73%

DIRECT: When and Where Should You Allocate Test-Time Compute in Embodied Planners?

DIRECT: 在具身规划器中何时何地分配测试时计算?

Jadelynn Dao, Milan Ganai, Yasmina Abukhadra, Ajay Sridhar, Mozhgan Nasr Azadani, Katie Luo, Clark Barrett, Jiajun Wu, Chelsea Finn, Marco Pavone

机构 * Stanford University(斯坦福大学) University of Waterloo(滑铁卢大学) NVIDIA(英伟达)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出DIRECT路由框架,根据多模态场景上下文按提示分配计算资源,优化成功-成本帕累托前沿,实验表明不同缩放轴带来不同能力增益,在物理机器人上以更低延迟匹配或超越更强模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11854 2026-06-11 cs.LG cs.AI cs.CL 新提交 73%

Fine-tuning Multi-modal LLMs with ART: Art-based Reinforcement Training

使用ART微调多模态大语言模型:基于艺术的强化训练

Michal Chudoba, Sergey Alyaev, Petra Galuscakova, Tomasz Wiktorski

机构 * University of Stavanger(斯塔万格大学) NORCE Research(NORCE研究机构)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG

AI总结 提出ART方法,通过优化原始视觉输入将信息注入冻结的多模态大语言模型,实现软提示微调,无需修改计算图,在数学和工具使用基准上达到与LoRA相当的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22725 2026-06-11 cs.CV cs.AI 版本更新 73%

OpenVTON-Bench: A Large-Scale High-Resolution Benchmark for Controllable Virtual Try-On Evaluation

OpenVTON-Bench:用于可控虚拟试穿评估的大规模高分辨率基准

Jin Li, Tao Chen, Kai Wen, Siqi Yin, Shuai Jiang, Weijie Wang, Jingwen Luo, Chenhui Wu

机构 * Renxing Intelligence, Hangzhou, China Hangzhou Dianzi University, Hangzhou, China(杭州电子科技大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出OpenVTON-Bench,包含约10万对高分辨率图像,通过DINOv3聚类和Gemini描述构建,并设计多模态评估协议,沿五个维度衡量试穿质量,与人类判断高度一致。

Comments Under review for the NeurIPS 2026 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10620 2026-06-10 cs.CV cs.AI 新提交 73%

Can Image Models Imagine Time? ImageTime: A Novel Benchmark for Probing Visual World Modeling Through Spatiotemporal Consistency

图像模型能想象时间吗?ImageTime:通过时空一致性探究视觉世界建模的新基准

Xinrui Wu, Lichen Huang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出ImageTime基准,通过四关键帧协议(初始状态、动作开始、过渡状态、最终状态)评估图像生成模型在时空一致性上的表现,揭示模型在维持连贯视觉世界状态方面的能力与不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10406 2026-06-10 cs.LG cs.AI 新提交 73%

FOGO: Forgetting-aware Orthogonalization Optimizer

FOGO:遗忘感知正交化优化器

Toan Nguyen, Yang Liu, Trung Le, Celso de Melo, Flora D. Salim

机构 * School of Computer Science and Engineering, University of New South Wales(新南威尔士大学计算机科学与工程学院) Department of Data Science & AI, Monash University(莫纳什大学数据科学与人工智能系) DEVCOM Army Research Laboratory(DEVCOM陆军研究实验室)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出FOGO优化器,通过谱正交化动量更新并利用紧凑码本记忆解决梯度干扰,在类别不平衡、持续学习和大模型微调等场景中提升收敛与知识保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06493 2026-06-10 cs.RO cs.AI cs.LG 版本更新 73%

HANDOFF: Humanoid Agentic Task-Space Whole-Body Control via Distilled Complementary Teachers

HANDOFF: 通过蒸馏互补教师实现人形机器人任务空间全身控制

Lizhi Yang, Junheng Li, Nehar Poddar, Yiling Hou, Gio Huh, Robert Griffin, Georgia Gkioxari, Aaron Ames

机构 * California Institute of Technology(加州理工学院) The Institute for Human & Machine Cognition(人机认知研究院)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出HANDOFF框架,通过多教师KL蒸馏和上下文门控机制,将全身运动跟踪、行走和跌倒恢复三个专家策略融合为混合专家学生策略,实现基于紧凑显式接口的全身控制,在Unitree G1上达到先进的速度跟踪性能并扩展了操作工作空间。

Comments 22 pages, 9 figures, Project page: https://lzyang2000.github.io/HANDOFF/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22574 2026-06-08 cs.CV cs.AI 版本更新 73%

Enhancing Video Representations with Spatiotemporal-Semantic Residual to Mitigate Hallucinations in Video Large Multimodal Models

增强视频表示中的时空语义残差以缓解视频大型多模态模型中的幻觉

Yuansheng Gao, Jinman Zhao, Tong Zhang, Xingguo Xu, Wenbin Xing, Han Bao, Zonghui Wang, Wenzhi Chen

机构 * Zhejiang University(浙江大学) University of Toronto(多伦多大学) Dalian University of Technology(大连理工大学) Sun Yat-sen University(中山大学)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出ViSSRes方法,通过轻量级MLP网络学习视频表示的残差,从时空和语义一致性优化,在推理时仅需单次前向传播,有效降低幻觉率并提升视频理解性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02576 2026-06-04 cs.CV cs.LG 73%

ProtoAda: Prototype-Guided Adaptive Adapter Expansion and Geometric Consolidation for Multimodal Continual Instruction Tuning

ProtoAda: 原型引导的自适应适配器扩展与几何整合用于多模态持续指令微调

Yu-Cheng Shi, Zhen-Hao Xie, Jun-Tao Tang, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室)

专题命中 VLM训练与架构 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 提出ProtoAda框架,通过格式感知任务原型和几何感知参数整合,解决多模态持续指令微调中任务路由错误和梯度干扰问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27391 2026-05-29 cs.CV cs.LG 73%

Modality Alignment across Trees on Heterogeneous Hyperbolic Manifolds

异质双曲流形上的树间模态对齐

Wei Wu, Xiaomeng Fan, Yuwei Wu, Zhi Gao, Pengxiang Li, Yunde Jia, Mehrtash Harandi

机构 * Beijing Key Laboratory of Intelligent Information Technology, School of Computer Science & Technology, Beijing Institute of Technology(北京智能信息科技重点实验室,计算机科学与技术学院,北京理工大学) Guangdong Laboratory of Machine Perception and Intelligent Computing, Shenzhen MSU-BIT University(广东机器感知与智能计算实验室,深圳MSU-BIT大学) Department of Electrical and Computer System Engineering, Monash University(电子与计算机系统工程系,墨尔本大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.LG

AI总结 提出一种在异质双曲流形上对齐图像和文本树状层次特征的方法,通过交叉注意力提取视觉层次特征、异质流形嵌入及KL距离度量学习中间流形,在开放集分类任务中优于基线。

Comments Published as a conference paper at ICLR 2026

Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026), Rio de Janeiro, Brazil, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏