VISA: Agentic Self-Evolving Data Synthesis for Multimodal Instruction Following
VISA:用于多模态指令遵循的智能体式自进化数据合成
机构 * vivo AI Lab(vivo AI实验室)
AI总结 VISA是一种智能体式自进化数据合成框架,通过自进化循环优化多模态指令合成,在MM-IFEval等基准上提升了多模态指令遵循性能。
大厂专区
VISA:用于多模态指令遵循的智能体式自进化数据合成
机构 * vivo AI Lab(vivo AI实验室)
AI总结 VISA是一种智能体式自进化数据合成框架,通过自进化循环优化多模态指令合成,在MM-IFEval等基准上提升了多模态指令遵循性能。
可核查的方案:基于验证器的可执行视频编辑开放权重规划器学习
机构 * School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)人工智能学院) ; vivo AI Lab(vivo AI实验室) ; University of the Chinese Academy of Sciences(中国科学院大学) ; Southeast University(东南大学) ; Peking University(北京大学) ; School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) ; Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来智能网络研究院) ; Guangdong Provincial Key Laboratory of Future Networks of Intelligence, CUHK-Shenzhen(香港中文大学(深圳)广东省未来智能网络重点实验室)
AI总结 针对可执行视频编辑规划问题,提出基于验证器的RefineCut及RefineCut-Evo方法,训练8B开放权重规划器,在基准上取得优于前沿模型的效果,代码与基准已公开。
Comments Accepted to the Main Conference of EMNLP '26
STA-VPT:时空对齐的视觉提示微调
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; vivo Mobile Communication Co., Ltd.(维沃移动通信有限公司) ; Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) ; Pengcheng Laboratory(鹏城实验室)
AI总结 针对现有视觉提示微调无法捕捉空间关系、缺乏细粒度提示能力的问题,提出时空对齐的视觉提示微调模型STA-VPT,通过空间/时空对齐的提示令牌实现个性化区域提示,提升提示性能。
Comments Extension to AAAI 2024, substantially revised version; added new experiments, expanded the methodology section
ReX-Shot:基于几何与相机基础生成的单图像重摄影
机构 * School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与工程学院) ; vivo Mobile Communication Co., Ltd.(维沃移动通信有限公司)
AI总结 ReX-Shot是首个从单图像联合控制视点、焦距和摄影效果的统一生成框架,通过几何与相机基础生成技术实现更优性能与近实时交互性,解决了现有方法的多因素控制局限
Comments Project page: https://ruiqi-nju.github.io/ReX-Shot/
DocPure:基于退化感知结构引导的小波调制的无提示统一文档复原
机构 * College of Computer Science and Artificial Intelligence, Wenzhou University(温州大学计算机与人工智能学院) ; AI Analytics Team, Nasdaq(纳斯达克人工智能分析团队) ; vivo Mobile Communication Co., Ltd(维沃移动通信有限公司) ; College of Engineering and Computer Science, The Australian National University(澳大利亚国立大学工程与计算机科学学院)
AI总结 本文提出无提示统一文档复原框架DocPure,通过退化感知结构自编码器与结构引导小波交互机制,在多类文档退化复原任务中实现优于现有方法的性能。
Comments 19 pages, 15 figures. Lingming Su and Wanglong Lu contributed equally to this work
HonestFace:基于单步扩散模型的诚实人脸复原方法
机构 * Shanghai Jiao Tong University(上海交通大学) ; vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)
AI总结 本研究提出基于单步扩散模型的HonestFace人脸复原方法,通过身份嵌入器、掩码人脸对齐等组件构建新数据集MultiRefCeleb-Test,其性能优于现有最优方法。
Comments Published at ACM MM 2026
SpatialAfford:教紧凑视觉语言模型(VLMs)关注何处与定位何处以实现 affordance
机构 * Zhejiang University(浙江大学) ; Vivo Mobile Communication Co., Ltd(维沃移动通信有限公司)
AI总结 SpatialAfford 是一个两阶段框架,通过空间注意力对齐和空间感知 GRPO,使紧凑 4B VLMs 在多个基准上的 affordance 定位性能优于更强的 7B+ 基线模型。
先恢复文本,后增强图像:基于字形结构引导的两阶段场景文本图像超分辨率
机构 * VCIP, CS, Nankai University(南开大学计算机科学与技术学院) ; vivo Mobile Communication Co. Ltd(vivo移动通信有限公司) ; SDS, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)信息科学与技术学院)
AI总结 TIGER通过两阶段框架先恢复文本再增强图像,利用字形结构引导实现场景文本图像超分辨率的高保真度与可读性提升。
Comments Project Page: https://tony-lowe.github.io/TIGER_project_page/ GitHub Repo: https://github.com/OpenVeraTeam/TiGeSR Huggingface Dataset: https://huggingface.co/datasets/mxluocv/UZ-ST Huggingface Weights: https://huggingface.co/mxluocv/TiGeSR
REGEN:用于从专家到通用模型蒸馏的离线强化学习的重放回收
机构 * vivo AI Lab(vivo人工智能实验室) ; Department of Computer Science, Sun Yat-Sen University(中山大学计算机科学系)
AI总结 针对大语言模型强化学习扩展的挑战,提出REGEN方法,通过回收重放记忆并运用离线强化学习算法训练通用模型,解耦训练过程,降低成本,在多任务上以低成本达类似准确率,还可能变革在线强化学习及扩展训练阶段。
VIPER:用于物理上合理的视频生成的视觉上下文物理推理
机构 * Zhejiang University(浙江大学) ; vivo Mobile Communication Co., Ltd.(维沃移动通信有限公司)
AI总结 研究针对视频生成模型控制物理行为难的问题,提出VIPER框架,利用多模态大语言模型提取物理线索,通过分层训练引导图像到视频生成器,构建VIPER-19K数据集,实验证明该框架能实现物理行为转移且效果良好。
Comments tech report
MagicMakeup:用于高保真妆容转移的区域可控扩散Transformer
机构 * Zhejiang University(浙江大学) ; State Key Lab of CAD&CG(计算机辅助设计与图形学国家重点实验室) ; vivo Mobile Communication Co., Ltd.(维沃移动通信有限公司) ; vivo BlueImage Lab(vivo蓝图像实验室)
AI总结 研究妆容转移中区域可控性等难题,提出MagicMakeup框架,基于空间约束和概念解缠结,用令牌对齐区域门控和跨模态感知指导实现精确编辑与概念澄清,设计数据生成管道并建立基准,提升了多方面性能和鲁棒性。
CoVStream: 面向长视频流的边缘-云协作理解
机构 * The State Key Lab of Brain-Machine Intelligence, Zhejiang University(浙江大学脑机智能国家重点实验室) ; vivo Mobile Communication Co., Ltd., Shenzhen, China(深圳 vivo 通信有限公司)
AI总结 提出边缘-云协作框架CoVStream,边缘节点将视频流压缩为视觉特征和语义描述传输至云端,云服务器构建实体图与全局视觉上下文,仅在用户查询时激活大模型,在LVBench上带宽降低87.6%且准确率保持99.2%。
Comments 9 pages
TinySR:剪枝扩散模型用于现实世界图像超分辨率
机构 * Zhejiang University(浙江大学) ; Vivo Mobile Communication Co. Ltd(沃伊通信有限公司) ; Zhejiang Lab(浙江实验室)
AI总结 本文提出TinySR,一种针对现实世界图像超分辨率的紧凑高效扩散模型,通过动态块激活和扩展-腐蚀策略实现实时性能与高质量输出,相比教师模型TSD-SR在计算成本和参数量上分别减少5.68倍和83%。
Moebius: 0.2B轻量级图像修复框架,性能达10B级别
机构 * Huazhong University of Science and Technology(华中科技大学) ; VIVO AI Lab(VIVO人工智能实验室)
AI总结 提出Moebius轻量级图像修复框架,通过局部-λ混合交互模块和自适应多粒度蒸馏策略,以0.22B参数实现与10B级模型FLUX.1-Fill-Dev相当甚至更优的生成质量,推理速度提升15倍以上。
基于最小充分表示学习的大语言模型领域特定数据合成
机构 * vivo AI Lab(vivo人工智能实验室) ; Ant Group(蚂蚁集团) ; Zhejiang University(浙江大学)
AI总结 提出DOMINO框架,通过对比解耦学习最小充分领域表示,指导生成领域对齐的合成数据,在隐式领域定义下提升微调性能。
Comments Accepted by KDD 2026
GeoSVG-RL:面向布局约束的文本到SVG图表生成的几何感知强化学习
机构 * University of California, Merced(加州大学梅尔德分校) ; The University of Queensland(昆士兰大学) ; vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司)
AI总结 提出GeoSVG-RL框架,通过强化学习优化策略,利用几何反馈奖励(渲染有效性、画布适配、锚点放置、文本包含、图一致性和代码整洁性)解决文本到SVG图表生成中的结构脆弱性问题,显著提升箭头锚点精度和文本框内率。
C$^2$FG: 通过分数差异分析实现控制分类器无关引导
机构 * Shanghai Jiao Tong University(上海交通大学) ; vivo BlueImage Lab(vivo 蓝影实验室) ; vivo Mobile Communication Co., Ltd.(vivo 通信有限公司)
AI总结 本文提出C$^2$FG,一种基于分数差异分析的控制分类器无关引导方法,通过严格理论分析建立了条件分布与无条件分布在不同时间步的分数差异上界,从而为时间依赖引导提供了理论基础,并通过实验验证了其在多种生成任务中的有效性。
Comments Accepted to CVPR 2026 (Highlight)
EchoSR: 为轻量图像超分辨率实现高效的上下文利用
机构 * College of Computer Science and Artificial Intelligence, Wenzhou University, Wenzhou 325000, China(温州大学计算机科学与人工智能学院) ; vivo BlueImage Lab, vivo Mobile Communication Co., Ltd, Shanghai 200100, China(vivo蓝影实验室,vivo移动通信有限公司,上海200100,中国) ; College of Engineering and Computer Science, Australian National University, Canberra, Australia(工程与计算机科学学院,澳大利亚国立大学,堪培拉,澳大利亚) ; The AI/Analytics Team, Nasdaq, St. John’s, Canada(AI/分析团队,纳斯达克,圣约翰,加拿大)
AI总结 本文提出EchoSR框架,通过统一多尺度感受野建模和层次化上下文融合,提升了轻量图像超分辨率的效率和效果,同时在多个基准上优于现有方法,并实现了约两倍的速度提升。
Comments Accepted by Information Fusion; 20 pages, 17 figures
RaPD:通过语义增强的隐式表示实现分辨率无关的像素扩散
机构 * College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) ; vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司) ; Nanjing University(南京大学)
AI总结 RaPD通过语义表示引导和坐标查询注意力渲染器,在连续神经图像场的潜在空间中实现分辨率无关的像素扩散,解决了重建与生成之间的差距,提升了生成质量和分辨率扩展能力。
Octopus:无历史梯度正交化用于多模态大语言模型中的持续学习
机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能大模型关键实验室,人工智能研究院,上海交通大学) ; vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司)
AI总结 Octopus提出一种基于无历史梯度正交化的方法,通过两阶段微调策略平衡持续学习中的可塑性与稳定性,实验表明其在UCIT数据集上性能优于现有最佳方法。
HDRFace: 重新思考高维表示下的面部修复
机构 * City University of Hong Kong(香港城市大学) ; vivo BlueImage Lab, vivo Mobile Communication Co., Ltd(vivo蓝影实验室,vivo移动通信有限公司)
AI总结 本文提出HDRFace框架,通过注入语义丰富的先验知识提升面部修复效果,采用高维特征编码器提取细粒度面部表示,并引入SDFM机制平衡结构一致性和细节保真度。
深度概率展开用于量化压缩感知
机构 * Westlake University, School of Engineering, Hangzhou, Zhejiang, China(西湖大学工程学院,杭州,浙江,中国) ; Vivo Mobile Communication Co., Ltd., Hangzhou, Zhejiang, China(Vivo移动通信有限公司,杭州,浙江,中国)
AI总结 本文提出深度概率展开模型,通过展开框架提升重建精度和效率,采用闭式概率梯度投影替代传统L2投影,设计双域Mamba模块融合多尺度特征,实验证明其在量化压缩感知中的优越性能。
通过扩散框架实现逼真且高效的bokeh渲染
机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) ; vivo BlueImage Lab, vivo Mobile Communication Co., Ltd.(vivo BlueImage实验室,vivo移动通信有限公司) ; Shenzhen University of Advanced Technology(深圳大学)
AI总结 本文提出MagicBokeh框架,通过替代训练策略和聚焦感知的掩码注意力机制,联合优化bokeh渲染与超分辨率,提升可控性和视觉保真度,并引入降质感知深度模块以提高低质量输入的深度估计准确性。
Comments Accepted by CVPR 2026
EditRefiner:一种对齐人类的代理框架用于图像编辑细化
机构 * Shanghai Jiao Tong University(上海交通大学) ; Vivo Mobile Communication Co., Ltd(Vivo移动通信有限公司) ; University of Electronic Science and Technology of China(电子科学与技术大学)
AI总结 本文提出EditRefiner,一种对齐人类的代理框架,通过人类反馈数据集改进图像编辑的细粒度问题,通过感知-推理-行动-评估循环提升编辑质量。
视觉文本压缩作为度量传输
机构 * University of Alberta(阿尔伯塔大学) ; vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) ; Tsinghua University(清华大学)
AI总结 本文通过度量传输理论分析视觉文本压缩,提出无标签路由准则和传输感知聚焦机制,提升压缩效率并优化下游任务表现。
SOLAR-RL:半在线长 horizon 分配强化学习
机构 * vivo AI Lab(vivo人工智能实验室) ; Zhejiang Lab(浙江实验室) ; CUHK MMLab(香港大学多模态实验室) ; Hubei University(湖北省大学) ; Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)
AI总结 SOLAR-RL通过整合全局轨迹信息到离线学习中,提升GUI任务的长horizon完成率和鲁棒性,提供高效样本利用的自主导航方案。
Comments 14 pages, 11 figures. Accepted to Findings of the Association for Computational Linguistics: ACL 2026
SmartPhotoCrafter: 统一推理、生成与优化用于自动摄影图像编辑
机构 * vivo BlueImage Lab, vivo Mobile Communication Co., Ltd.(vivo蓝影实验室,vivo移动通信有限公司)
AI总结 本文提出SmartPhotoCrafter,通过统一推理生成过程实现自动摄影图像编辑,提升图像质量与美观,无需人工指令。
Comments tech report
先caption,后VQA:知识密度而非任务格式驱动多模态扩展
机构 * vivo AI Lab(vivo人工智能实验室) ; Wuhan University(武汉大学)
AI总结 研究发现,多模态模型扩展的关键瓶颈在于训练数据的知识密度而非任务格式,通过结构化caption增强和跨模态知识注入可提升模型性能,表明当前多模态模型因训练数据知识覆盖不足而难以扩展。
Comments 23 pages, 4 figures, 10 tables. Preprint
MAS-Bench:一种统一的快捷键增强混合移动GUI代理基准测试
机构 * Zhejiang University(浙江大学) ; vivo AI Lab(vivo AI实验室) ; Peking University(北京大学)
AI总结 本文提出MAS-Bench,用于评估结合GUI和快捷键的混合移动自动化代理,包含139个任务和9个评估指标,实验显示混合代理在效率上优于纯GUI代理。
Skill-SD:基于多轮LLM代理的技能条件自蒸馏
机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) ; The Chinese University of Hong Kong(香港中文大学) ; University of Science and Technology of China(中国科学技术大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; vivo AI Lab(vivo AI实验室)
AI总结 Skill-SD通过将代理自身轨迹转化为动态训练监督,结合重要加权反KL损失稳定训练,提升多轮LLM代理性能,实验显示优于标准RL和OPD方法。
Comments Project page: https://k1xe.github.io/skill-sd/