arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Microsoft(微软)

2026-07-29 至 2026-07-29 共收录 3
2607.24904 2026-07-29 cs.CV cs.CL 新提交

Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model

Mage-VL:一种高效的编解码器原生流式多模态基础模型

Senqiao Yang, Kaichen Zhang, Zhaoyang Jia, Jinghao Guo, Yifei Shen, Xinjie Zhang, Xiaoyi Zhang, Haoqing Wang, Xiao Li, Peng Zhang, Xiang An, Yin Xie, Zhening Liu, Xun Guo, Jiahao Li, Shicheng Zheng, Jinglu Wang, Zongyu Guo, Wenxuan Xie, Zihan Zheng, Yuxuan Luo, Bin Li, Yan Lu

机构 * Microsoft(微软)

AI总结 研究针对标准视觉语言模型在流式感知任务的不足,提出Mage-VL。核心方法是用Mage-ViT选择性编码关键区域,减少视觉令牌消耗。该模型在多模态理解和交互上表现出色,推理速度加快,还有多项关键实证发现。

Comments Project page: https://microsoft.github.io/Mage

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24898 2026-07-29 cs.CV cs.AI 新提交

Harm is not Universal: Community-Specific Toxicity Detection is Urgently Needed

危害并非普遍存在:迫切需要针对特定社区的毒性检测

Xinnuo Xu, Anja Thieme, Daniela Massiceti, Ioana Tanase, Rita Marques, Melanie Fernandez Pradier, Martin Grayson, Camilla Longden, Cecily Morrison

机构 * Microsoft Research Cambridge, UK(英国剑桥微软研究院) Microsoft Paris, France(法国巴黎微软)

AI总结 研究指出文本到图像生成的通用毒性检测方法不能保护边缘化社区,主张特定社区毒性检测(CTD)。通过与专家合作制定指南,利用图像数据集实验表明现有模型表现不佳,基于提示的方法和参数高效微调可提升性能,但CTD性能仍远低于通用检测,需持续研究。

Comments 18 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06757 2026-07-29 cs.CV 版本更新

FlowInOne:Unifying Multimodal Generation as Image-in, Image-out Flow Matching

FlowInOne:将多模态生成统一为图像输入、图像输出的流匹配

Junchao Yi, Rui Zhao, Jiahao Tang, Weixian Lei, Linjie Li, Qisheng Su, Zhengyuan Yang, Lijuan Wang, Xiaofeng Zhu, Alex Jinpeng Wang

机构 * University of Electronic Science and Technology of China(电子科技大学) Central South University(中南大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Microsoft(微软)

AI总结 本文提出FlowInOne框架,将多模态生成统一为纯视觉流匹配,通过视觉提示消除跨模态对齐瓶颈,实现文本到图像生成、布局引导编辑和视觉指令遵循的统一。

Comments Accepted by ECCV 2026. 38 Pages, 21 Figures, 12 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏