arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Tencent(腾讯)

2026-05-19 至 2026-05-19 共收录 12
2605.18733 2026-05-19 cs.CV

Advancing Narrative Long Video Generation via Training-Free Identity-Aware Memory

通过无训练的身份感知记忆推进叙事长视频生成

Jinzhuo Liu, Jiangning Zhang, Wencan Jiang, Yabiao Wang, Dingkang Liang, Zhucun Xue, Ran Yi, Yong Liu

机构 * Zhejiang University(浙江大学) Tencent Youtu Lab(腾讯云智实验室) Huazhong University of Science and Technology(华中科技大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出了一种无训练的身份感知记忆框架IAMFlow,通过显式建模和跟踪持久实体身份,实现一致的生成,同时引入NarraStream-Bench基准测试,在叙事流视频生成中取得最佳性能。

Comments Project page: https://eddie0521.github.io/projects/iamflow/ Code: https://github.com/Eddie0521/IAMFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18632 2026-05-19 cs.LG cs.AI

Position: Weight Space Should Be a First-Class Generative AI Modality

权重空间应成为一种第一类生成式AI模态

Zhangyang Wang, Peihao Wang, Kai Wang

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Tencent Hy(腾讯实验室)

AI总结 本文提出将模型检查点视为第一类数据模态,并主张在权重空间中进行生成式建模应成为机器学习的核心原始操作。通过最近的进展表明,神经网络权重可以按需合成,通常在减少适应成本的规模下达到微调性能。本文认为这些结果反映了权重空间中高性能模型占据的低维、高度结构化区域的结构事实。基于此观点,本文将现有方法组织成五阶段流程,调查该方法已实际应用的领域,并澄清当前限制:适配器规模和条件生成正在迅速发展,而无限制的前沿规模检查点合成仍处于开放状态。

Comments AI systems routinely improve or create other AI systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18577 2026-05-19 cs.CV

OmniPro: A Comprehensive Benchmark for Omni-Proactive Streaming Video Understanding

OmniPro: 一个全面的多模态流视频理解基准测试

Ruixiang Zhao, Jie Yang, Zijie Xin, Tianyi Wang, Fengyun Rao, Jing LYU, Xirong Li

机构 * Renmin University of China(中国人民大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)

AI总结 本文提出OmniPro基准测试,旨在评估多模态感知、主动响应和多样视频理解任务,通过2700个经人类验证的样本覆盖9个子任务和3个认知层次,揭示音频在流视频理解中的关键作用及模型在长时间任务中的鲁棒性问题。

Comments Project page: https://ruixiangzhao.github.io/OmniPro

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18328 2026-05-19 cs.CV

CineMatte: Background Matting for Virtual Production and Beyond

CineMatte:虚拟制作及其他场景的背景分割

Yuanjian He, Chen Zhang, Fasheng Chen, Jiangbo Cao

机构 * Online Video Business Unit, Tencent PCG Shenzhen, China(腾讯PCG深圳在线视频事业部)

AI总结 本文提出CineMatte,一种用于虚拟制作及其他场景的鲁棒背景分割框架。该方法采用交叉注意力条件设计,通过共享权重的冻结DINOv3 Vision Transformer编码输入帧和捕获的背景,并利用交叉注意力模块预测前景,从而保留预训练语义并提高对背景位移的鲁棒性。此外,还引入了CineMatte-4K数据集,包含4K HDR图像视频,为虚拟制作分割提供了首个非合成的数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18115 2026-05-19 cs.CV

WinTok: A Win-Win Hybrid Tokenizer via Decomposing Visual Understanding and Generation with Transferable Tokens

WinTok: 一种通过分解视觉理解和生成来实现双赢的混合分词器

Yiwei Guo, Shaobin Zhuang, Zhipeng Huang, Canmiao Fu, Chen Li, Jing Lyu, Yali Wang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) WeChat Vision, Tencent Inc.(腾讯微信视觉部) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出WinTok,一种通过分解视觉理解和生成任务来实现双赢的混合分词器,通过引入可迁移的语义分词来减少跨任务干扰,从而在多个基准测试中提升了重建、理解和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17834 2026-05-19 cs.CV

Stabilizing, Scaling & Enhancing MeanFlow for Large-scale Diffusion Distillation

稳定、扩展与增强MeanFlow用于大规模扩散蒸馏

Xiao He, Yang Li, Peizhen Zhang, Songtao Liu, Zhao Zhong, Nannan Wang

机构 * State Key Laboratory of Integrated Services Networks(信息服务网络国家重点实验室) Xidian University(西安电子科技大学) Tencent Hunyuan(腾讯文英)

AI总结 本文提出了一种稳定MeanFlow的方法,通过引入暖启动技术并结合轨迹分布对齐,提高了大规模工业模型蒸馏的性能和泛化能力。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17583 2026-05-19 cs.CV

AgentSteerTTS: A Multi-Agent Closed-Loop Framework for Composite-Instruction Text-to-Speech

AgentSteerTTS: 一个用于复合指令文本到语音的多智能体闭环框架

Bin Kang, Shaoguo Wen, Yang Fan, Shunlong Wu, Junjie Wang, Yulin Li, Junzhi Zhao, Junle Wang, Zhuotao Tian

机构 * University of Chinese Academy of Sciences(中国科学院大学) Shenzhen Loop Area Institute(深圳河套学院) Tencent Turinglab(腾讯人工智能实验室) Tsinghua University(清华大学) Southwest Jiaotong University(西南交通大学)

AI总结 本文提出AgentSteerTTS,一个多智能体闭环框架,通过引入对抗解耦代理、双流锚定控制器和快速-慢反馈代理,实现了对复合指令的意图忠实表达控制,实验表明其在复合指令基准和公开测试集上显著提升了性能。

Comments Project page: https://kane2kang.github.io/AgentSteerTTS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12687 2026-05-19 cs.LG cs.AI

Trust the uncertain teacher: distilling dark knowledge via calibrated uncertainty

信任不确定的教师:通过校准的不确定性提炼暗知识

Jeonghyun Kim, SooKyung Kim, Richeng Xuan, Hyunsoo Cho

机构 * Ewha Womans University(成均馆大学) Tencent(腾讯)

AI总结 本文提出校准不确定性提炼(CUD)框架,通过从分布角度重新审视知识蒸馏,使暗知识更忠实地被访问。CUD鼓励教师在有信息的地方揭示不确定性,并引导学生学习校准而非锐化确定性,从而在易例中获益于自信信号,在难例中获益于结构化不确定性,提升了学生在分布偏移和长尾输入上的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23994 2026-05-19 cs.SD cs.AI

PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation

PhyAVBench: 一个具有挑战性的音频物理敏感性基准,用于物理基础的文本到音频视频生成

Tianxin Xie, Wentao Lei, Kai Jiang, Guanjie Huang, Pengfei Zhang, Chunhui Zhang, Fengji Ma, Haoyu He, Han Zhang, Jiangshan He, Jinting Wang, Linghan Fang, Lufei Gao, Orkesh Ablet, Peihua Zhang, Ruolin Hu, Shengyu Li, Weilin Lin, Xiaoyang Feng, Xinyue Yang, Yan Rong, Yanyun Wang, Zihang Shao, Zelin Zhao, Chenxing Li, Shan Yang, Wenfu Wang, Meng Yu, Dong Yu, Li Liu

机构 * HKUST(GZ)(香港科技大学(广州)) Tencent(腾讯)

AI总结 本文提出PhyAVBench,一个用于评估文本到音频视频生成、图像到音频视频生成和视频到音频生成模型中音频-物理基础能力的基准,通过引入新的数据集和评估方法,揭示了当前模型在物理合理音频生成方面的不足。

Comments 6 major physical dimensions, 41 fine-grained test points, 337 groups of variable-controlled test samples, 11,605 newly recorded videos

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19320 2026-05-19 cs.CV

SteadyDancer: Harmonized and Coherent Human Image Animation with First-Frame Preservation

SteadyDancer: 一种具有第一帧保留的和谐且一致的人像图像动画方法

Jiaming Zhang, Shengming Cao, Rui Li, Xiaotong Zhao, Yutao Cui, Xinglin Hou, Gangshan Wu, Haolan Chen, Yu Xu, Limin Wang, Kai Ma

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) Platform and Content Group (PCG), Tencent(腾讯平台与内容部) Shanghai AI Lab(上海人工智能实验室)

AI总结 本文提出SteadyDancer,一种基于图像到视频(I2V)范式的框架,通过条件协调机制、协同姿态调节模块和分阶段解耦目标训练管道,实现了和谐一致的人像动画,并首次确保第一帧的鲁棒保留。

Comments 10 pages, with supp

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18822 2026-05-19 cs.CV

SAM 2++: Tracking Anything at Any Granularity

SAM 2++: 任意粒度下的任意目标跟踪

Jiaming Zhang, Cheng Liang, Yichun Yang, Chenkai Zeng, Yutao Cui, Xinwen Zhang, Xin Zhou, Kai Ma, Gangshan Wu, Limin Wang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Tencent(腾讯) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 本文提出SAM 2++框架,通过统一的提示编码、输出解码和记忆表示设计,实现了对不同粒度的目标状态(如掩码、框和点)的统一跟踪,同时引入Tracking-Any-Granularity数据集以提升统一跟踪模型的训练和评估效果。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.11675 2026-05-19 cs.CV

ReBaR: Reference-Based Reasoning for Robust Pose Estimation from Monocular Images

ReBaR:基于参考的鲁棒单目图像姿态估计

Yongkang Cheng, Mingjiang Liang, Jifeng Ning, Gaoge Han, Wei Liu, Shaoli Huang

机构 * College of Information Engineering Northwest A\&F University(西北农林科技大学信息工程学院) University of Technology Sydney(悉尼技术大学) Tencent AI Lab(腾讯人工智能实验室) City University of Hong Kong(香港城市大学)

AI总结 本文提出ReBaR方法,通过学习参考特征来解决遮挡和深度模糊问题,实现从单目图像中鲁棒的人体姿态和形状估计。

Comments Accepted by Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏