arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Tencent(腾讯)

2026-04-13 至 2026-04-13 共收录 6
2512.21334 2026-04-13 cs.CV

Streaming Video Instruction Tuning

流式视频指令微调

Jiaer Xia, Peixian Chen, Mengdan Zhang, Xing Sun, Kaiyang Zhou

机构 * Hong Kong Baptist University(香港浸会大学) Tencent Youtu Lab(腾讯优图实验室)

AI总结 本文提出Streamo,一个实时流式视频大语言模型,能执行多种视频任务,如实时叙述、动作理解等。通过大规模指令遵循数据集训练,Streamo在时间推理和多任务处理上表现优异,填补了离线视频模型与实时多模态助手之间的差距。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09201 2026-04-13 cs.CV

CT-1: Vision-Language-Camera Models Transfer Spatial Reasoning Knowledge to Camera-Controllable Video Generation

CT-1:视觉-语言-相机模型将空间推理知识转移到相机可控的视频生成

Haoyu Zhao, Zihao Zhang, Jiaxi Gu, Haoran Chen, Qingping Zheng, Pin Tang, Yeyin Jin, Yuang Zhang, Junqi Cheng, Zenghui Lu, Peng Shu, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Tencent(腾讯) Xiamen University(厦门大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出CT-1模型,通过准确估计相机轨迹将空间推理知识转移到视频生成中,利用小波正则化损失和视频扩散模型提升相机控制精度,实验显示其生成的视频质量高且控制准确率提升25.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08921 2026-04-13 cs.CV

TAIHRI: Task-Aware 3D Human Keypoints Localization for Close-Range Human-Robot Interaction

TAIHRI:面向近距离人机交互的任务感知3D人体关键点定位

Ao Li, Yonggen Ling, Yiyang Lin, Yuji Wang, Yong Deng, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Tencent Robotics X(腾讯机器人实验室X) Futian Laboratory(福田实验室)

AI总结 TAIHRI是首个针对近距离人机交互的视觉-语言模型,通过任务感知的3D关键点定位实现人机交互中的精准空间定位,提升机器人对任务相关身体部位的识别与响应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08915 2026-04-13 cs.CV cs.AI

Large-Scale Universal Defect Generation: Foundation Models and Datasets

大规模通用缺陷生成:基础模型与数据集

Yuanting Fan, Jun Liu, Bin-Bin Gao, Xiaochen Chen, Yuhuan Lin, Zhewei Dai, Jiawei Zhan, Chengjie Wang

机构 * Tencent Youtu Lab, Shenzhen, China(腾讯优图实验室,深圳,中国)

AI总结 本文提出UniDG模型和UDG数据集,通过参考基和文本指令生成缺陷,提升缺陷生成的多样性和真实性,实验表明其在异常检测和定位任务中表现优异。

Comments 25 pages, 13 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05072 2026-04-13 cs.LG

Hierarchical SVG Tokenization: Learning Compact Visual Programs for Scalable Vector Graphics Modeling

分层SVG标记化:为可扩展矢量图形建模学习紧凑的视觉程序

Ximing Xing, Ziteng Xue, Zhenxi Li, Weicong Liang, Linqing Wang, Zhantao Yang, Tiankai Hang, Zijin Yin, Qinglin Lu, Chunyu Wang, Qian Yu

机构 * Tencent(腾讯) Visual Computing Group, Beijing(北京视觉计算组)

AI总结 本文提出HiVG框架,通过分层标记化提升矢量图形生成的序列效率与空间一致性,解决传统标记化方法在几何结构表达上的不足。

Comments Homepage: https://hy-hivg.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17667 2026-04-13 cs.IR cs.CV cs.LG

When & How to Write for Personalized Demand-aware Query Rewriting in Video Search

何时及如何为个性化需求感知的视频搜索查询重写编写

Cheng cheng, Chenxing Wang, Aolin Li, Haijun Wu, Huiyun Hu, Juyuan Wang

机构 * Weixin Group, Tencent(腾讯微信事业群)

AI总结 本文提出WeWrite框架,通过自动化后验挖掘策略、混合训练范式和并行'假召回'架构,提升视频搜索查询重写效果,提高点击视频量1.07%并降低查询重写率2.97%。

详情

展开后加载摘要…

URL PDF HTML 收藏