arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Tencent(腾讯)

2026-05-20 至 2026-05-20 共收录 12
2605.20035 2026-05-20 cs.CV

Stage-adaptive Token Selection for Efficient Omni-modal LLMs

面向高效多模态大语言模型的阶段自适应令牌选择

Zijie Xin, Jie Yang, Ruixiang Zhao, Tianyi Wang, Fengyun Rao, Jing Lyu, Xirong Li

机构 * Renmin University of China(中国人民大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)

AI总结 本文提出SEATS方法,通过阶段自适应的令牌选择技术,有效提升多模态大语言模型的推理效率,在保留96.3%原始性能的同时,实现9.3倍的FLOPs减少和4.8倍的prefill加速。

Comments Code Link: https://github.com/xxayt/SEATS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19995 2026-05-20 cs.CV

CogOmniControl: Reasoning-Driven Controllable Video Generation via Creative Intent Cognition

CogOmniControl: 通过创意意图认知实现推理驱动的可控视频生成

Hongji Yang, Songlian Li, Yucheng Zhou, Xiaotong Zhao, Alan Zhao, Chengzhong Xu, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学SKL-IOTSC、CIS实验室) Online-Video BU, Tencent(腾讯在线视频事业部)

AI总结 本文提出CogOmniControl框架,通过将可控视频生成分解为创意意图认知和生成两个阶段,利用专门训练的CogVLM生成更专业清晰的输出,并通过强化学习对齐不同条件的控制,最终在两个基准测试中超越现有开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19950 2026-05-20 cs.CV

AffectVerse: Emotional World Models for Multimodal Affective Computing

AffectVerse: 多模态情感计算中的情感世界模型

Bo Zhao, Fanghua Ye, Yixin Ji, Sicheng Zhao, Xiaojiang Peng, Zitong YU

机构 * Great Bay University(大湾大学) Tencent(腾讯) Tsinghua University(清华大学) Shenzhen Technology University(深圳技术大学)

AI总结 本研究提出AffectVerse,一种基于Qwen2.5-Omni的多模态情感计算模型,通过引入情感世界模块实现短期潜在情感预测,利用未来预测作为自监督信号,提高了情感计算的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19727 2026-05-20 cs.CV

Tango3D: Towards Alignment for Global and Local 2D-3D Correspondence

Tango3D: 向全局和局部2D-3D对应关系对齐迈进

Zebin He, Mingxin Yang, Shuhui Yang, Hanxiao Sun, Xintong Han, Chunchao Guo, Wenhan Luo

机构 * HKUST(香港科技大学) Tencent Hunyuan(腾讯混元)

AI总结 本文提出Tango3D,一种统一密集对应和全局检索的3D基础模型,通过几何感知的2D视觉骨干网络和预训练的3D VAE将图像编码为2D片段,点云编码为3D标记,并映射到共享空间以实现局部像素-点对齐和全局语义对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19597 2026-05-20 cs.CL

LLMEval-Logic: A Solver-Verified Chinese Benchmark for Logical Reasoning of LLMs with Adversarial Hardening

LLMEval-Logic: 一个验证求解器的中文逻辑推理基准,具有对抗性强化

Ming Zhang, Qiyuan Peng, Yinxi Wei, Yujiong Shen, Kexin Tan, Yuhui Wang, Zhenghao Xiang, Junjie Ye, Zhangyue Yin, Zhiheng Xi, Shihan Dou, Tao Gui, Maxm Pan, Ruizhi Yang, Qi Zhang, Xuanjing Huang

机构 * Institute of Trustworthy Embodied Artificial Intelligence(可信具身人工智能研究院) Fudan University(复旦大学) Hunyuan Team Tencent(腾讯 Hunyuan 团队) School of Philosophy Fudan University(复旦大学哲学学院)

AI总结 本文提出LLMEval-Logic,一个基于真实情境场景的中文逻辑推理基准,通过作者和专家共同审核自然语言项目及其形式化参考,利用Z3验证注释答案,构建自然到形式的评分标准,并通过闭环对抗流程强化选定项目。基准包含246个基础项目和190个难度项目,评估14个前沿LLM显示当前模型存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19523 2026-05-20 cs.CL cs.AI cs.CV

Investigating Cross-Modal Skill Injection: Scenarios, Methods, and Hyperparameters

探究跨模态技能注入:场景、方法与超参数

Zhiyu Xu, Lean Wang, Yuanxin Liu, Lei Li, Hao Zhou, Fandong Meng, Jie Zhou, Xu Sun

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) WeChat AI, Tencent Inc., China(腾讯公司,中国) The University of Hong Kong(香港大学)

AI总结 本文研究了跨模态技能注入在不同场景下的表现,分析了其方法和超参数的影响,发现其在指令遵循和跨语言任务中表现良好,但在数学推理中存在困难,同时指出经典方法如TA和DARE在性能上优于其他融合方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19522 2026-05-20 cs.CV

iDiff: Interpretable Difference-aware Framework for Pairwise Image Quality Assessment

iDiff:用于成对图像质量评估的可解释差异感知框架

Xinli Yue, JianHui Sun, Tao Shao, Liangchao Yao, Fan Xia, Yuetang Deng

机构 * Tencent(腾讯)

AI总结 本文提出iDiff框架,通过双分支设计结合可解释的差异建模和结构化多模态推理,提升成对图像质量评估的鲁棒性和可解释性,并在NTIRE 2026 RAIM挑战中取得第一名。

Comments Accepted to CVPR 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15186 2026-05-20 cs.CV cs.AI

VGGT-Edit: Feed-forward Native 3D Scene Editing with Residual Field Prediction

VGGT-Edit:基于残差场预测的前馈原生3D场景编辑

Kaixin Zhu, Yiwen Tang, Yifan Yang, Renrui Zhang, Bohan Zeng, Ziyu Guo, Ruichuan An, Zhou Liu, Qizhi Chen, Delin Qu, Jaehong Yoon, Wentao Zhang

机构 * Peking University(北京大学) Tencent(腾讯) The Chinese University of Hong Kong(香港中文大学) Shanghai AI Lab(上海人工智能实验室) NTU Singapore(新加坡国立大学) Zhongguancun Academy(中关村学院) Beijing Key Lab of Data Intel. & Security (PKU)(北京数据智能与安全实验室(北京大学))

AI总结 本文提出VGGT-Edit,一种基于文本条件的前馈原生3D场景编辑框架,通过引入深度同步文本注入和残差变换头,实现高质量的3D场景编辑,同时构建DeltaScene数据集以提升编辑效果和推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07379 2026-05-20 cs.CV cs.AI

RELO: Reinforcement Learning to Localize for Visual Object Tracking

RELO:用于视觉目标跟踪的强化学习定位

Xin Chen, Chuanyu Sun, Jiao Xu, Houwen Peng, Dong Wang, Huchuan Lu, Kede Ma

机构 * City University of Hong Kong(香港城市大学) Hunyuan Team, Tencent(腾讯文心团队) Dalian University of Technology(大连理工大学)

AI总结 本文提出RELO方法,通过将目标定位建模为马尔可夫决策过程,利用强化学习替代传统手工设计的空间先验,以提升跟踪性能和一致性。

Comments ICML 2026 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17237 2026-05-20 cs.IR cs.AI

HeadRank: Decoding-Free Passage Reranking via Preference-Aligned Attention Heads

HeadRank: 通过偏好对齐的注意力头实现无需解码的段落重排序

Juyuan Wang, Chenxing Wang, Yuchen Fang, Huiyun Hu, Junwu Du, Aolin Li, Shunlin Rong, Haijun Wu, Jin Xu, Ligang Liu, Dongliang Liao

机构 * Weixin Group, Tencent, China(腾讯微信集团,中国) South China University of Technology, Guangzhou, China(华南理工大学,广州,中国)

AI总结 本文提出HeadRank框架,通过熵正则化的头部选择、硬相邻级偏好对和分布正则化,在连续注意力域中提升偏好优化,从而在无需解码的情况下实现高效的段落重排序,其在多个基准测试中均取得最佳的平均NDCG@10成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21196 2026-05-20 cs.LG cs.CV

Differential-Integral Neural Operator for Long-Term Turbulence Forecasting

微分-积分神经算子用于长期湍流预测

Hao Wu, Yuan Gao, Fan Xu, Fan Zhang, Qingsong Wen, Kun Wang, Xiaomeng Huang, Xian Wu

机构 * Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学) Tencent(腾讯)

AI总结 本文提出了一种基于物理原理的微分-积分神经算子,通过并行分支学习不同的物理算子,以提高长期湍流预测的稳定性与鲁棒性,从而在2D Kolmogorov流基准测试中实现了更精确的预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18884 2026-05-20 cs.LG cs.CV

Navigating the Emotion Tree: Hierarchical Hyperbolic RAG for Multimodal Emotion Recognition

在情绪树中导航:用于多模态情绪识别的分层双曲RAG

Zeheng Wang, Bo Zhao, Yijie Zhu, Zhishu Liu, Hui Ma, Ruixin Zhang, Shouhong Ding, Qianyu Xie, Zitong Yu

机构 * Great Bay University(广东东莞大亚湾大学) Tencent Youtu Lab(腾讯优图实验室)

AI总结 本文提出HyperEmo-RAG,一种利用结构化情绪知识库的检索增强生成框架,通过双曲空间嵌入和证据图构建来提升多模态情绪识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏