Manifold-Aware Exploration for Reinforcement Learning in Video Generation
面向流形的探索用于视频生成的强化学习
机构 * Tencent Hunyuan(腾讯文脉)
AI总结 本文提出SAGE-GRPO方法,通过在微和宏观层面约束探索,确保在视频数据流形附近进行,提升视频生成的质量和奖励估计的可靠性。
Comments 17 pages, 12 figures
大厂专区
面向流形的探索用于视频生成的强化学习
机构 * Tencent Hunyuan(腾讯文脉)
AI总结 本文提出SAGE-GRPO方法,通过在微和宏观层面约束探索,确保在视频数据流形附近进行,提升视频生成的质量和奖励估计的可靠性。
Comments 17 pages, 12 figures
探究表格数据如何提升长上下文推理的可扩展性
机构 * Large Language Model Department, Tencent(腾讯大语言模型部门) ; Xi'an Jiaotong University, Xi'an, China(西安交通大学) ; Fudan University, Shanghai, China(复旦大学)
AI总结 本文研究表格数据对长上下文推理的增强作用,通过分析表格依赖结构揭示周期性非消失依赖,并提出TableLong框架提升推理能力,实验显示在多个基准上提升8.24%。
学习轨迹感知的多模态大语言模型用于视频推理分割
机构 * Southern University of Science and Technology(南方科技大学) ; Tencent YouTu Lab(腾讯优图实验室)
AI总结 本文提出TrajSeg框架,通过双向文本轨迹对齐提升视频对象轨迹感知能力,采用帧级内容整合模块和统一掩码解码器实现端到端训练,实验表明其在视频推理分割任务中优于现有方法。
DeepCompress:一种双奖励策略用于动态探索和压缩推理链
机构 * Tencent AI Lab(腾讯AI实验室)
AI总结 DeepCompress通过双奖励策略动态调整推理链长度,提升大推理模型的准确性和效率,实验显示在数学基准上表现优于基线方法。
Comments ICLR 2026
点在上下文:通过上下文学习理解点云
机构 * State Key Laboratory of General Artificial Intelligence(国家一般人工智能重点实验室) ; Peking University(北京大学) ; Shenzhen Graduate School(深圳研究生院) ; School of Intelligent Systems Engineering(智能系统工程学院) ; Sun Yat-sen University(中山大学) ; ETH Zurich(苏黎世联邦理工学院) ; Tencent Inc.(腾讯公司) ; S-Lab(S实验室) ; Nanyang Technological University(南洋理工大学)
AI总结 本文提出Point-In-Context框架,利用上下文学习实现多任务处理,通过联合采样模块和创新训练策略提升点云分割性能,无需微调即可泛化到新领域。
Comments Project page: https://fanglaosi.github.io/Point-In-Context_Pages. arXiv admin note: text overlap with arXiv:2306.08659
预测正则化对抗多模态大语言模型中的视觉表征退化
机构 * NKIARI ; VCIP, CS, Nankai University(VCIP计算机科学系,南开大学) ; AAIS, Nankai University(AAIS,南开大学) ; Tencent Youtu Lab(腾讯优设实验室)
AI总结 本文研究多模态大语言模型中的视觉表征退化问题,提出预测正则化方法以维持视觉表征,提升视觉语言性能。
Comments Accepted at CVPR 2026
MHPO:基于稳定强化学习的调节危险感知策略优化
机构 * The University of Hong Kong(香港大学) ; Tencent Youtu Lab(腾讯优图实验室)
AI总结 MHPO通过引入Log-Fidelity Modulator和Decoupled Hazard Penalty,实现对策略偏差的精细调控,提升强化学习的稳定性和性能。
Comments 18 pages, 3 figures, 4 tables
AdaptVision: 通过自适应视觉获取实现高效的视觉-语言模型
机构 * Tencent Hunyuan(腾讯文言)
AI总结 AdaptVision通过自适应视觉获取机制,结合强化学习与工具学习,提升视觉-语言模型在视觉问答任务中的效率与准确性。
Comments Accepted by CVPR 2026. Code and models are available at https://github.com/AdaptVision/AdaptVision
所有补丁都重要,更多补丁更好:通过全景补丁学习增强AI生成图像检测
机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; Youtu Lab, Tencent(腾讯优图实验室) ; Peking University(北京大学) ; Wechat Pay, Tencent(腾讯微信支付) ; School of Software Technology, Zhejiang University(浙江大学软件技术学院)
AI总结 本文提出全景补丁学习框架,通过随机补丁替换和补丁级对比学习,解决AI生成图像检测中的Few-Patch偏差问题,提升检测鲁棒性和泛化能力。
具有记忆掩码的多智能体辩论
机构 * TMLR Group, Hong Kong Baptist University(香港 Baptist 大学 TMLR 团队) ; Search Algorithm Group, WeChat, Tencent(微信搜索算法团队,腾讯)
AI总结 本文提出MAD-M$^2$框架,通过在每轮辩论前屏蔽错误记忆以提升多智能体辩论的鲁棒性,实验证明其在数学和逻辑推理任务中表现更优。
Comments ICLR 2026