arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Kuaishou(快手)

共收录 308
2608.16220 2026-08-18 cs.SD cs.CV 新提交

SingDance: Compositional Zero-Shot Singing-and-Dancing Video Generation with Role-Aware Audio Conditioning

SingDance:基于角色感知音频条件的组合式零样本歌舞视频生成

Tao Feng, Xu Li, Xiangyang Luo, Ming Wen, Huadai Liu, Chen Zhang, Wei Xue

机构 * Kuaishou Technology(快手科技)

AI总结 SingDance是统一视频扩散框架,将语音表达设为语义角色,通过硬紧凑路由等技术实现组合式零样本歌舞视频生成,参数少且性能具竞争力。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13552 2026-08-17 cs.CV 版本更新

PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives

PlayWorld:基于智能体玩家的长程目标世界模型基准测试

Kaixin Ding, Xi Chen, Minghong Cai, Zhiyuan Xu, Yiyang Wang, Yuxiang Lu, Junyi Li, Shuyang Chen, Yuan Gao, Xin Tao, Pengfei Wan, Hengshuang Zhao

机构 * The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Kuaishou Technology(快手科技)

AI总结 该研究针对现有世界模型跨模型公平比较的难题,推出含171个场景的PlayWorld基准,通过多模态智能体玩家从多维度评估9种先进世界模型,发现其长程交互式目标表现仍不可靠。

Comments project page: https://kxding.github.io/project/PlayWorld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02075 2026-08-17 cs.CV 版本更新

HandsOnWorld: Unconstrained Egocentric Video Generation with Camera-Disentangled Hand Control

HandsOnWorld: 无约束的自我中心视频生成,具有相机解耦的手部控制

Yushuo Chen, Xiaoyu Shi, Xiaoshi Wu, Xintao Wang, Pengfei Wan, Yebin Liu

机构 * Tsinghua University(清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Chinese University of Hong Kong(香港中文大学)

AI总结 提出HandsOnWorld框架,通过单目重建从无约束视频中学习手部控制,利用Plücker手部映射解耦相机与手部运动,生成高保真自我中心视频。

Comments Project Page: https://shad0wta9.github.io/handsonworld-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21805 2026-08-14 cs.IR cs.AI cs.LG 版本更新

DiffGRM: Diffusion-based Generative Recommendation Model

DiffGRM:基于扩散的生成式推荐模型

Zhao Liu, Yichen Zhu, Yiqing Yang, Xiao Lv, Guoping Tang, Rui Huang, Qiang Luo, Ruiming Tang, Kun Gai, Guorui Zhou

机构 * Kuaishou Technology(快手科技)

AI总结 针对生成式推荐中SID的结构问题,提出DiffGRM模型,通过MDM、PSE、OCN、CPD等技术优化,在多数据集上使NDCG@10提升6.9%-15.5%。

Comments 12 pages, 6 figures. Accepted at The ACM Web Conference 2026. Camera-ready version; author list updated to match the published version; presentation revised, results unchanged

Journal ref Proceedings of the ACM Web Conference 2026 (WWW '26), pp. 5853-5864, ACM, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11236 2026-08-13 cs.CL cs.AI 新提交

TRACE Bench: Task-driven Roleplay Agentic Checklist Evaluation

TRACE Bench:任务驱动的角色扮演智能体清单评估基准

Jiahui Zhang, Ziwei Zhang, Yipeng Wang, Yibo Liu, Haozhou Pang, Yikai Hu, Hongyan Ren, Lan Zhou, Qi Gan, Kai Sheng

机构 * Kuaishou GameMind Lab(快手GameMind实验室)

AI总结 研究针对角色扮演评估的黑箱问题,提出TRACE Bench框架,通过清单分解与对话跟踪实现更透明的评估,在覆盖度、鲁棒性等方面优于现有基准,支持闭环演化。

Comments Project page: https://kuaishou-gamemind.github.io/projects/trace_bench/. Code: https://github.com/KuaishouGameMind/TRACE-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10444 2026-08-13 cs.CL cs.AI 版本更新

From Reasoning Depth to Reasoning Breadth: Evaluating Multi-Point Associative Reasoning in Large Language Models

从推理深度到推理广度:评估大型语言模型中的多点关联推理

Si'an Xie, Jiaxun Liu, Biao Yang, Wei Yuan, Fan Yang, Tingting Gao, Ming Wu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Kuaishou Technology(快手科技)

AI总结 该研究构建了中英双语多点关联推理基准MPAR-Bench,发现大型语言模型的推理深度未自动带来稳健的推理广度,当前基准未充分覆盖推理广度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19436 2026-08-12 cs.CV cs.AI cs.LG cs.MM 版本更新

VDC-Agent: When Video Detailed Captioners Evolve Themselves via Agentic Self-Reflection

VDC-Agent:当视频详细描述器通过代理自我反思而自我进化

Qiang Wang, Xinyuan Gao, Yuhang He, Jizhou Han, Jiangyang Li, SongLin Dong, Zhiheng Ma, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学) Kuaishou Technology(快手科技) Shenzhen University of Advanced Technology(深圳先进技术大学)

AI总结 VDC-Agent通过自我反思机制实现视频详细描述的自我进化,利用自动生成的(描述,评分)对提升描述准确性与评分表现。

Comments Accepted to ECCV 2026. Project Page: https://vdcagent.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09571 2026-08-11 cs.SD 新提交

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation

SonicWeave:用于统一音频场景生成的分块路由混合专家模型

Yunrui Cai, Xu Li, Yucheng Zhou, Jinchao Li, Dingdong Wang, Dongchao Yang, Xixin Wu, Chen Zhang, Zhiyong Wu, Pengfei Wan, Helen Meng

机构 * Kuaishou Technology(快手科技) The Chinese University of Hong Kong(香港中文大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

AI总结 本文提出SonicWeave,一种带CPE-MoE的流匹配模型,可通过单一权重集生成含语音、音乐等的统一音频场景,在多项基准及复杂场景评估中表现优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08627 2026-08-11 cs.AI 新提交

UniMoMo: Expert Merging-Based MoE Acceleration for Large Recommendation Models

UniMoMo:基于专家合并的大推荐模型混合专家(MoE)加速方法

Lei Xin, Bin Gu, Peize Li, Zitong Wang, Jianbo Zhao, Changjiang Jiang, Yanyue Xie, Chao Huang, Xuyang Zhao, Zunhai Su, Fanhu Zeng, Zhenglun Kong

机构 * Kuaishou Technology(快手科技) Hohai University(河海大学) Wuhan University(武汉大学) ByteDance, Seed(字节跳动 Seed) Alibaba, Ant Group(阿里巴巴蚂蚁集团) ByteDance, Douyin(字节跳动抖音) The University of Hong Kong(香港大学) Harvard University(哈佛大学)

AI总结 UniMoMo是一种后训练压缩框架,通过功能相似性合并MoE专家并引入层自适应保护,在Amazon Beauty等三个数据集上实现推荐MoE的高效压缩与加速,且性能损失极小。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27771 2026-08-07 cs.LG cs.CV 版本更新

NormGuard: Reward-Preserving Norm Constraints in Flow-Matching Reinforcement Learning

NormGuard: 流匹配强化学习中保持奖励的范数约束

Tianlin Pan, Lianyu Pang, Cheng Da, Huan Yang, Changqian Yu, Kun Gai, Wenhan Luo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Kuaishou Technology(快手科技) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 针对流生成器强化学习后训练中感知质量下降的问题,提出NormGuard方法,通过铰链惩罚约束速度范数,在保持奖励的同时提升图像质量和真实性。

Comments v5: Fixed PDF rendering compatibility issue affecting Apple PDFKit (macOS Preview/iOS PDF viewer). No changes to technical content compared to v4

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04956 2026-08-06 cs.CV 新提交

ContextMaster: Interactive Multi-Shot Video Creation via Fixed-Budget Sparse Context Routing

ContextMaster:基于固定预算稀疏上下文路由的交互式多镜头视频创作

Xu Guo, Zhengxuan Wei, Xinghui Li, Hanzhuo Huang, Xinyu Liu, Xiangyang Luo, Min Wei, Yiran Zhu, Qiulin Wang, Yulong Xu, Xintao Wang, Pengfei Wan, Qi Fan, Xiangwang Hou

机构 * Tsinghua University(清华大学) Nanjing University(南京大学) Kling Team, Kuaishou Technology(快手科技影团队) ShanghaiTech University(上海科技大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 该研究提出统一模型ContextMaster,以固定预算稀疏上下文路由等技术解决交互式多镜头视频创作问题,在基础任务表现优于专用基线,单GPU达16 FPS且支持灵活工作流。

Comments Project page: https://guoxu1233.github.io/ContextMaster/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04625 2026-08-06 cs.AI 新提交

A/B Agent: A Self-Evolving Agent for Strategy Iteration in Industrial A/B Testing

A/B Agent:面向工业A/B测试中策略迭代的自进化智能体

Zhuohang Jiang, Yuxin Chen, Yongsen Pan, Zheng Hu, Wenqi Fan, Qing Li, Hongyang Wang, Jun Wang, Wenwu Ou

机构 * The Hong Kong Polytechnic University(香港理工大学) Kuaishou Technology(快手科技) University of Electronic Science and Technology of China(电子科技大学) Southwest Jiaotong University(西南交通大学)

AI总结 该研究提出A/B Agent智能体,通过层级经验树与Tree-RAG技术优化工业A/B测试的策略迭代,在短视频电商场景实现GMV提升4.829%且护栏指标正向增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04421 2026-08-06 cs.LG cs.AI 新提交

Generative Optimization for Incentivized Advertising with Global Level Constraints

面向全局层级约束的激励式广告生成优化

Gege Chen, Ning Luo, Hao Jiang, Da Li, Wenzheng Shu, Teng Sha, Yanxiang Zeng, Wenxin Tai, Fan Zhou, Xialong Liu

机构 * University of Electronic Science and Technology of China(电子科技大学) Kuaishou Technology(快手科技)

AI总结 针对全局约束下激励式广告的优化难题,提出GOAL框架与SCPO方法,在降低ROI违规率的同时提升长期收入与用户留存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12000 2026-08-06 cs.CV 版本更新

MetaView: Monocular Novel View Synthesis with Scale-Aware Implicit Geometry Priors

MetaView:基于尺度感知隐式几何先验的单目新视图合成

Yufei Cai, Xuesong Niu, Hao Lu, Kun Gai, Kai Wu, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) Kolors Team, Kuaishou Technology(快手科技色彩团队) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 研究提出MetaView框架,结合隐式几何建模与少量显式3D线索,利用前馈几何感知网络隐式几何先验及度量深度,实现大视角下单目新视图合成,实验证明该方法在挑战性场景中显著优于现有方法且泛化能力强。

Comments accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01628 2026-08-05 cs.CV 版本更新

Motion Beyond Morphology: Bootstrapping Cross-Category Motion Transfer from Abstract Motion Representations

超越形态的运动:从抽象运动表示引导跨类别运动迁移

Zhixue Fang, Zhimin Zhang, Bi'an Du, Zijie Meng, Yan Zhou, Wei Hu, Guoxin Zhang, Pengfei Wan, Kun Gai

机构 * Kuaishou Technology(快手科技) Peking University(北京大学)

AI总结 该研究针对现有运动迁移依赖固定结构对应关系的局限,提出两阶段框架,结合自研数据集与基准,实现跨类别运动迁移,在运动保真度和目标保留上达当前最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28058 2026-07-31 cs.CV 新提交

Temporal Concentration from Rollout Errors: Implicit Preference Optimization for Text-to-Video Diffusion

基于回退误差的时间集中:文本到视频扩散的隐式偏好优化

Henglin Liu, Fangyuan Kong, Jing Wang, Yizhou Lin, Nisha Huang, Chang Liu, Xintao Wang, Pengfei Wan, Kun Gai, Xiu Li

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技) Sun Yat-sen University(中山大学)

AI总结 针对文本到视频扩散模型的时间稀疏伪影问题,本文提出集中式隐式偏好优化(cIPO)框架,通过回退误差推导隐式偏好信号,将优化集中于高误差片段,有效提升了视频的真实性与时间连贯性。

Comments project page: https://henglin-liu.github.io/cIPO_vis/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27265 2026-07-31 cs.LG 新提交

PlatformBid: An Auto-Bidding Benchmark from a Unified Advertising Platform's Perspective

PlatformBid:来自统一广告平台视角的自动竞价基准

Shengtian Yang, Yewen Li, Peng Jiang, Zhiyi Lyu, Bo An, Peng Jiang, Qingpeng Cai, Lei Feng

机构 * Southeast University(东南大学) Kuaishou Technology(快手科技) Nanyang Technological University(南洋理工大学)

AI总结 该研究针对现有自动竞价算法仅聚焦DSP侧的问题,提出首个以统一广告平台为中心的自动竞价基准PlatformBid,定义三类竞争场景并评估多种方法,还提出BidFlow方法,在快手实验中目标成本提升0.68%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03126 2026-07-31 cs.LG cs.AI 版本更新

ACPO: Asymmetric Credit Policy Optimization via Mode-Local Entropy Surrogate

ACPO:通过细粒度替代熵实现自适应信用策略优化

Zijun Xie, Yuyang You, Yongzhi Li, Enlei Gong, Quan Chen, Yanhua Cheng, Peng Jiang, Binbin Zheng, Xiaolong Liu, Zeyu Chen, Yadong Mu

机构 * Peking University(北京大学) Baidu Inc.(百度公司) Kuaishou Inc(快手公司)

AI总结 研究针对强化学习中稀疏奖励致令牌级信用分配难的问题,提出基于模式局部替代熵的ACPO框架,通过不对称调制策略更新改进信用分配,实验表明其优于多种强化学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26860 2026-07-30 cs.LG 新提交

Amortized Moment Matching for Visual Generation

用于视觉生成的摊销矩匹配

Wenze Liu, Xintao Wang, Pengfei Wan, Xiangyu Yue

机构 * MMLab, CUHK(香港中文大学MMLab) Kling Team, Kuaishou Technology(快手科技影幻团队)

AI总结 该研究提出摊销矩匹配方法,构建AMFD损失,用于视觉生成,在ImageNet、GenEval等基准上性能优于FD基线及FLUX.2 4B模型,实现高效高维数据生成。

Comments 30 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27084 2026-07-30 cs.CV 版本更新

SceneExpander: Text-Guided 3D Scene Expansion via Free-Form View Insertion

SceneExpander:通过自由形式插入视图扩展3D场景

Zijian He, Renjie Liu, Yihao Wang, Weizhi Zhong, Huan Yuan, Kun Gai, Guangrun Wang, Guanbin Li

机构 * Sun Yat-sen University(中山大学) KlingAI Research, Kuaishou Technology(快手科技 KlingAI 研究)

AI总结 本文提出SceneExpander,通过在用户控制下插入合成视图扩展3D场景,解决几何偏移和一致性问题,提升重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25404 2026-07-29 cs.LG cs.IR 新提交

TWICE: Two-Clock, Two-Window Learning for Long-Horizon Conversion Prediction in Online Advertising

TWICE:在线广告中用于长期转化预测的双时钟、双窗口学习

Kaiyuan Li, Kun Wang, Zhongbo Wang, Teng Sha, Ming Yan, Yanhua Cheng, Xialong Liu

机构 * Kuaishou Technology(快手科技)

AI总结 研究在线广告中延迟反馈下的长期转化预测问题,提出TWICE框架,将长期点击后转化率分解,利用双时钟提供互补监督训练模型,实验证明该方法有效,提升了快手广告系统的相关指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24779 2026-07-29 cs.AI cs.LG 新提交

HOBA: Hierarchical On-Policy Bidding Agents for Adaptive Online Advertising

HOBA:用于自适应在线广告的分层策略性投标代理

Ji Wu, Yunshan Peng, Wentao Bai, Yunke Bai, Wenzheng Shu, Jinan Pang, Yanxiang Zeng, Xialong Liu

机构 * Kuaishou Technology(快手科技)

AI总结 针对在线广告投标系统问题,提出 HOBA 分层强化学习框架,在三个时间尺度解耦相关环节,通过实验验证其优于现有基线,大规模在线部署实现目标成本提升 3.6%,证明该范式有效。

Comments 10pages,accepted by KDD 2026 ads track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22724 2026-07-28 cs.LG cs.AI 新提交

Progress-conditioned Group Policy Optimization for Long-Horizon Agentic Tasks

用于长期代理任务的进度条件分组策略优化

Kaibing Yang, Guangfeng Cai, Shengtian Yang, Shuo He, Yu Li, Mengyi Liu, Pengwei Chen, Jun Xu, Lei Feng

机构 * Southeast University(东南大学) Kuaishou Technology(快手科技) Meituan(美团)

AI总结 研究长期代理任务中基于分组策略优化的采样不平衡问题,提出进度条件分组策略优化(ProGPO),通过特定条件下利用首次访问观察覆盖率,为访问更多新状态的轨迹或步骤赋予优势,实验证明该方法优于基线,尤其在困难任务上效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18267 2026-07-27 cs.CV 版本更新

SRC-Flow: Compact Semantic Representations Enable Normalizing Flows for Image Generation

SRC-Flow:紧凑语义表示实现归一化流用于图像生成

Longtao Jiang, Jianmin Bao, Zhendong Wang, Xin Tao, Pengfei Wan, Zhihui Li, Xiaojun Chang

机构 * University of Science and Technology of China(中国科学技术大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

AI总结 提出SRC-Flow,通过语义表示压缩器将高维RAE特征压缩到低维语义空间,降低归一化流建模负担,在ImageNet上实现最优生成质量,同时保持精确似然计算和确定性可逆采样。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20389 2026-07-23 cs.CV 新提交

PercepCap: Video Captioner with Structured Spatio-Temporal Perception

PercepCap:具有结构化时空感知的视频字幕生成器

Yifan Xu, Zihao Wang, Zhixiao Wang, Jiaming Zhang, Yichun Yang, Desen Meng, Yuanxing Zhang, Pengfei Wan, Limin Wang

机构 * Nanjing Univerisity(南京大学) Kuaishou Technology(快手科技) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 研究视频字幕生成问题,提出PercepCap框架,遵循感知-描述生成链,设计两阶段训练策略及相关数据构建方法,在评估中优于基线,提升视频字幕生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20247 2026-07-23 cs.CV 新提交

Vera: Identity-Faithful Human Subject-to-Video Generation

Vera:身份忠实的人类主体到视频生成

Yulong Xu, Xinyue Liu, Shujuan Li, huafeng shi, Yan Zhou, Jiwen Liu, Xintao Wang, Yu Shen Liu, Huaibo Huang

机构 * Kuaishou Technology(快手科技) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学)

AI总结 针对主体到视频生成中人类身份一致性不足问题,提出Vera框架,通过构建百万对身份对齐数据集,引入身份聚焦掩码监督和参考感知分层注意力两种设计,提升了身份一致性、主体绑定及运动自然性等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17719 2026-07-22 cs.AI cs.MA 版本更新

SR-Agent: An Experience-Driven Agentic Framework for Post-Ranking Strategy Refinement in E-Commerce Recommendation

SR-Agent:一种用于电子商务推荐中排序后策略优化的经验驱动智能框架

Hanchen Yang, Kaiwen Yang, Junpeng Zhuang, Yang He, Keting Cen, Bochao Liu, Zhongbo Sun, An Liu, Zhongteng Han, Chenyi Lei

机构 * Kuaishou Technology(快手科技)

AI总结 电商推荐系统中,后排序策略因环境变化需优化,以往方式存在问题。本文提出SR-Agent框架,统一用户模拟、分析和策略优化组件,经快手平台测试,能提升订单量、浏览深度和点击类别多样性,还缩短优化周期、降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26800 2026-07-21 cs.CV cs.GR cs.LG 版本更新

OmniX: From Unified Panoramic Generation and Perception to Graphics-Ready 3D Scenes

OmniX:从统一全景生成与感知到适用于图形的3D场景

Yukun Huang, Jiwen Yu, Yanning Zhou, Jianan Wang, Xintao Wang, Pengfei Wan, Xihui Liu

机构 * University of Hong Kong(香港大学) Kuaishou Technology(快手科技) Tencent(腾讯)

AI总结 研究基于全景的2D提升技术,提出OmniX框架,利用跨模态适配器结构和循环空间算子,将预训练2D流匹配先验用于多模态联合建模,构建数据集,实现适用于图形的3D场景生成,为虚拟世界创建开辟新可能。

Comments ECCV 2026; Project page: https://yukun-huang.github.io/OmniX/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13460 2026-07-16 cs.CV 新提交

LPM: Industrial-Scale Generative Video Restoration

LPM:工业规模的生成式视频修复

Bichuan Zhu, Fulin Li, Jiachao Gong, Jinhua Hao, Kai Zhao, Kun Yuan, Pengcheng Xu, Qiang Wang, Qiao Mo, Yanlong Yuan, Yizhen Shao, Yuxiao Hu, Zixi Tuo, Ming Sun, Chao Zhou, Bin Chen, Bin Yu

机构 * Kuaishou Technology(快手科技)

AI总结 研究提出工业规模的LPM用于视频修复,通过统一系统解决UGC退化问题,含数据工程、模型训练和推理。其架构等机制实现高保真修复,已在快手生产应用,节省带宽成本,还能集成产品,证明该方法实用、可扩展且具成本效益。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13061 2026-07-16 cs.CV 版本更新

LaME: Learning to Think in Latent Space for Multimodal Embedding via Information Bottleneck

LaME: 通过信息瓶颈在潜在空间中进行多模态嵌入的推理学习

Peixi Wu, Biao Yang, Feipeng Ma, Bosong Chai, Bo Lin, Wei Yuan, Fan Yang, Tingting Gao, Hebei Li, Xiaoyan Sun

机构 * University of Science and Technology of China(中国科学技术大学) Kuaishou Technology(快手科技) Zhejiang University(浙江大学) Tsinghua University(清华大学)

AI总结 提出LaME方法,将面向嵌入的潜在推理建模为弱监督信息瓶颈,使用可学习推理令牌在单次前向传播中完成推理,避免显式CoT的高计算成本和标注依赖,实现60倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏