arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 337 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 337 篇

2608.08729 2026-08-11 cs.HC 新提交 50%

From Scaffolding to Internalization: Enhancing CPR Training with In-Situ Visualization and Kinesthetic Feedback

从支架到内化:利用原位可视化与运动反馈强化心肺复苏(CPR)训练

Jiahe Dong, Shuhao Zhang, Yutao Ming, Jinkai Zhang, Yurui Zhang, Quan Li

专题命中 视频多模态 :multimodal(abstract)

AI总结 本研究针对现有CPR训练系统依赖外部反馈导致技能保持差的问题,设计了阶段自适应多模态混合现实训练系统Kinesthetic-CPR,经60人参与的受控研究验证,为CPR训练系统提供了设计启示。

Comments In The 39th Annual ACM Symposium on User Interface Software and Technology (UIST '26), November 02-05, 2026, Detroit, MI, USA. ACM, New York, NY, USA, 15 pages. https://doi.org/10.1145/3830398.3830498

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06783 2026-08-10 eess.SP 新提交 50%

Design and Validation of a Portable EEG-tES Platform Supporting High-Rate EEG Recording and Temporal Interference Stimulation

支持高速脑电图记录和时间干扰刺激的便携式脑电图-经颅电刺激平台的设计与验证

Le Xing, Maoxing Liang, Disi A, Yifei Jia, Gaoxiang Xie, Linfeng Xu, Xiang'ao Chen, Jiebin Shi, Gang Pan, Bicheng Han

专题命中 视频多模态 :multimodal(abstract)

AI总结 本研究设计并验证了一款以MCU为核心的便携式EEG-tES平台,集成8通道EEG采集与2通道tES功能,具备高信号保真度与低刺激误差,为便携式闭环神经调控系统提供了实用基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01773 2026-08-04 q-bio.NC 新提交 50%

NeuroWorld: A Latent Brain World Model for Stimulus-Conditioned Human Brain Dynamics

NeuroWorld:用于刺激条件下人脑动力学的潜在脑世界模型

Zijian Dong, Jianxiong Zhou, Kwun Kei Ng, Jan Paolo Macapinlac Balagtas, Zhizhou Li, Zijiao Chen, Juan Helen Zhou

专题命中 视频多模态 :multimodal(abstract)

AI总结 研究针对现有脑编码模型的时间约束缺陷,提出首个脑世界模型NeuroWorld,通过两阶段方法在三个fMRI基准上实现了更优的脑活动多步预测性能,为脑活动因果预测提供了新框架。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29482 2026-08-03 cs.RO 新提交 50%

Temporal Policy: History-Initialized Action Generation for Robotic Learning from Demonstration

时间策略:用于机器人演示学习的历史初始化动作生成

Dylan Miller, Martin Jagersand

机构 * University of Alberta(阿尔伯塔大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出Temporal Policy生成框架,将动作生成为时间耦合传输问题,在降低近一个数量级传输成本的同时匹配基线成功率,实现高频闭环控制。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29413 2026-08-03 cs.HC 新提交 50%

SAVVY: Student Attention Visualization for Video-based Learning Analysis

SAVVY:面向视频学习分析的学生注意力可视化

Shixian Zhou, Minghuan Shen, Xiaolin Wen, Zijun Qiu, Yongliang Jiang, Xiangyang Wu, Fei Wu, Yong Wang, Zhiguang Zhou

专题命中 视频多模态 :multimodal(abstract)

AI总结 针对现有视频学习注意力分析算法易受噪声干扰、教师修订成本高的问题,提出基于多模态脑信号的注意力建模框架,开发整合视听注意力的SAVVY可视化系统,经验证可有效辅助教学视频优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23457 2026-07-28 physics.soc-ph 新提交 50%

From Pen to Palette: Mathematical Analysis of van Gogh's Psychological Trajectory

从笔到调色板:梵高心理轨迹的数学分析

Anna Singley, Eli Goldwyn, Mark Pitzer, Jessica Logue

专题命中 视频多模态 :multi-modal(abstract)

AI总结 该研究通过对梵高信件片段情感分析和画作分形维数分析,运用临界慢化理论,发现视觉复杂性与死亡情绪相关,重大危机前有CSD模式,如1888年割耳事件,揭示数学方法可检测历史人物心理转变特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21309 2026-07-24 cs.RO 新提交 50%

Factorized Spatio-Temporal Convolutions for Human Pose Estimation from Planar Lidar

用于基于平面激光雷达的人体姿态估计的分解时空卷积

Simone Arreghini, Mirko Nava, Nicholas Carlotti, Antonio Paolillo, Alessandro Giusti

机构 * Dalle Molle Institute for Artificial Intelligence (IDSIA), USI-SUPSI(瑞士意大利语区大学提契诺大学人工智能达勒莫利研究所)

专题命中 视频多模态 :cross-modal(abstract)

AI总结 针对服务机器人仅配备平面激光雷达和普通处理器的情况,提出基于时空块的轻量级网络,用于全向人体检测和相对2D姿态估计,通过跨模态自监督训练,优于基线模型,适用于计算受限的服务机器人空间感知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19827 2026-07-23 cs.RO cs.CY 新提交 50%

Clinical Pathways as Safety Specifications for Physical AI in Hospital Wards

临床路径作为医院病房物理人工智能的安全规范

Gabriele Franchini, Giulio Mallardi, Michele De Carolis, Filippo Lanubile

专题命中 视频多模态 :multimodal(abstract)

AI总结 研究针对医院病房物理人工智能系统的安全挑战,提出将临床路径作为安全规范,构建集成多种组件的概念性机器人架构,用运行时安全监视器结合多种方法识别安全违规,助力护理人员并为安全物理人工智能做贡献。

Comments 4 pages, 3 figures. Accepted at the 1st IJCAI Workshop on Safe Physical AI (SPAI 2026), held in conjunction with IJCAI-ECAI 2026, Bremen, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15628 2026-07-20 eess.IV 新提交 50%

MSTF-Net: A UAV-Oriented Multi-Spectral Video Segmentation Method via Modality-Robust, Scale-Adaptive, and Consistent Fusion

MSTF-Net:一种通过模态稳健、尺度自适应和一致融合的面向无人机的多光谱视频分割方法

Chenwei Wang, Zhida Wang, Zelin Li, Elif Ozden-Yenigun, Houde Liu

专题命中 视频多模态 :cross-modal(abstract)

AI总结 研究针对无人机多光谱视频分割面临的模态融合困境和时间变化问题,提出MSTF-Net框架,通过模态稳健、尺度自适应融合有效建模跨模态融合与时间一致性,在公共数据集实验中取得出色分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16050 2026-07-20 cs.LG 新提交 50%

DELUGE: Towards Continental-Scale Daily Pluvial Flood Damage Prediction via Interpretable Conditioning on Foundation Model Embeddings

DELUGE:通过基础模型嵌入的可解释条件实现大陆尺度每日暴雨洪水灾害预测

Yuya Kawakami, Daniel Cayan, Dongyu Liu, Kwan-Liu Ma, Tom Corringham

机构 * University of California, Davis(加利福尼亚大学戴维斯分校)

专题命中 视频多模态 :multimodal(abstract)

AI总结 研究针对美国暴雨洪水难预测及现有方法局限问题,提出DELUGE多模态深度学习框架,通过对特定单元格建模,利用参数模块结合基础模型嵌入实现可解释预测,在PR - AUC指标上优于基线,且该条件设定方案可用于其他地理空间预测任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15880 2026-07-20 cs.RO cs.LG 新提交 50%

Dynamics-Aware Meta-Imitation for Generalization to Unseen Robotic Manipulation

用于泛化到未见机器人操作的动力学感知元模仿

Zhenduo Shang, Xiyao Liu, Bohan Li, Xudong Wang, Teng Ren, Lianqing Liu, Zhi Han

机构 * State Key Laboratory of Robotics and Intelligent Systems, Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所机器人学国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Shenyang University of Technology(沈阳工业大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 研究针对机器人模仿学习的数据稀缺与环境泛化问题,提出动力学感知元模仿(DAMI)框架,通过整合元学习、引入视觉运动轨迹模块等方法,有效捕捉任务动力学,在模拟和真实场景实验中表现优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09746 2026-07-14 q-bio.QM eess.IV 新提交 50%

Longitudinal MRI template of the baboon brain from birth to adolescence

从出生到青春期的狒狒大脑纵向MRI模板

Katherine L. Bryant, Arnaud Le Troter, David Meunier, Yannick Becker, Scott A. Love, Siham Bouziane, Kep Kee Loh, Julien Sein, Luc Renaud, Olivier Coulon, Adrien Meguerditchian

专题命中 视频多模态 :multi-modal(abstract)

AI总结 该研究针对狒狒大脑从出生到青春期的发育,提出BABACOOL方法创建多模态发育图谱,生成BaBa21纵向发育模板,还提供全自动生成中间年龄模板的方法,为狒狒数据归一化及相关研究提供便利。

Comments 21 pages, 6 Figures, 6 Supplementary Figures, In Press

Journal ref Imaging Neuroscience, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09234 2026-07-13 cs.RO 新提交 50%

Implicit-Behavior Coordination from Unlabeled Sub-Task Demonstrations for Rearrangement Tasks

基于未标记子任务演示的重排任务隐式行为协调

Ahmed Shokry, Usama Ahmed Siddiquie, Sicong Pan, Maren Bennewitz

机构 * Humanoid Robots Lab and Center for Robotics, University of Bonn(人形机器人实验室及机器人技术中心,波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 研究长期机器人重排任务,提出基于未标记子任务演示的隐式行为协调方法,通过价值引导动作选择学习类技能行为,实验表明该方法在复杂任务中表现优,能处理更大行为库,为显式技能管道提供替代。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06215 2026-07-08 quant-ph cond-mat.mes-hall 新提交 50%

Coherence Estimation Beyond the Liouvillian Gap in a Finite Nonequilibrium System

有限非平衡系统中超越刘维尔间隙的相干性估计

Sonali Brahma, Trishna Kalita, Himangshu Prabal Goswami

专题命中 视频多模态 :multimodal(abstract)

AI总结 研究有限量子系统与热库相互作用时热库诱导相干性的估计,通过分析刘维尔本征谱证明最优传感窗口源于模式竞争,刘维尔间隙倒数与最优传感时间无一般缩放关系,耦合系统到量子腔可转变为稳态资源。

Comments Suggestions on references are welcome along with other suggestions or comments

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04988 2026-07-07 cs.RO 新提交 50%

InternVLA-A1.5: Unifying Understanding, Latent Foresight, and Action for Compositional Generalization

InternVLA-A1.5:统一理解、潜在预见与组合泛化的行动

Haoxiang Ma, Junhao Cai, Xiaoxu Xu, Hao Li, Yuyin Yang, Yang Tian, Jiafei Cao, Hongrui Zhu, Zherui Qiu, Zhaxizhuoma, Yuqiang Yang, Jiaqi Peng, Xueyuan Wei, Yangkun Zhu, Jiahao Jiang, Xing Gao, Hanqing Wang, Feng Yuan, Kailin Li, Xueyue Zhu, Tai Wang, Yan Ding, Jiangmiao Pang, Jia Zeng, Jingjing Zhang, Bowen Zhou, Yao Mu, Chunhua Shen, Weinan Zhang

机构 * Physical Intelligence Team Shanghai AI Laboratory(上海人工智能实验室物理智能团队)

专题命中 视频多模态 :multimodal(abstract)

AI总结 研究旨在统一机器人操作模型,提出InternVLA-A1.5,基于原生VLM骨干构建策略,将未来预测转化为潜在查询问题,继承预训练视频生成模型动力学先验,在模拟和现实基准测试中效果良好。

Comments Homepage: https://internrobotics.github.io/internvla-a15.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04955 2026-07-07 astro-ph.IM astro-ph.EP astro-ph.GA astro-ph.SR 新提交 50%

CausticFlow: An Efficient Machine Learning Framework Combining Neural Differential Equations and Normalizing Flows for Binary Microlensing Parameter Inference

CausticFlow:一种结合神经微分方程和归一化流用于二元微引力透镜参数推断的高效机器学习框架

Haibin Ren, Wei Zhu

专题命中 视频多模态 :multimodal(abstract)

AI总结 介绍结合神经控制微分方程与归一化流的CausticFlow框架推断二元微引力透镜参数,能处理不规则采样等,训练后快速生成后验样本,用于下游优化可提高精度,在真实事件测试中表现良好。

Comments 17 pages, 8 figures, submitted to AJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01400 2026-07-07 cs.SE cs.LG q-bio.NC 新提交 50%

A global predicted-fMRI drive signal from TRIBE does not predict YouTube replay heatmaps

来自TRIBE的全局预测fMRI驱动信号无法预测YouTube重播热图

Barada Sahu, Shivesh Pandey

机构 * Cabal AI Para AI

专题命中 视频多模态 :multimodal(abstract)

AI总结 本研究测试了深度多模态脑编码模型TRIBE预测的fMRI信号是否能预测YouTube视频的重播行为,发现全局场功率与重播热图无显著相关性。

Comments 12 pages, 2 figures. v2: adds equivalence and Bayes-factor bounds, split-half reliability ceiling, a supervised probe with proper position control, a per-input-stream dissociation, and ISC discussion. Code, video-ID manifest, and per-video results: https://github.com/mercurialsolo/tribe-replay-heatmaps

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01468 2026-07-03 cs.DB 新提交 50%

CADENZA in Action: Breaking the Monolith with Intent-Dependent Plan Spaces for Semantic Queries

CADENZA 在行动:通过意图依赖的计划空间打破语义查询的单一架构

Jaehyun Ha, Yongjoo Park, Wook-Shin Han

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出CADENZA语义算子优化器,将意图分解为步骤并选择物理实现,根据用户偏好调优参数,平衡质量、延迟和成本。

Journal ref VLDB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26093 2026-06-25 cs.RO 新提交 50%

ForceBand: Learning Forceful Manipulation with sEMG

ForceBand: 利用表面肌电信号学习有力操作

Botao He, Zhi Wang, Linna Kuang, Ishaan Ghosh, Jitendra Malik, Cornelia Fermuller, Tingfan Wu, Jiayuan Mao, Ruoshi Liu, Haozhi Qi, Yiannis Aloimonos

机构 * Amazon FAR(亚马逊 FAR) University of Maryland(马里兰大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出ForceBand,一种低成本腕戴式sEMG系统,通过预测手指力来增强人类演示数据,用于机器人有力操作策略学习,在多种物体上实现87%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24962 2026-06-25 cs.LG 新提交 50%

Towards Scalable Multi-Task Reinforcement Learning with Large Decision Models

迈向可扩展的多任务强化学习与大决策模型

Thibaut Kulak

专题命中 视频多模态 :multi-modal(abstract)

AI总结 提出LDM-v0,一个在大规模异构强化学习环境上离线预训练的Transformer策略,通过监督下一动作预测实现多任务学习,在约1000个环境中达到与独立训练策略相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23791 2026-06-24 hep-ph 新提交 50%

One Generator, Any Process: LLM-Conditioning for the LHC

一个生成器,任意过程:LHC的LLM条件生成

Henning Bahl, Tilman Plehn, Daniel Schiller, Thanush Sivagnanalingam

专题命中 视频多模态 :multi-modal(abstract)

AI总结 提出利用预训练LLM为自回归变压器提供描述性嵌入,通过连续参数、过程标签和费曼图的条件化方案,实现LHC事件生成网络的快速收敛、更优结果及对未见过程的泛化。

Comments 33 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23729 2026-06-24 cond-mat.mtrl-sci 新提交 50%

Interpretable Material Spatial Intelligence for Discovery of Governing Microstructural Features

可解释的材料空间智能用于发现主导微观结构特征

Mathieu Calvat, Gregory Sparks, Dhruv Anjaria, Chris Bean, Haoren Wang, Paul Gradl, Timothy M. Smith, Allison M. Beese, Gabriel Demeneghi, Kenneth Vecchio, Morad Behandish, J. C. Stinville

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出材料空间智能(MSI)框架,通过多模态表示学习直接从空间观测数据中编码微观结构信息,实现性能预测、解释和优化,并识别主导力学行为的关键特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22336 2026-06-23 stat.ML cs.LG 新提交 50%

Null-Calibrated Conformal Selection via Target-Membership Scores

通过目标隶属度分数进行零校准的共形选择

Seungjin Choi

机构 * CROID Research and aSSIST University(CROID研究院和aSSIST大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出基于目标隶属度分数的共形选择方法,通过零校准(NCCS)生成有限样本有效的零p值,在方差驱动和多模态目标上优于传统预测导向分数。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22729 2026-06-23 cs.RO 新提交 50%

Temporal Logic Guidance for Action-Only Diffusion Policies with World Models

基于时序逻辑的动作扩散策略与世界模型引导

Moritz Zoellner, Anastasios Manganaris, Rohan Paleja

机构 * German Academic Exchange Service (DAAD)(德国学术交流中心(DAAD))

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出一种利用世界模型实现时序逻辑鲁棒性可微评估的引导方法,在不重新训练的情况下改善动作扩散策略的约束满足,在Robomimic任务中将违规率从80%降至4%。

Comments Accepted at the ICRA 2026 Workshop on Bridging the Gap between Robot Learning and Human-Robot Interaction. 3 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21776 2026-06-23 cs.LG 新提交 50%

A Causal DAG Prior for Synthetic Time-Series Classification Datasets

用于合成时间序列分类数据集的因果DAG先验

Franco Martino O'Rourke, Ana Trisovic, Dimitris Bertsimas

机构 * Massachusetts Institute of Technology, Cambridge, MA, USA(麻省理工学院)

专题命中 视频多模态 :cross-modal(abstract)

AI总结 提出一种因果DAG先验,从随机采样的有向无环图生成多变量、多类别的时间序列分类数据集,包含跨模态因果结构,微调TabPFN v2.5后在UCR/UEA数据集上显著优于基线。

Comments Accepted at the 2nd ICML 2026 Workshop on Foundation Models for Structured Data (FMSD). 4 pages (main text), 2 figures, plus references and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21600 2026-06-23 cs.RO 新提交 50%

VQActFlow: Vector-Quantized Action Mode Steering for Multi-Task Robot Manipulation

VQActFlow: 用于多任务机器人操作的矢量量化动作模式引导

Zhigen Zhao, Mark Leggiero, Yipu Chen, Haoran Liu, Yifan Wu, Huishu Xue, Sirui Zhan, Ye Zhao

机构 * Institute for Robotics and Intelligent Machines (IRIM), Georgia Institute of Technology(佐治亚理工学院机器人与智能机器研究所(IRIM))

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出VQActFlow,通过矢量量化动作标记和变分流匹配生成离散代码序列,显式区分动作模式,并利用推理时引导(语言条件无分类器引导和代码本评论家)实现模式承诺,在LIBERO、Unitree G1和ALOHA平台上优于连续和离散基线。

Comments 8 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21088 2026-06-23 cs.RO 新提交 50%

MV-WAM: Manifold-Aware World Action Model with Value Augmentation

MV-WAM: 具有价值增强的流形感知世界动作模型

Jintao Chen, Peidong Jia, Qingpo Wuwu, Jiaming Liu, Mengfei Du, Chun-Kai Fan, Xiaowei Chi, Hao Chen, Chengyu Bai, Zezhong Qian, Hao Wang, Jiajun Cao, Weishi Mi, Xiaozhu Ju, Jian Tang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 视频多模态 :cross-modal(abstract)

AI总结 提出MV-WAM框架,通过跨模态因果掩码、流形感知优化和进度价值调节机制,联合建模视觉预测、动作生成和价值估计,在分布外场景中提升动作泛化能力,在仿真和真实机器人任务上显著优于基线。

Comments 20 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12899 2026-06-17 eess.SP 新提交 50%

LGVSC: A Large-Model-Driven Generative Video Semantic Communication Framework

LGVSC:一种大模型驱动的生成式视频语义通信框架

Yu Ma, Hang Yin, Li Qiao, Shuo Sun, Zhen Gao, Yin Xu, Wenjun Zhang

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出大模型驱动的生成式视频语义通信框架LGVSC,通过解耦编解码器、引入概率语义相似度评分和语义引导关键帧提取,在极低带宽下实现高效视频语义传输,并保持零样本泛化能力。

Comments Accepted by IEEE Transactions on Vehicular Technology; v2: Added appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16053 2026-06-16 cs.SI cs.CY 新提交 50%

Modeling Engagement with Brand and Organizational TikTok Videos Using Machine-Assisted Theory-Ensemble Annotation

使用机器辅助理论集成标注建模品牌和组织TikTok视频的参与度

Sander Paekivi, Andres Karjus

专题命中 视频多模态 :multimodal(abstract)

AI总结 利用多模态大语言模型标注77个理论驱动的结构变量,分析约1万个TikTok视频,以预测参与度并探索短视频文化差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15330 2026-06-16 cs.IR 新提交 50%

OneBar: An End-to-End Content-Grounded Generative Query Recommendation Framework for E-Commerce Video Feeds

OneBar:一种面向电商视频流的端到端内容驱动生成式查询推荐框架

Yao Tang, Ying Yang, Ben Chen, Yufei Ma, Zihan Liang, Chenyi Lei, Wenwu Ou, Jian Liu

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出OneBar框架,通过协同多模态意图对齐、统一端到端架构和渐进偏好学习,解决短视频平台查询推荐中的延迟和偏好漂移问题,显著提升查询曝光和点击。

Comments Any questions feel free to contact: benchen4395@gmail.com

详情

展开后加载摘要…

URL PDF HTML 收藏