arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4735 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4735 篇

2507.06080 2025-12-16 cs.CV 57%

CAST-Phys: Contactless Affective States Through Physiological signals Database

CAST-Phys: 通过生理信号进行无接触情绪状态的数据库

Joaquim Comas, Alexander Joel Vera, Xavier Vives, Eleonora De Filippi, Alexandre Pereda, Federico Sukno

机构 * Department of Information and Communication Technologies, Pompeu Fabra University(信息与通信技术系,庞培法布拉大学) Eurecat Centre Tecnològic(埃鲁卡特技术中心)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 CAST-Phys数据库通过多模态远程生理信号实现无接触情绪识别,提供高质量的生理和面部数据以提升情绪识别技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00696 2025-12-16 q-bio.MN cs.AI cs.ET 57%

Hierarchical Molecular Language Models (HMLMs)

分层分子语言模型(HMLMs)

Hasi Hays, Yue Yu, William J. Richardson

机构 * Department of Chemical Engineering, University of Arkansas(化学工程系,亚拉巴马大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

AI总结 HMLMs通过构建分子语言模型,将细胞信号传递建模为分子语言,利用分层注意力机制和跨尺度操作符整合多模态数据,提升对复杂信号网络的时间动态预测能力,推动精准医学发展。

Comments The current version includes minor revisions to the preprint v2 (arXiv preprint arXiv:2512.00696), Added the Supplementary materials section

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11510 2025-12-15 cs.CV 57%

Reconstruction as a Bridge for Event-Based Visual Question Answering

重建作为事件驱动视觉问答的桥梁

Hanyue Lou, Jiayi Zhou, Yang Zhang, Boyu Li, Yi Wang, Guangnan Ye, Boxin Shi

机构 * Peking University(北京大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于重建的框架,通过FRT和ART方法提升事件驱动视觉问答性能,并引入EvQA基准验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11189 2025-12-15 cs.CV 57%

Multi-task Learning with Extended Temporal Shift Module for Temporal Action Localization

多任务学习与扩展时间移位模块用于时间动作定位

Anh-Kiet Duong, Petra Gomez-Krämer

机构 * L3i Laboratory, La Rochelle University(拉罗谢尔大学L3i实验室)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出基于扩展时间移位模块的多任务学习方法,用于多视角多模态视频中的时间动作定位,通过引入背景类别和加权集成策略提升了预测的鲁棒性和一致性。

Comments BinEgo360@ICCV25

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23158 2025-12-15 cs.LG cs.AI 57%

Deep Learning-Based Detection of Cognitive Impairment from Passive Smartphone Sensing with Routine-Aware Augmentation and Demographic Personalization

基于深度学习的被动智能手机传感认知障碍检测:具有常规感知增强和人口统计学个性化

Yufei Shen, Ji Hwan Park, Minchao Huang, Jared F. Benge, Justin F. Rousseau, Rosemary A. Lester-Smith, Edison Thomaz

机构 * Department of Electrical and Computer Engineering, Cockrell School of Engineering, The University of Texas at Austin(电气与计算机工程系,Cockrell工程学院,德克萨斯大学奥斯汀分校) Department of Neurology, Dell Medical School, The University of Texas at Austin(神经病学系,德克萨斯医学学院,德克萨斯大学奥斯汀分校) Department of Neurology, University of Texas Southwestern Medical Center(神经病学系,德克萨斯西南医学中心) Peter O’Donnell Jr. Brain Institute, University of Texas Southwestern Medical Center(彼得·奥·唐纳德·杰罗姆脑研究所,德克萨斯西南医学中心) Department of Speech, Language, and Hearing Sciences, Moody College of Communication, The University of Texas at Austin(语言病理学系,摩依学院,德克萨斯大学奥斯汀分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出基于深度学习的被动智能手机传感方法,通过常规感知增强和人口统计学个性化技术,提高模型在老年人认知障碍检测中的泛化能力。

Comments Accepted at 2025 IEEE EMBS International Conference on Biomedical and Health Informatics (IEEE BHI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09354 2025-12-11 cs.CV 57%

Video-QTR: Query-Driven Temporal Reasoning Framework for Lightweight Video Understanding

Video-QTR: 一种基于查询的轻量级视频理解时序推理框架

Xinkui Zhao, Zuxin Wang, Yifan Zhang, Guanjie Cheng, Yueshen Xu, Shuiguang Deng, Chang Liu, Naibo Wang, Jianwei Yin

机构 * School of Software Technology, Zhejiang University, Hangzhou, China(浙江大学软件技术学院) School of Computer Science, Zhejiang University, Hangzhou, China(浙江大学计算机科学学院) School of Software Engineering, Xidian University, Xi’an, China(西安电子科技大学软件工程学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 Video-QTR通过查询驱动的时序推理框架,实现轻量级视频理解,显著降低计算成本并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00702 2025-12-11 cs.HC cs.NI cs.SD eess.AS eess.IV 57%

CardioLive: Empowering Video Streaming with Online Cardiac Monitoring

CardioLive: 通过在线心脏监测增强视频流媒体

Sheng Lyu, Ruiming Huang, Sijie Ji, Yasar Abbas Ur Rehman, Lan Ma, Chenshu Wu

机构 * Department of Computer Science, The University of Hong Kong, Hong Kong SAR(香港大学计算机科学系) TCL AI Lab, Hong Kong SAR(TCL人工智能实验室)

专题命中 视频多模态 :audio-visual(abstract);分类 eess.AS

AI总结 CardioLive通过在线心脏监测技术,在视频流媒体中实现对生理信息的提取与分析,提升远程医疗和情感计算等应用的性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06301 2025-12-10 cs.AI 57%

Large Language Models and Their Applications in Roadway Safety and Mobility Enhancement: A Comprehensive Review

大语言模型及其在道路安全与出行提升中的应用:全面综述

Muhammad Monjurul Karim, Yan Shi, Shucheng Zhang, Bingzhang Wang, Mehrdad Nasri, Yinhai Wang

机构 * Department of Civil and Environmental Engineering, University of Washington(土木与环境工程系,华盛顿大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文综述了大语言模型在道路安全与出行提升中的应用,探讨其在交通领域的适应策略及面临的挑战。

Journal ref Artificial Intelligence for Transportation, 1, 100004, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05524 2025-12-09 cs.CV 57%

VOST-SGG: VLM-Aided One-Stage Spatio-Temporal Scene Graph Generation

VOST-SGG:基于视觉语言模型的一阶段时空场景图生成

Chinthani Sugandhika, Chen Li, Deepu Rajan, Basura Fernando

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院) Institute of High-Performance Computing, Agency for Science, Technology and Research, Singapore(科学、技术与研究局高性能计算研究所) Centre for Frontier AI Research, Agency for Science, Technology and Research, Singapore(科学、技术与研究局前沿人工智能研究中心)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 VOST-SGG通过整合视觉语言模型的常识推理能力,提出了一种基于多模态特征和双源查询初始化的一阶段时空场景图生成方法,实现了对视频中对象及其关系的高效建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14861 2025-12-09 cs.AI 57%

LabOS: The AI-XR Co-Scientist That Sees and Works With Humans

LabOS:能够看见并与人类协作的AI-XR共科学家

Le Cong, David Smerkous, Xiaotong Wang, Di Yin, Zaixi Zhang, Ruofan Jin, Yinkai Wang, Michal Gerasimiuk, Ravi K. Dinesh, Alex Smerkous, Lihan Shi, Joy Zheng, Ian Lam, Xuekun Wu, Shilong Liu, Peishan Li, Yi Zhu, Ning Zhao, Meenal Parakh, Simran Serrao, Imran A. Mohammad, Chao-Yeh Chen, Xiufeng Xie, Tiffany Chen, David Weinstein, Greg Barbone, Belgin Caglar, John B. Sunwoo, Fuxin Li, Jia Deng, Joseph C. Wu, Sanfeng Wu, Mengdi Wang

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 LabOS是一种通过多模态感知和增强现实实现人机协作的AI系统,能实时协助科学家进行实验,推动实验室向智能协作环境发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06674 2025-12-09 cs.CV 57%

RunawayEvil: Jailbreaking the Image-to-Video Generative Models

RunawayEvil: 对图像到视频生成模型的劫持

Songping Wang, Rufan Qian, Yueming Lyu, Qinglong Liu, Linzhuang Zou, Jie Qin, Songhua Liu, Caifeng Shan

机构 * PRLab, Nanjing University(南京大学PRLab) Meituan(美团) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 RunawayEvil是一种针对图像到视频生成模型的多模态劫持框架,通过自我进化机制实现动态攻击策略,显著提升攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07978 2025-12-08 cs.CV 57%

Martian World Model: Controllable Video Synthesis with Physically Accurate 3D Reconstructions

火星世界模型:可控视频合成与物理准确的3D重建

Longfei Li, Zhiwen Fan, Wenyan Cong, Xinhang Liu, Yuyang Yin, Matt Foutter, Panwang Pan, Chenyu You, Yue Wang, Zhangyang Wang, Yao Zhao, Marco Pavone, Yunchao Wei

机构 * BJTU(北京工业大学) UT Austin(德克萨斯大学奥斯汀分校) HKUST(香港科技大学) Stanford University(斯坦福大学) XMU(厦门大学) SBU(雪城大学) USC(南加州大学) NVIDIA(英伟达)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出M3arsSynth和MarsGen,通过物理准确的3D重建生成逼真的火星视频,提升任务模拟与机器人训练的可视化效果。

Comments Project Page: https://marsgenai.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03918 2025-12-04 cs.CV 57%

UniMo: Unifying 2D Video and 3D Human Motion with an Autoregressive Framework

UniMo:基于自回归框架统一2D视频与3D人体运动

Youxin Pang, Yong Zhang, Ruizhi Shao, Xiang Deng, Feng Gao, Xu Xiaoming, Xiaoming Wei, Yebin Liu

机构 * Tsinghua University(清华大学) Meituan(美团)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 UniMo通过自回归框架统一2D视频与3D人体运动,实现同时生成与理解,提升多模态联合建模能力。

Comments https://carlyx.github.io/UniMo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03837 2025-12-04 cs.CV 57%

Heatmap Pooling Network for Action Recognition from RGB Videos

用于RGB视频中动作识别的热图池化网络

Mengyuan Liu, Jinfu Liu, Yongkang Jiang, Bin He

机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School(国家通用人工智能重点实验室,北京大学深圳研究生院) Imaging Department, DJI Technology Co., Ltd(大疆技术创新有限公司影像部) TongJi University(同济大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种用于视频中动作识别的热图池化网络,通过反馈池化模块提取稳健且简洁的人体特征,并结合多模态数据提升识别性能。

Comments Final Version of IEEE Transactions on Pattern Analysis and Machine Intelligence

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03687 2025-12-04 cs.CV 57%

Active Visual Perception: Opportunities and Challenges

主动视觉感知:机遇与挑战

Yian Li, Xiaoyu Guo, Hao Zhang, Shuiwang Li, Xiaowei Dai

机构 * College of Computer Science and Engineering, Guilin University of Technology(桂林理工大学计算机科学与工程学院) New Engineering Industry College, Putian University(莆田大学新工程产业学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文探讨了主动视觉感知在复杂环境中的应用与挑战,分析了其在机器人、自动驾驶等领域的潜力及面临的实时处理与多模态整合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03580 2025-12-04 cs.CV cs.CR 57%

Dynamic Optical Test for Bot Identification (DOT-BI): A simple check to identify bots in surveys and online processes

动态光学测试用于机器人识别(DOT-BI):一种简单的检查以在调查和在线过程中识别机器人

Malte Bleeker, Mauro Gotsch

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 DOT-BI通过利用人类对运动的感知来识别自动化系统,通过隐藏数字的动态特性区分人类与机器人,实验表明其在调查和在线过程中具有高识别率和良好的用户体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05661 2025-12-04 cs.CV 57%

Language-Driven Object-Oriented Two-Stage Method for Scene Graph Anticipation

基于语言的面向对象两阶段方法用于场景图预见

Xiaomeng Zhu, Changwei Wang, Haozhe Wang, Xinyu Liu, Fangzhen Lin

机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(计算机科学与工程系,香港科学与技术大学) Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center, Qilu University of Technology(计算能力网络与信息安全重点实验室,教育部,山东计算机科学中心,齐鲁大学) Academy of Interdisciplinary Studies, The Hong Kong University of Science and Technology(跨学科研究学院,香港科学与技术大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于语言的面向对象两阶段方法,通过时间一致性正则化预测对象集动态和关系轨迹,显著提升视频场景图预见性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01312 2025-12-02 cs.CV 57%

IVCR-200K: A Large-Scale Multi-turn Dialogue Benchmark for Interactive Video Corpus Retrieval

IVCR-200K: 一个大规模多轮对话基准数据集用于交互视频语料检索

Ning Han, Yawen Zeng, Shaohua Long, Chengqing Li, Sijie Yang, Dun Tan, Jianfeng Dong, Jingjing Chen

机构 * Xiangtan University(湘潭大学) Hunan University(湖南大学) Zhejiang Gongshang University(浙江工商大学) Fudan University(复旦大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出IVCR-200K数据集及基于多模态大语言模型的框架,用于交互视频语料检索,提升多轮对话式交互效果。

Comments Accepted by SIGIR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01298 2025-12-02 cs.CV 57%

TBT-Former: Learning Temporal Boundary Distributions for Action Localization

TBT-Former:基于时间边界分布的学习用于动作定位

Thisara Rathnayaka, Uthayasanker Thayasivam

机构 * Dept. of Computer Science \& Engineering University of Moratuwa Sri Lanka

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 TBT-Former通过改进的Transformer架构和边界分布回归头,提升动作定位性能,实现THUMOS14和EPIC-Kitchens 100数据集上的新高。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00953 2025-12-02 cs.CV 57%

Adaptive Evidential Learning for Temporal-Semantic Robustness in Moment Retrieval

自适应证据学习用于时刻检索中的时序-语义鲁棒性

Haojian Huang, Kaijing Ma, Jin Chen, Haodong Chen, Zhou Wu, Xianghao Zang, Han Fang, Chao Ban, Hao Sun, Mulin Chen, Zhongjiang He

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出DEMR框架,通过引入RFF模块和几何正则化器,提升时刻检索中对复杂视频场景的适应性与鲁棒性。

Comments Accepted by AAAI 2026, 10 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23477 2025-12-01 cs.CV 57%

Video-CoM: Interactive Video Reasoning via Chain of Manipulations

Video-CoM:通过操作链进行交互式视频推理

Hanoona Rasheed, Mohammed Zumri, Muhammad Maaz, Ming-Hsuan Yang, Fahad Shahbaz Khan, Salman Khan

机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) University of California Merced(加州梅尔 Ced 大学) Google Research(谷歌研究院) Linköping University(林奈大学) Australian National University(澳大利亚国立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 Video-CoM通过操作链实现交互式视频推理,提升视频理解任务的性能和可解释性

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11423 2025-12-01 cs.AI 57%

CURENet: Combining Unified Representations for Efficient Chronic Disease Prediction

CURENet:结合统一表示以实现高效的慢性疾病预测

Cong-Tinh Dao, Nguyen Minh Thao Phan, Jun-En Ding, Chenwei Wu, David Restrepo, Dongsheng Luo, Fanyi Zhao, Chun-Chieh Liao, Wen-Chih Peng, Chi-Te Wang, Pei-Fu Chen, Ling Chen, Xinglong Ju, Feng Liu, Fang-Ming Hung

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Can Tho University(Cần Thơ 大学) Stevens Institute of Technology(史蒂文斯理工学院) University of Michigan(密歇根大学) Massachusetts Institute of Technology(麻省理工学院) Florida International University(佛罗里达国际大学) Southern Utah University(南方犹他大学) Far Eastern Memorial Hospital(东方纪念医院) Yuan Ze University(元智大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 CURENet通过整合多模态EHR数据,利用LLMs和Transformer编码器提升慢性疾病预测的准确率,达到94%以上的预测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19637 2025-12-01 cs.CV 57%

Enhanced Partially Relevant Video Retrieval through Inter- and Intra-Sample Analysis with Coherence Prediction

通过互样本分析和内样本分析增强部分相关视频检索

Junlong Ren, Gangjian Zhang, Yu Hu, Jian Shu, Hui Xiong, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种增强部分相关视频检索的方法,通过互样本分析和内样本分析,结合时间一致性预测模块,提升视频与文本查询的语义对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02364 2025-12-01 eess.AS 57%

State-of-the-art Embeddings with Video-free Segmentation of the Source VoxCeleb Data

最先进的无视频分割源 VoxCeleb 数据嵌入

Sara Barahona, Ladislav Mošner, Themos Stafylakis, Oldřich Plchot, Junyi Peng, Lukáš Burget, Jan Černocký

专题命中 视频多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文提出了一种无需视频分割的说话人嵌入提取方法,利用弱标注数据训练提取器,实现了最先进的说话人验证性能,并提供了无需视觉的替代数据集创建方案。

Comments Accepted at the IEEE Automatic Speech Recognition and Understanding Workshop (ASRU) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22036 2025-12-01 cs.CL cs.LG 57%

ResearchArcade: Graph Interface for Academic Tasks

ResearchArcade: 用于学术任务的图界面

Jingjun Xu, Chongshan Lin, Haofei Yu, Tao Feng, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CL

AI总结 ResearchArcade是一种基于图的学术任务接口,通过统一多源数据和多模态信息,提升机器学习模型在学术研究中的性能与应用范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17490 2025-11-27 cs.CV 57%

Video-R4: Reinforcing Text-Rich Video Reasoning with Visual Rumination

Video-R4:通过视觉沉思强化文本丰富的视频推理

Yolo Y. Tang, Daiki Shimada, Hang Hua, Chao Huang, Jing Bi, Rogerio Feris, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) Sony Group Corporation(索尼集团) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 Video-R4通过视觉沉思机制提升文本丰富视频的推理能力,采用多阶段学习框架实现像素基础的多模态推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01533 2025-11-27 cs.CV 57%

ReasonAct: Progressive Training for Fine-Grained Video Reasoning in Small Models

ReasonAct: 为小模型在细粒度视频推理中的渐进训练

Jiaxin Liu, Zhaolu Kang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 ReasonAct通过三阶段训练提升小模型细粒度视频推理性能,实现比基线更高的准确率和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19882 2025-11-26 cs.CV 57%

ChessMamba: Structure-Aware Interleaving of State Spaces for Change Detection in Remote Sensing Images

ChessMamba: 结构感知的多时态空间交错用于遥感图像变化检测

Lei Ding, Tong Liu, Xuanguang Liu, Xiangyun Liu, Haitao Guo, Jun Lu

机构 * Information Engineering University(信息工程大学) Aerospace Information Research Institute, Chinese Academy of Sciences(航天信息研究所,中国科学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 ChessMamba通过结构感知的交错状态空间建模,提升多时态遥感图像变化检测的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12959 2025-11-26 cs.CV 57%

Time-step Mixup for Efficient Spiking Knowledge Transfer from Appearance to Event Domain

时间步混合用于从外观域到事件域的高效脉冲知识转移

Yuqi Xie, Shuhan Ye, Yi Yu, Chong Wang, Qixin Zhang, Jiazhen Xu, Le Shen, Yuanbin Qian, Jiangbo Qian, Guoqi Li

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出时间步混合知识转移方法,通过细粒度混合策略和模态感知辅助学习目标,实现从外观到事件域的高效脉冲神经网络知识转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19236 2025-11-25 cs.RO cs.AI 57%

SENTINEL: A Fully End-to-End Language-Action Model for Humanoid Whole Body Control

SENTINEL:一种用于人形机器人全身控制的端到端语言-动作模型

Yuxuan Wang, Haobin Jiang, Shiqing Yao, Ziluo Ding, Zongqing Lu

机构 * Peking University(北京大学) BeingBeyond

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

AI总结 SENTINEL是一种端到端语言-动作模型,通过直接映射语言指令和本体感觉输入到低层动作,实现人形机器人全身控制,并支持多模态扩展。

Comments 23 pages, 8 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏