arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4749 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4749 篇

2502.18220 2026-03-24 cs.CV cs.AI 62%

UASTrack: A Unified Adaptive Selection Framework with Modality-Customization in Single Object Tracking

UASTrack: 一种具有模态定制化的统一自适应选择框架在单目标跟踪中

He Wang, Tianyang Xu, Zhangyong Tang, Xiao-Jun Wu, Josef Kittler

机构 * School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机科学学院) Centre for Vision, Speech and Signal Processing, University of Surrey(萨里大学视觉、语音和信号处理中心)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 UASTrack通过统一自适应选择框架实现多模态跟踪中的模态定制化,有效过滤噪声并提升跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20422 2026-03-24 cs.CV cs.AI cs.IR 62%

PEARL: Personalized Streaming Video Understanding Model

PEARL:个性化流视频理解模型

Yuanhong Zheng, Ruichuan An, Xiaopeng Lin, Yuxing Liu, Sihan Yang, Huanyu Zhang, Haodong Li, Qintong Zhang, Renrui Zhang, Guopeng Li, Yifan Zhang, Yuheng Li, Wentao Zhang

机构 * Peking University(北京大学) Adobe CASIA Stepfun CUHK(香港中文大学) Zhongguancun Academy(中关村学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出个性化流视频理解任务PSVU,并引入PEARL-Bench基准测试,通过帧级和视频级两种模式评估模型对个性化概念的响应能力,提出无需训练的PEARL策略,实现先进性能。

Comments Arxiv Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19565 2026-03-23 cs.CV cs.AI cs.LG 62%

PFM-VEPAR: Prompting Foundation Models for RGB-Event Camera based Pedestrian Attribute Recognition

基于RGB事件相机的行人属性识别的PFM-VEPAR:用于基础模型的提示方法

Minghe Xu, Rouying Wu, ChiaWei Chu, Xiao Wang, Yu Li

机构 * City University of Macau(澳门城市大学) Zhuhai College of Science and Technology(珠海科学技术学院) Macau University of Science and Technology(澳门科学大学) School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PFM-VEPAR,通过轻量级DCT和IDCT提取事件域特征,结合外部记忆库和Hopfield网络提升行人属性识别的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19546 2026-03-23 cs.LG cs.AI cs.CV 62%

Subspace Kernel Learning on Tensor Sequences

张量序列的子空间核学习

Lei Wang, Xi Ding, Yongsheng Gao, Piotr Koniusz

机构 * Griffith University(格里菲斯大学) Data61 CSIRO University of New South Wales(新南威尔士大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出UKTL框架,通过不确定性驱动的子空间加权和可扩展的Nyström线性化,实现对多模式张量的高效学习,取得最先进的性能和有意义的模式洞察。

Comments Accepted at the Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18062 2026-03-23 cs.CV cs.AI 62%

S3T-Former: A Purely Spike-Driven State-Space Topology Transformer for Skeleton Action Recognition

S3T-Former:一种纯粹由脉冲驱动的状态空间拓扑变换器用于骨骼动作识别

Naichuan Zheng, Hailun Xia, Zepeng Sun, Weiyi Li, Yujia Wang

机构 * School of Information and Communication Engineering(信息与通信工程学院) Beijing University of Posts and Telecommunications(北京邮电大学) International School(国际学校) School of Economics and Management(经济管理学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出S3T-Former,一种专为高效骨骼动作识别设计的脉冲驱动变换器,通过多流解剖脉冲嵌入和横向脉冲拓扑路由实现稀疏事件流,提升能效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17948 2026-03-19 cs.CV cs.AI 62%

VideoAtlas: Navigating Long-Form Video in Logarithmic Compute

VideoAtlas: 在对数计算中导航长视频

Mohamed Eltahir, Ali Habibullah, Yazan Alshoibi, Lama Ayash, Tanveer Hussain, Naeemullah Khan

机构 * King Abdullah University of Science and Technology (KAUST)(卡斯特大学) Department of Computer Science, King Khalid University (KKU)(国王 Khalid 大学计算机科学系) Department of Computer Science, Edge Hill University(Edge Hill 大学计算机科学系)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 VideoAtlas通过层次化网格结构实现长视频的无损表示,解决视频表示和长上下文问题,提出Video-RLM架构,展示对数计算增长、环境预算和自适应计算分配等贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17307 2026-03-19 cs.CV cs.AI 62%

Symphony: A Cognitively-Inspired Multi-Agent System for Long-Video Understanding

Symphony:一种受认知启发的多智能体系统用于长视频理解

Haiyang Yan, Hongyun Zhou, Peng Xu, Xiaoxue Feng, Mengyi Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Kuaishou Technology(快手科技) School of Future Technology, University of Chinese Academy of Sciences(中国科学院大学未来技术学院)

专题命中 视频多模态 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Symphony多智能体系统,通过模拟人类认知模式,提升长视频理解任务的推理能力,实验显示在多个基准测试中表现优异。

Comments Accepted by cvpr2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12664 2026-03-17 cs.CL cs.AI 62%

From Text to Forecasts: Bridging Modality Gap with Temporal Evolution Semantic Space

从文本到预测:通过时间演化的语义空间弥合模态差距

Lehui Li, Yuyao Wang, Jisheng Yan, Wei Zhang, Jinliang Deng, Haoliang Sun, Zhongyi Han, Yongshun Gong

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TESS方法,通过引入时间演化语义空间弥合文本与预测模型间的模态差距,实验显示在四个真实世界数据集上预测误差降低29%。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10979 2026-03-17 cs.CV cs.AI 62%

PAS: A Training-Free Stabilizer for Temporal Encoding in Video LLMs

PAS:一种无训练的时序编码稳定器

Bowen Sun, Yujun Cai, Ming-Hsuan Yang, Hang Wu, Yiwei Wang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对视频大语言模型中时序不一致问题,提出PAS机制,通过相位聚合平滑技术减少帧间扰动,提升注意力稳定性,实验表明在不增加计算开销的情况下提升了视频理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13374 2026-03-17 cs.CV cs.AI 62%

Geometry-Aware Semantic Reasoning for Training Free Video Anomaly Detection

基于几何的语义推理用于无训练视频异常检测

Ali Zia, Usman Ali, Muhammad Umer Ramzan, Hamza Abid, Abdul Rehman, Wei Xiang

机构 * School of Computing, Engineering \& Mathematical Sciences, La Trobe University, Melbourne, Australia School of Engineering Applied Sciences, GIFT University, Gujranwala 52250, Pakistan

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MM-VAD框架,通过将异常检测转为适应性测试时推理,利用双曲空间保留层次结构,并结合可学习提示和Mahalanobis细化提升性能,实现在多个基准上优于现有无训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05092 2026-03-17 cs.LG cs.AI cs.CL 62%

Aura: Universal Multi-dimensional Exogenous Integration for Aviation Time Series

Aura:通用多维外源整合用于航空时间序列

Jiafeng Lin, Mengren Zheng, Simeng Ye, Yuxuan Wang, Huan Zhang, Yuhui Liu, Zhongyi Pei, Jianmin Wang

机构 * School of Software, BNRist, Tsinghua University(软件学院、BNRist、清华大学) Hongshen College, Chongqing University(弘深学院、重庆大学) School of Software, Tsinghua University(软件学院、清华大学) China Southern Airlines(中国南方航空)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Aura框架,通过整合多维外源因素提升航空时间序列预测精度,实验表明其在航空安全与可靠性方面具有广泛应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12938 2026-03-16 cs.CV cs.AI 62%

Thinking in Streaming Video

流式视频思考

Zikang Liu, Longteng Guo, Handong Li, Ru Zhen, Xingjian He, Ruyi Ji, Xiaoming Ren, Yanhao Zhang, Haonan Lu, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) OPPO AI Center, OPPO Inc.(OPPO人工智能中心,OPPO公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ThinkStream框架,通过Watch-Think-Speak范式实现流式视频推理,采用RCSM压缩内存和流式强化学习提升效率,实验表明其在多个流式视频基准上性能优越且低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03666 2026-03-12 cs.CV cs.AI 62%

MonitorVLM:A Vision Language Framework for Safety Violation Detection in Mining Operations

MonitorVLM:一种用于采矿作业中安全违规检测的视觉语言框架

Jiang Wu, Sichao Wu, Yinsong Ma, Guangyuan Yu, Haoyuan Xu, Lifang Zheng, Jingliang Duan

机构 * School of Mechanical Engineering, University of Science and Technology Beijing(北京科技大学机械工程学院) Laboratory for Computational Sensing and Robotics, Johns Hopkins University(约翰霍普金斯大学计算感知与机器人实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 MonitorVLM通过视觉语言框架提升采矿作业中安全违规检测的精度和召回率,实现高效自动化监控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08927 2026-03-11 cs.CV cs.MM 62%

MEGC2026: Micro-Expression Grand Challenge on Visual Question Answering

MEGC2026:面向视觉问答的微表情大奖挑战

Xinqi Fan, Jingting Li, John See, Moi Hoon Yap, Su-Jing Wang, Adrian K. Davison

机构 * Department of Computing and Mathematics, Manchester Metropolitan University(曼彻斯特 Metropolitan 大学计算与数学系) State Key Laboratory of Cognitive Science and Mental Health, Institute of Psychology, CAS & Department of Psychology, University of the Chinese Academy of Sciences(中国科学院心理研究所认知科学与心理健康国家重点实验室及中国科学院大学心理学系) School of Mathematical and Computer Sciences, Heriot-Watt University Malaysia(赫瑞-沃森大学马来西亚分校数学与计算机科学学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 MEGC2026通过视觉问答任务探索微表情识别,利用多模态大语言模型和大视觉-语言模型提升微表情分析能力。

Comments MEGC 2026 at IEEE FG 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05437 2026-03-10 cs.CV cs.AI 62%

SAIL: Similarity-Aware Guidance and Inter-Caption Augmentation-based Learning for Weakly-Supervised Dense Video Captioning

SAIL:基于相似性感知引导和跨字幕增强学习的弱监督密集视频字幕生成

Ye-Chan Kim, SeungJu Cha, Si-Woo Kim, Minju Jeon, Hyungee Kim, Dong-Jin Kim

机构 * Hanyang University(翰阳大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 SAIL通过跨模态对齐和大语言模型增强策略,提升弱监督密集视频字幕生成的准确性和语义感知能力。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00141 2026-03-06 cs.CV cs.AI 62%

FLoC: Facility Location-Based Efficient Visual Token Compression for Long Video Understanding

FLoC:基于设施定位的高效视觉令牌压缩用于长视频理解

Janghoon Cho, Jungsoo Lee, Munawar Hayat, Kyuwoong Hwang, Fatih Porikli, Sungha Choi

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 FLoC提出了一种基于设施定位函数的高效视觉令牌压缩方法,通过懒惰贪心算法实现紧凑且多样化的令牌选择,有效提升长视频理解的处理效率和性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18833 2026-03-04 cs.SD cs.CV eess.AS eess.IV 62%

PrismAudio: Decomposed Chain-of-Thoughts and Multi-dimensional Rewards for Video-to-Audio Generation

PrismAudio:分解的思维链与多维奖励用于视频到音频生成

Huadai Liu, Kaicheng Luo, Wen Wang, Qian Chen, Peiwen Sun, Rongjie Huang, Xiangang Li, Jieping Ye, Wei Xue

机构 * Hong Kong University of Science and Technology (HKUST)(香港科技大学) Tongyi Fun Team, Alibaba Group(通义Fun团队,阿里巴巴集团) The Chinese University of Hong Kong (CUHK)(香港中文大学)

专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV、eess.AS

AI总结 PrismAudio通过分解思维链与多维奖励,解决视频到音频生成中的目标纠缠问题,实现更高质量的生成效果。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01694 2026-03-03 cs.CV cs.AI cs.LG 62%

MVR: Multi-view Video Reward Shaping for Reinforcement Learning

MVR:多视图视频奖励塑造用于强化学习

Lirui Luo, Guoxi Zhang, Hongming Xu, Yaodong Yang, Cong Fang, Qing Li

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室)

专题命中 视频多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 MVR通过多视角视频和视觉语言模型提升强化学习中的奖励塑造,有效解决复杂动态任务中的状态相关性和视角偏见问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01169 2026-03-03 cs.CV cs.AI cs.LG 62%

TripleSumm: Adaptive Triple-Modality Fusion for Video Summarization

TripleSumm: 适应性三模态融合用于视频摘要

Sumin Kim, Hyemin Jeong, Mingu Kang, Yejin Kim, Yoori Oh, Joonseok Lee

机构 * Seoul National University(首尔国立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 TripleSumm通过适应性三模态融合技术,在视频摘要任务中实现了最先进的性能,首次提出了多模态视频摘要的大型基准MoSu。

Comments Published as a Conference Paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01104 2026-03-03 cs.HC cs.AI cs.CV cs.CY 62%

Egocentric Co-Pilot: Web-Native Smart-Glasses Agents for Assistive Egocentric AI

第一人称共驾:面向辅助第一人称AI的网页原生智能眼镜代理

Sicheng Yang, Yukai Huang, Weitong Cai, Shitong Sun, Fengyi Fang, You He, Yiqiao Xie, Jiankang Deng, Hang Zhang, Jifei Song, Zhensong Zhang

机构 * Shenzhen International Graduate School Tsinghua University Shenzhen China(深圳国际研究生院清华大学深圳中国) Independent Researcher London United Kingdom(独立研究者伦敦英国) Queen Mary University of London London United Kingdom(女王玛丽大学伦敦英国) Imperial College London London United Kingdom(帝国理工学院伦敦英国) University Of Surrey Guildford United Kingdom(Surrey大学Guildford英国)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Egocentric Co-Pilot通过网页原生智能眼镜代理实现第一人称AI的持续辅助,结合神经符号框架和多模态意图层,展示了在日常生活中提升可及性和情境感知的实用路径。

Comments 14 pages, 6 figures, WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22026 2026-02-26 cs.CV cs.AI 62%

RGB-Event HyperGraph Prompt for Kilometer Marker Recognition based on Pre-trained Foundation Models

基于预训练基础模型的RGB-Event超图提示用于基于预训练基础模型的公里标识别

Xiaoyu Xian, Shiao Wang, Xiao Wang, Daxin Tian, Yan Tian

机构 * School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院) CRRC Academy Co., Ltd(CRRC研究院)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于预训练基础模型的RGB-Event超图提示方法,构建首个大规模RGB-Event数据集EvMetro5K,用于提升地铁公里标识别性能。

Comments Accepted by IEEE Transactions on Cognitive and Developmental Systems (IEEE TCDS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20739 2026-02-25 cs.AI cs.CV 62%

PyVision-RL: Forging Open Agentic Vision Models via RL

通过强化学习构建开放代理视觉模型:PyVision-RL

Shitian Zhao, Shaoheng Lin, Ming Li, Haoquan Zhang, Wenshuo Peng, Kaipeng Zhang, Chen Wei

机构 * Shanghai AI Lab(上海人工智能实验室) Rice University(里士满大学) Shanda AI Research, Tokyo(上海沙达人工智能研究东京)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 PyVision-RL通过强化学习框架解决多模态代理的交互崩溃问题,结合回放策略和累积奖励提升多轮推理能力,实现高效视频理解与处理。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16210 2026-02-24 cs.CV cs.AI 62%

PyraTok: Language-Aligned Pyramidal Tokenizer for Video Understanding and Generation

PyraTok: 用于视频理解和生成的语言对齐金字塔分词器

Onkar Susladkar, Tushar Prakash, Adheesh Juvekar, Kiet A. Nguyen, Dong-Hwan Jang, Inderjit S Dhillon, Ismini Lourentzou

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 PyraTok通过多尺度文本引导量化和全局自回归目标,实现了视频理解和生成中语言与视觉的紧密对齐,提升了视频重建和零样本迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18763 2026-02-24 cs.CV cs.AI 62%

TAG: Thinking with Action Unit Grounding for Facial Expression Recognition

TAG:基于动作单元的面部表情识别中的思维

Haobo Lin, Tianyi Bai, Jiajun Zhang, Xuanhao Chang, Sheng Lu, Fangming Gu, Zengjie Hu, Wentao Zhang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 TAG通过基于动作单元的视觉-语言框架,提升面部表情识别的推理可信度和视觉一致性。

Comments 33 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18702 2026-02-24 cs.CV cs.AI 62%

Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding

基于接地的思考:用于长视频理解的课程强化推理与视频接地

Houlun Chen, Xin Wang, Guangyao Li, Yuwei Zhou, Yihan Chen, Jia Jia, Wenwu Zhu

机构 * Tsinghua University(清华大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Video-TwG通过课程强化框架和接地范式提升长视频理解,采用双阶段策略和TwG-GRPO算法优化推理与接地质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18540 2026-02-24 cs.CV cs.AI 62%

Rodent-Bench

Rodent-Bench:用于评估多模态大语言模型在啮齿动物行为标注中的性能

Thomas Heap, Laurence Aitchison, Emma Cahill, Adriana Casado Rodriguez

机构 * University of Bristol(布里斯托大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Rodent-Bench评估了多模态大语言模型在啮齿动物行为标注中的性能,发现现有模型存在时间分段、长视频处理和细微行为区分方面的挑战,为未来模型发展提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05523 2026-02-19 cs.CV cs.AI 62%

Prompt When the Animal is: Temporal Animal Behavior Grounding with Positional Recovery Training

提示当动物是:基于位置恢复训练的时序动物行为 grounding

Sheng Yan, Xin Du, Zongying Li, Yi Wang, Hongcang Jin, Mengyuan Liu

机构 * School of Artificial Intelligence, Chongqing University of Technology(重庆理工大学人工智能学院) National Key Laboratory of General Artificial Intelligence, Shenzhen Graduate School, Peking University(北京大学深圳研究生院国家通用人工智能实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出 Port 框架,通过位置恢复训练提升动物行为时序 grounding 的准确性,在 Animal Kingdom 数据集上取得 38.52 的 IoU@0.3 成绩,并在 ICME 2024 挑战赛中表现突出。

Comments Accepted by ICMEW 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15862 2026-02-19 cs.CL cs.AI 62%

Enhancing Action and Ingredient Modeling for Semantically Grounded Recipe Generation

增强语义 grounded 的动作和成分建模以实现语义 grounded 的食谱生成

Guoshan Liu, Bin Zhu, Yian Li, Jingjing Chen, Chong-Wah Ngo, Yu-Gang Jiang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出语义 grounded 的框架,通过两阶段流程结合监督微调和强化微调,提升食谱生成的语义准确性与成分预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17091 2026-02-19 cs.CV cs.AI cs.LG 62%

Ctrl-GenAug: Controllable Generative Augmentation for Medical Sequence Classification

Ctrl-GenAug: 可控生成增强用于医学序列分类

Xinrui Zhou, Yuhao Huang, Haoran Dou, Shijing Chen, Ao Chang, Jia Liu, Weiran Long, Jian Zheng, Erjiao Xu, Jie Ren, Alejandro F. Frangi, Ruobing Huang, Jun Cheng, Xiaomeng Li, Wufeng Xue, Dong Ni

机构 * National-Regional Key Technology Engineering Laboratory for Medical Ultrasound(国家级区域医疗超声关键技术工程实验室) School of Biomedical Engineering(生物医学工程学院) Medical School(医学院) Shenzhen University(深圳大学) Medical UltraSound Image Computing (MUSIC) Lab(医学超声图像计算(MUSIC)实验室) School of Artificial Intelligence(人工智能学院) The Hong Kong University of Science and Technology(香港科学与技术大学) Department of Electronic and Computer Engineering(电子与计算机工程系) The University of Manchester(曼彻斯特大学) The Third Affiliated Hospital of Sun Yat-sen University(中山大学第三附属医院) Longgang District People’s Hospital of Shenzhen(深圳龙岗区人民医院) The Second Affiliated Hospital of The Chinese University of Hong Kong(香港中文大学第二附属医院) School of Biomedical Engineering and Informatics(生物医学工程与信息学学院) NIHR Manchester Biomedical Research Centre(NIHR曼彻斯特生物医学研究中心)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Ctrl-GenAug通过可控生成增强方法提升医学序列分类性能,解决语义和序列可控性不足及噪声样本问题。

Comments Accepted by International Journal of Computer Vision, 30 pages, 11 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13329 2026-02-17 cs.CV cs.AI cs.RO 62%

HiST-VLA: A Hierarchical Spatio-Temporal Vision-Language-Action Model for End-to-End Autonomous Driving

HiST-VLA:一种用于端到端自动驾驶的分层时空视觉-语言-动作模型

Yiru Wang, Zichong Gu, Yu Gao, Anqing Jiang, Zhigang Sun, Shuo Wang, Yuwen Heng, Hao Sun

机构 * Bosch Corporate Research(博世企业研究) School of Communication and Information Engineering(信息工程学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 HiST-VLA通过分层时空视觉-语言-动作模型提升自动驾驶轨迹生成的精度与效率,实现端到端的自动驾驶系统。

详情

展开后加载摘要…

URL PDF HTML 收藏