Generating Multilingual Documents from a Knowledge Base: The TECHDOC Project
专题命中 视频多模态 :multimodal(abstract);分类 cs.CL
Comments 5 pages, TEX + PS figure
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 视频多模态 :multimodal(abstract);分类 cs.CL
Comments 5 pages, TEX + PS figure
R4DSG:面向长时序自我中心视频中以对象为中心的问答的相对4D场景图记忆
机构 * Samsung R&D Institute China - Beijing(三星中国研发研究院(北京)) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视频多模态 :分类 cs.CV、cs.AI、cs.MM;multimodal(comments)
AI总结 该研究提出R4DSG,一种面向长时序自我中心视频的相对4D场景图记忆,在EgoLifeQA数据集的对象相关问答任务中,较EgoRAG-Text取得显著性能提升,可作为可穿戴助手等的实用记忆载体。
Comments 10 pages, 3 figures, ACM Multimedia 2026, egocentric video; 3D scene graph; temporal memory; graph retrieval; object-state reasoning; multimodal question answering
世界在你手中:一个大规模且开源的生态系统,用于在真实世界中学习以人类为中心的操纵
专题命中 视频多模态 :multimodal(abstract,comments)
AI总结 本文提出World In Your Hands,一个包含1000小时真实人类操纵数据的开源生态系统,通过高精度运动捕捉和多模态数据提升机器人在杂乱环境中的操作成功率。
Comments This dataset represents the first large-scale collection of real-world, human-centric multimodal data integrating vision, language, tactile sensing, and action (VLTA) Github: https://github.com/tars-robotics/World-In-Your-Hands
专题命中 视频多模态 :分类 cs.CV、cs.AI;multimodal(comments);multimodal foundation model(comments)
Comments Accepted by ICCV Workshop 2023 (What is Next in Multimodal Foundation Models?)
事件相机表示学习系统综述
专题命中 视频多模态 :multimodal(abstract)
AI总结 综述从原始事件流转换为可学习表示的角度,分类梳理了基于密集和稀疏表示的方法,分析其在结构规则性、时间保真度、稀疏保持和架构兼容性上的权衡,并总结基准与未来方向。
Comments Under Review
利用TESS重新研究耀变体PKS 0735+178的中微子事件时期
专题命中 视频多模态 :multi-modal(abstract)
AI总结 本文利用TESS观测耀变体PKS 0735+178的周级耀发,分析其光学光变特性,探讨该源光学变异性与同期中微子事件的可能关联,为其光学流量行为提出物理场景。
Comments Accepted for publication in ApJ, 13 pages, 6 figures, 1 table
用于多相输运和热系统数据驱动建模的开放多模态数据集与开源软件
机构 * Department of Mechanical Engineering, University of Arkansas(阿肯色大学机械工程系)
专题命中 视频多模态 :multimodal(abstract)
AI总结 本文介绍了一个由NED3实验室开发的开放多模态数据集和开源软件生态系统,提出了空间加时间维度(S+TD)分类框架,并重点描述了SeqReg序列回归库,以推动可复现的AI赋能热流体研究。
Comments Accepted manuscript replacing arXiv:2605.23037 (v1). Substantially expanded from the original preprint and published in Transport Phenomena 2026, 1(3), 20260081. https://doi.org/10.1515/tp-2026-0081
Journal ref Transport Phenomena 2026, 1(3), 20260081
通过触觉梦想学习多功能人形操作
机构 * Carnegie Mellon University(卡内基梅隆大学) ; UT Arlington(UT阿灵顿) ; Bosch Center for AI(博世人工智能中心)
专题命中 视频多模态 :multimodal(abstract)
AI总结 本文提出HTD模型,结合触觉、视觉和本体感觉,通过触觉梦想增强学习实现高灵活性的人形操作,实验证明在五个真实任务中成功率提升显著。
一种用于分析准周期生理信号瞬态形态变化及其神经源性关联的新方法
专题命中 视频多模态 :multimodal(abstract)
AI总结 本文提出了一种新的可视化方法,用于分析准周期生理信号的瞬态形态变化及其神经源性关联,通过二维地毯图同时评估心跳节律和信号特征。
Comments 31 pages, 7 figures
基于状态条件转移采样的非参数时空轨迹预测
机构 * Amazon Web Services(亚马逊网络服务)
专题命中 视频多模态 :multi-modal(abstract)
AI总结 该研究提出一种无训练的非参数时空轨迹预测方法,无需GPU和学习参数,在数据充足时精度与57M参数Transformer相当,数据稀缺时性能显著更优,可从少量历史数据部署到新区域。
JEPA-WAM:机器人操作中世界-动作模型的阶段级联合嵌入预测
专题命中 视频多模态 :multimodal(abstract)
AI总结 该研究针对通用机器人策略未明确建模任务阶段级未来的问题,提出JEPA-WAM模型,在50个RoboTwin 2.0任务上实现90.25%的整体成功率,成功减少了平均执行步骤数。
面向配备分布式储能的数据中心的概率功率供应理论
专题命中 视频多模态 :multi-modal(abstract)
AI总结 本文针对配备分布式储能的数据中心的电力供应问题,提出概率框架,划分两种运行模式并引入等效功率概念,经三类生产数据中心工作负载验证,为下一代AI数据中心提供规模设计原则。
Comments 26 pages, 7 figures, 5 tables
机器人操作是视觉到几何映射(f(v)→G):超越语言和视频模型的视觉-几何骨干
机构 * Sun Yat-sen University(中山大学) ; Guangdong Key Laboratory of Big Data Analysis(大数据分析与处理广东省重点实验室) ; X-Era AI Lab(X-Era人工智能实验室) ; AMAP, Alibaba(阿里妈妈实验室) ; Guangdong University of Technology(广东工业大学)
专题命中 视频多模态 :image-text(abstract)
AI总结 本文提出基于视觉-几何骨干的机器人操作方法,通过直接利用预训练的3D表示生成动作,优于传统语言或视频模型,在精确操作和零样本泛化中表现更优。
Comments Accepted at ACM Multimedia 2026
从支架到内化:利用原位可视化与运动反馈强化心肺复苏(CPR)训练
专题命中 视频多模态 :multimodal(abstract)
AI总结 本研究针对现有CPR训练系统依赖外部反馈导致技能保持差的问题,设计了阶段自适应多模态混合现实训练系统Kinesthetic-CPR,经60人参与的受控研究验证,为CPR训练系统提供了设计启示。
Comments In The 39th Annual ACM Symposium on User Interface Software and Technology (UIST '26), November 02-05, 2026, Detroit, MI, USA. ACM, New York, NY, USA, 15 pages. https://doi.org/10.1145/3830398.3830498
无序地标视觉导航
专题命中 视频多模态 :multimodal(abstract)
AI总结 针对无序图像导航的挑战,本文提出无需时间与里程计先验的ULVN框架,通过整合建图、定位与规划,在仿真和真实场景中性能优于现有最优方法。
Comments ECCV2026 Oral & Spotlight
Loom:利用局部邻域和全局轨迹对空间转录组学进行多区域分析
专题命中 视频多模态 :multi-modal(abstract)
AI总结 Loom是用于空间转录组学分析的视觉计算系统,利用新颖图形符号和计算框架,应对多模态整合挑战,经案例研究和可用性研究评估,有效支持细胞转变及时空表达动态发现。
支持高速脑电图记录和时间干扰刺激的便携式脑电图-经颅电刺激平台的设计与验证
专题命中 视频多模态 :multimodal(abstract)
AI总结 本研究设计并验证了一款以MCU为核心的便携式EEG-tES平台,集成8通道EEG采集与2通道tES功能,具备高信号保真度与低刺激误差,为便携式闭环神经调控系统提供了实用基础。
超越静态预测:利用世界模型进行移动交通外推
专题命中 视频多模态 :multimodal(abstract)
AI总结 本文提出MobiWM世界模型,用于移动网络中的移动交通外推,通过融合多模态环境上下文和编码动作,提升空间理解,实验表明其在所有评估场景中均取得最佳分布保真度。
大黄蜂:用于大规模推荐系统的交错混合层构建块
专题命中 视频多模态 :cross-modal(abstract)
AI总结 研究针对推荐系统发展的两条轨道缺乏交互的问题,提出大黄蜂架构,通过交错可堆叠块设计,结合多种技术,实现模态混合与信息丰富,经实验验证该方法优于基线模型,证明交错异构单元是有前途的推荐架构范式。
NeuroWorld:用于刺激条件下人脑动力学的潜在脑世界模型
专题命中 视频多模态 :multimodal(abstract)
AI总结 研究针对现有脑编码模型的时间约束缺陷,提出首个脑世界模型NeuroWorld,通过两阶段方法在三个fMRI基准上实现了更优的脑活动多步预测性能,为脑活动因果预测提供了新框架。
Comments 10 pages, 9 figures
0.55T下同时进行EEG-fMRI可行性的研究:记录、去噪与功能映射
专题命中 视频多模态 :multimodal(abstract)
AI总结 本研究证明在0.55T下同时进行EEG-fMRI的可行性,通过去噪和功能映射展示了多模态神经成像的潜力。
时间策略:用于机器人演示学习的历史初始化动作生成
机构 * University of Alberta(阿尔伯塔大学)
专题命中 视频多模态 :multimodal(abstract)
AI总结 本文提出Temporal Policy生成框架,将动作生成为时间耦合传输问题,在降低近一个数量级传输成本的同时匹配基线成功率,实现高频闭环控制。
Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)
SAVVY:面向视频学习分析的学生注意力可视化
专题命中 视频多模态 :multimodal(abstract)
AI总结 针对现有视频学习注意力分析算法易受噪声干扰、教师修订成本高的问题,提出基于多模态脑信号的注意力建模框架,开发整合视听注意力的SAVVY可视化系统,经验证可有效辅助教学视频优化。
COIVis:基于眼动的MOOC视频概念学习视觉探索
专题命中 视频多模态 :multimodal(abstract)
AI总结 COIVis通过眼动追踪技术分析MOOC视频中学习过程,提取课程概念并定义感兴趣概念,提供多视角可视化,帮助教师理解学习者认知状态,支持个性化干预和教学优化。
Comments 17pages, 8 figures
Journal ref IEEE Transactions on Visualization and Computer Graphics, vol. 32, no. 7, pp. 7074-7091, July 2026
StateScribe: 向现实世界重访中的可访问性变化意识迈进
专题命中 视频多模态 :multimodal(abstract)
AI总结 StateScribe通过双层记忆架构实现跨重访的现实变化感知,提高盲人和低视力用户对环境变化的认知能力,准确率达83.1%。
从笔到调色板:梵高心理轨迹的数学分析
专题命中 视频多模态 :multi-modal(abstract)
AI总结 该研究通过对梵高信件片段情感分析和画作分形维数分析,运用临界慢化理论,发现视觉复杂性与死亡情绪相关,重大危机前有CSD模式,如1888年割耳事件,揭示数学方法可检测历史人物心理转变特征。
一种带有触觉反馈的视觉-触觉数据采集系统用于粗到细模仿学习
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)
专题命中 视频多模态 :multimodal(abstract)
AI总结 本文提出一种视觉-触觉数据采集系统,生成时间结构丰富的接触密集演示,用于模仿学习。通过直接驱动夹具和触觉阵列,保留自然触觉反馈,结合实时注释,生成多模态数据集以支持粗到细学习算法。
用于基于平面激光雷达的人体姿态估计的分解时空卷积
机构 * Dalle Molle Institute for Artificial Intelligence (IDSIA), USI-SUPSI(瑞士意大利语区大学提契诺大学人工智能达勒莫利研究所)
专题命中 视频多模态 :cross-modal(abstract)
AI总结 针对服务机器人仅配备平面激光雷达和普通处理器的情况,提出基于时空块的轻量级网络,用于全向人体检测和相对2D姿态估计,通过跨模态自监督训练,优于基线模型,适用于计算受限的服务机器人空间感知。
Facade:使用深度上下文异常检测的高精度内部威胁检测
专题命中 视频多模态 :multi-modal(abstract)
AI总结 研究内部人员特权访问带来的威胁,提出Facade系统,通过考虑事件上下文、基于多模态模型及对比学习策略检测可疑事件,能高精度检测内部威胁且误报率极低,可用于大型企业环境。
临床路径作为医院病房物理人工智能的安全规范
专题命中 视频多模态 :multimodal(abstract)
AI总结 研究针对医院病房物理人工智能系统的安全挑战,提出将临床路径作为安全规范,构建集成多种组件的概念性机器人架构,用运行时安全监视器结合多种方法识别安全违规,助力护理人员并为安全物理人工智能做贡献。
Comments 4 pages, 3 figures. Accepted at the 1st IJCAI Workshop on Safe Physical AI (SPAI 2026), held in conjunction with IJCAI-ECAI 2026, Bremen, Germany