Arabic Sign Language Recognition using Multimodal Approach
阿拉伯手语识别的多模态方法
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出结合Leap Motion和RGB摄像头的多模态方法,用于提高阿拉伯手语识别的准确率,实验结果显示78%的识别准确率。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
阿拉伯手语识别的多模态方法
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出结合Leap Motion和RGB摄像头的多模态方法,用于提高阿拉伯手语识别的准确率,实验结果显示78%的识别准确率。
用于多模态场景理解的声学场视频
专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出声学场视频作为多模态场景理解的新输入方式,通过整合空间声学数据显著提升视觉-语言模型的性能。
ToS: 一种针对视频中立体声音事件定位与检测的专家团队集成框架,包含距离估计
机构 * Centre for Vision, Speech ; Signal Processing (CVSSP) University of Surrey, Guildford, U.K.
专题命中 视频多模态 :multimodal(abstract);audio-visual(abstract);分类 eess.AS
AI总结 ToS框架通过整合三个互补子网络,有效解决视频中立体声音事件定位与检测的多维度推理问题,优于现有方法。
MAViS:一个用于长序列视频叙事的多智能体框架
机构 * Virginia Tech(弗吉尼亚理工大学) ; Nanyang Technological University(南洋理工大学) ; Eyeline Studios(Eyeline工作室)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 MAViS通过多智能体协作框架提升长序列视频生成的辅助能力、视觉质量和表达性,支持多模态输出。
Comments Video Generation Agent
X-LeBench:一个用于极长第一人称视频理解的基准数据集
机构 * University of Bristol(布里斯托大学) ; University of Manchester(曼彻斯特大学) ; University of Cambridge(剑桥大学) ; College of AI, Tsinghua University(清华大学人工智能学院) ; Meta ; Memories.ai Research(Memories.ai研究)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV
AI总结 X-LeBench通过模拟真实日常生活场景,构建了首个极长第一人称视频理解基准数据集,揭示了长视频理解中的关键挑战。
从模式到莱维飞行:对波哥大公共交通系统的机动性建模
专题命中 视频多模态 :multimodal(abstract)
AI总结 本文通过分析波哥大公共交通系统的通行记录,发现其移动模式符合莱维飞行动力学,提出了一种基于用户记录的复杂交通系统分析新方法。
Comments 20 pages, 7 figures
Journal ref J. Stat. Mech. (2026) 013403
基于足部与衣物状态估计的近身穿衣辅助
机构 * Creative Science and Engineering Faculty, Waseda Univ.(早稻田大学创意科学与工程学部) ; Future Robotics Organization, Waseda Univ.(早稻田大学未来机器人组织) ; Faculty of Science and Engineering, Waseda Univ.(早稻田大学科学与工程学部) ; The National Institute of Advanced Science and Technology(日本国家先进科学与技术研究院)
专题命中 视频多模态 :multi-modal(abstract)
AI总结 本研究提出基于语义信息的穿衣辅助方法,通过多模态数据融合实现对足部和衣物状态的精准估计,成功帮助10名受试者穿袜子,优于其他方法。
Comments Accepted at RA-L, 2026
通过Stein变分推断实现计算高效的最大后验序列估计
机构 * Department of Mechanical and Aerospace Engineering, University of California, Irvine(加州大学尔湾分校机械与航空航天工程系)
专题命中 视频多模态 :multimodal(abstract)
AI总结 本文提出Stein-MAP-Seq方法,通过整合Stein变分梯度下降与动态规划算法,实现高效多模态状态估计。
Comments 20 pages
评估跨模态检索中的视角偏差
机构 * Department of Computer Engineering, Chulalongkorn University(楚莱隆坤大学计算机工程系) ; School of Information Science and Technology, VISTEC(信息科学与技术学院,VISTEC)
专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CL
AI总结 本文提出3XCM基准,揭示跨模态检索中语言和文化偏见的影响,强调需通过解耦策略实现公平检索。
TelcoAI: 通过代理多模态检索增强生成技术推进3GPP技术规范搜索
机构 * Generative AI Innovation Center, Amazon Web Services (AWS)(生成式AI创新中心,亚马逊网络服务)
专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 TelcoAI通过代理多模态检索增强生成技术,提升3GPP技术规范搜索的准确性和效率,实现87%的召回率和16%的性能提升。
Comments Accepted to IJCNLP-AACL 2025
ManuRAG:面向制造业问答的多模态检索增强生成
专题命中 跨模态检索 :multi-modal(title,abstract)
AI总结 ManuRAG通过多模态检索增强生成技术,提升制造业问答的准确性与可靠性,适用于多种领域。
特征空间生成模型用于单样本类增量学习
专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 Gen1S通过特征空间生成模型提升单样本类增量学习中的新类识别性能
QualiRAG:用于视觉质量理解的检索增强生成
机构 * Shanghai Jiao Tong University(上海交通大学) ; East China Normal University(华东师范大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
AI总结 QualiRAG通过检索增强生成框架,利用大模型的潜在感知知识,实现无需训练的视觉质量理解与比较。
跨领域EEG情感识别与对比学习
机构 * School of Software Engineering, Xi'an Jiaotong University, China(西安交通大学软件工程学院) ; School of Computer Science and Technology, Xi'an Jiaotong University, China(西安交通大学计算机科学与技术学院)
专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV
AI总结 EmotionCLIP通过多模态对比学习提升EEG情感识别的跨领域泛化能力,实现跨受试者和跨时间的高准确率
Comments Accepted by IEEE ICASSP 2026
AR-Omni:一种统一的自回归模型用于任意到任意生成
机构 * The Hong Kong Polytechnic University(香港理工大学) ; University of Science and Technology of China(中国科学技术大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
专题命中 多模态生成 :any-to-any(title,abstract);multimodal(abstract);分类 cs.CL、cs.AI
AI总结 AR-Omni提出一种无需专家解码器的统一自回归模型,实现多模态任意到任意生成,解决模态不平衡、视觉保真度和稳定性与创造力平衡问题。
统一的多模态理解和生成模型:进展、挑战与机遇
机构 * Alibaba Group(阿里巴巴集团) ; Hong Kong University of Science and Technology(香港科学与技术大学) ; Nanjing University(南京大学) ; Peking University(北京大学) ; Tsinghua University(清华大学)
专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文探讨了多模态理解和生成模型的统一进展、挑战与机遇,分析了不同架构范式及未来研究方向。
Comments In this version, we incorporate new papers (after Aug. 2025), datasets, and benchmarks. This work is still in progress; Github project: https://github.com/AIDC-AI/Awesome-Unified-Multimodal-Models
PointMapPolicy: 结构化点云处理用于多模态模仿学习
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ; Reality Labs, Meta(Meta现实实验室) ; Johannes Kepler University Linz(林茨约翰尼斯·开普勒大学)
专题命中 多模态生成 :multi-modal(title,abstract)
AI总结 PointMapPolicy通过结构化点云处理提升多模态模仿学习的精度与泛化能力,利用xLSTM融合点云与RGB数据,在RoboCasa和CALVIN基准中取得最佳性能。
生成式人工智能在沙特阿拉伯:国家调查:采用、风险和公众认知
机构 * College of Computing and Informatics, Saudi Electronic University(计算机与信息学院,沙特电子大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 本研究通过全国调查分析沙特阿拉伯GenAI的采用情况、风险和公众认知,发现93%的受访者积极使用GenAI进行文本任务,但整体意识和理解不均衡,需加强AI素养和伦理培训。
Uni-RS: 一种用于遥感的具有空间忠实性的统一理解和生成模型
机构 * Institute of Remote Sensing and Geographic Information System, School of Earth and Space Sciences, Peking University(遥感与地理信息系统研究所,地球与空间科学学院,北京大学) ; Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(土木与环境工程系,香港科学与技术大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 Uni-RS通过空间布局规划、空间感知查询监督和图像描述空间布局变化,提升遥感文本到图像生成的空间忠实性,同时保持多模态理解任务的性能。
超越工具性和替代性范式:引入机器文化作为大型语言模型中的涌现现象
专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出机器文化作为大型语言模型中的一种新兴现象,挑战传统工具性和替代性范式,揭示模型在文化表现上的独特特性。
Comments 16 pages, 6 figures
科学图像合成:基准测试、方法论与下游应用
机构 * Shanghai Jiao Tong University(上海交通大学) ; OpenDataLab, Shanghai Artificial Intelligence Laboratory(OpenDataLab,上海人工智能实验室) ; The University of Hong Kong(香港大学) ; Peking University(北京大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出ImgCoder框架和SciGenBench基准,通过逻辑驱动方法提升科学图像生成的结构精度,并展示微调LMMs在科学图像上的效果,验证了高保真合成在多模态推理中的潜力。
扁平化复杂:通过组合k-cell粒子进行联合B-Rep生成
机构 * Nanjing University(南京大学)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出了一种基于组合k-cell粒子的B-Rep生成方法,通过解耦层次结构实现拓扑与几何的联合生成,提升生成模型的精度和可编辑性。
通过局部估计分布生成合成数据以实现披露控制
专题命中 多模态生成 :multimodal(abstract)
AI总结 本文提出局部重采样器方法,通过局部估计分布生成合成数据,有效降低异常值导致的披露风险,提升数据效用与隐私保护的平衡。
MMR-Bench: 多模态大语言模型路由的综合基准
机构 * School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) ; National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学)
专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI
AI总结 MMR-Bench提供多模态大语言模型路由的统一基准,通过可控环境和广泛任务集评估路由策略,实验证明多模态信号可提升路由性能并超越单模型表现。
BLEnD-Vis: 评估视觉语言模型在多模态文化理解中的基准测试
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 BLEnD-Vis通过多模态文化基准测试评估视觉语言模型在语言重述和视觉模态下的文化理解稳健性,揭示当前模型在文化知识上的脆弱性,并指导更文化胜任的模型发展。
Comments EACL 2026
MSSDF:多模态自监督蒸馏用于高分辨率遥感图像学习
机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(测绘遥感信息工程国家重点实验室,武汉大学) ; Electronic Information School, Wuhan University(电子信息学院,武汉大学)
专题命中 多模态评测 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 MSSDF通过多模态自监督学习提升高分辨率遥感图像的预训练效果,优于现有方法,尤其在语义分割和深度估计任务中表现突出。
一种结合Mamba-Transformer网络的多模态特征蒸馏用于缺失模态的脑肿瘤分割
专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出一种结合Mamba-Transformer网络的多模态特征蒸馏方法,用于在缺失模态情况下实现更准确的脑肿瘤分割。
Comments 14 pages, 5 figures
多模态评估框架MERA Multi对俄语架构的评估
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出MERA Multi框架,用于评估俄语多模态架构,包含18个新任务和统一的评估方法,旨在解决俄语多模态基准缺失的问题。
Comments EACL main track
MangaVQA和MangaLMM:多模态漫画理解的基准和专用模型
机构 * The University of Tokyo(东京大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出MangaVQA和MangaLMM,用于多模态漫画理解的基准和专用模型,通过视觉问答和文本识别任务提升漫画叙事理解能力。
Comments EACL 2026 Findings. Project page: https://manga109.github.io/MangaVQA_LMM/
RotBench: 对多模态大语言模型识别图像旋转能力的评估
机构 * UNC Chapel Hill(北卡罗来纳大学夏洛特分校) ; Allen Institute for Artificial Intelligence(人工智能研究院) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 RotBench评估了多模态大语言模型在识别图像旋转角度方面的性能,发现大多数模型难以区分90°和270°旋转,但能识别0°和180°图像,揭示了模型空间推理能力与人类的差距。
Comments EACL 2026 Camera-Ready. Code and data: https://github.com/tianyiniu/RotBench