A recurrent multi-scale approach to RBG-D Object Recognition
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV
Comments Master thesis extracted from the paper arXiv:1806.01673 submitted to accv 2018
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV
Comments Master thesis extracted from the paper arXiv:1806.01673 submitted to accv 2018
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV
Comments BMVC 2018 camera ready
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
Comments For any inquiries contact aharakeh(at)uwaterloo(dot)ca
专题命中 多模态生成 :audio-visual(abstract);分类 cs.CV
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV
Comments Accepted in IJCAI 2018
专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
Journal ref IEEE Transactions on Medical Imaging, 15 November 2017, Volume:PP Issue: 99
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI
专题命中 多模态生成 :multi-modal(abstract);分类 cs.MM
Comments single-column 20 pages, 3 figures, 6 tables
专题命中 多模态生成 :multimodal(abstract);分类 cs.CL
Comments 4 pages, 3 figures; Federated Conference on Computer Science and Information Systems, Prague (FedCSIS-2017) (Prague, Czech Republic)
Journal ref Proceedings of the 2017 Federated Conference on Computer Science and Information Systems (FedCSIS-2017), p.639-642, Prague, Czech Republic, September 3-6, 2017
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV
Comments To appear at BMVC 2017
专题命中 多模态生成 :multimodal(abstract);分类 cs.CL
Comments 7 pages; Accepted to ACL 2017
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
Journal ref IJCSI International Journal of Computer Science Issues, Vol. 8, Issue 6, No 2, November 2011
专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI
Journal ref Dans HCP workshop on "Supervisory Control in Critical Systems Management" - 3rd International Conference on Human Centered Processes (HCP-2008), Delft : Pays-Bas (2008)
利用学习分析增强沉浸式教师模拟:挑战与机遇
专题命中 多模态生成 :multimodal(abstract,comments)
AI总结 本研究探讨如何利用学习分析增强沉浸式教师模拟,分析其在教师专业发展中的挑战与机遇。
Comments 30 pages, 10 figures. This chapter examines immersive teacher simulations and multimodal analytics. Project website: https://teachergenai.github.io/
机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; Nanyang Technological University(南洋理工大学)
专题命中 多模态生成 :分类 cs.CV、cs.CL、cs.AI;MLLM(comments)
Comments EMNLP 2025 main; The first two authors contribute equally. Project Page: https://raccoon-mllm-gen.github.io/
专题命中 多模态生成 :分类 cs.CV、cs.CL、cs.AI;multimodal(comments)
Comments Accepted to 7th Multimodal Learning and Applications Workshop (MULA 2024) at the IEEE/CVF Conference on Computer Vision and Pattern Recognition 2024
机构 * German Aerospace Center (DLR)(德国航空航天中心) ; University of Lübeck(吕贝克大学) ; German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)
专题命中 多模态生成 :分类 cs.CV、cs.AI;multimodal(comments);multimodal foundation model(comments)
Comments Accepted for presentation at ICCV Workshops 2025, "The 4th Workshop on What is Next in Multimodal Foundation Models?" (MMFM)
Bolo:面向下一代AI数据库的经验证的模型中心
专题命中 多模态生成 :multi-modal(abstract)
AI总结 该研究针对现有模型平台无法满足AI数据库需求的问题,提出基于多阶段智能体系统的Bolo模型平台,可将不可用模型权重转化为经验证的可用推理流水线,在实验中取得良好效果。
Comments 5 Pages
极端低带宽丢包网络下的抗丢包语义通信
专题命中 多模态生成 :multi-modal(abstract)
AI总结 针对极端低带宽丢包网络的语义通信问题,提出ResiGLC框架,结合语言模型上下文预测与掩码学习,通过渐进式解码提升抗丢包性,可在低带宽下改善通信的感知质量。
Comments Accepted to appear in IEEE TMC. 14 pages, 15 figures, and 5 tables
从潜在影响到语言:面向扩散的受众易感特征内容生成
专题命中 多模态生成 :multimodal(abstract)
AI总结 针对现有面向扩散的内容生成方法难以转化扩散影响信号的问题,提出三阶段框架DOCG-AS,实验显示其在预测扩散影响上优于现有基线。
RFWM:用于生成动态无线辐射场的物理引导世界模型
专题命中 多模态生成 :multimodal(abstract)
AI总结 本研究针对动态未知环境下RF场建模泛化难的问题,提出物理引导的RF世界模型RFWM,采用两阶段训练策略,在新构建的基准上实现了优于现有最优方法的RF场生成性能。
基于扩散的去噪在参数估计中优于普通得分匹配:一个理论解释
专题命中 多模态生成 :multimodal(abstract)
AI总结 本文通过理论分析证明,对于具有分离模态的多峰分布,基于扩散的去噪得分匹配估计器(DDSME)相比普通得分匹配估计器(SME)具有更优的误差界,并解释了扩散方法优越性的原因。
用于高维聚类数据的扩散模型:通过贝叶斯分类实现本征维度适应性
专题命中 多模态生成 :multimodal(abstract)
AI总结 该研究将扩散模型理论与多模态高维聚类数据几何结合,通过K混合高斯框架证明其去噪可作为动态贝叶斯分类器,KL误差界线性依赖聚类最大本征维度,实现了本征维度适应性。
面向6G的电磁世界模型:环境重建与信道预测的统一框架
专题命中 多模态生成 :multi-modal(abstract)
AI总结 该研究针对6G智能终端需同时实现环境感知与通信的需求,提出EMWM统一框架,融合多模态信息完成信道预测与环境重建,性能优于基线方法,具备鲁棒性与零样本泛化能力。
车联网中协同安全智能:一项综述
专题命中 多模态生成 :multi-modal(abstract)
AI总结 本文综述了V2X环境下协同安全智能的研究进展,围绕SPD框架分析了协同感知、多模态预测和风险感知规划的发展,提出基于SPD的设计原则和评估实践,以提升交通安全水平。
Comments Published in IEEE Communications Surveys & Tutorials (Early Access). DOI: 10.1109/COMST.2026.3723946
用于协调多智能体探索的规划器条件扩散模型
机构 * National University of Singapore(新加坡国立大学)
专题命中 多模态生成 :multimodal(abstract)
AI总结 提出规划器条件扩散策略PCDP,通过规划器身份作为条件输入训练多模态单智能体策略,结合局部重排序实现协调,在多智能体探索中提升性能并验证了方法有效性。
Comments Code and models are available at https://github.com/marmotlab/PCDP
扩散模型中流蒸馏的定量近似框架
机构 * School of Mathematical Sciences, Fudan University(复旦大学数学学院) ; Shanghai Key Laboratory of Contemporary Applied Mathematics, Fudan University(复旦大学当代应用数学重点实验室)
专题命中 多模态生成 :multimodal(abstract)
AI总结 针对扩散模型中的流蒸馏,提出一个定量近似框架,将少步采样视为学习流映射组合下的误差传播,通过理论分析和实验验证了稳定性平衡的非均匀时间网格能显著降低端到端相对MSE。
基于单视图观测的真实场景中大型物体的双臂协同灵巧抓取
机构 * The University of Auckland(奥克兰大学) ; Chongqing University(重庆大学) ; Southwest University(西南大学)
专题命中 多模态生成 :multimodal(abstract)
AI总结 本文针对机器人双臂抓取大型物体的挑战,提出含多模态数据集、DDPM模块及执行策略的真实场景双臂抓取框架,实验表明其对未见物体抓取成功率高。
Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)
Scale-CDA:一款用于量产车的、可扩展的原型,旨在普及AI辅助的协同驾驶自动化(CDA)
专题命中 多模态生成 :MLLM(abstract_cn)
AI总结 本研究提出Scale-CDA这一开源工具链,基于OpenDBC与Openpilot构建,成本低于1000美元,可实现AI辅助CDA的即插即用改装,通过多车辆测试验证了其低时延与数据隐私保护能力,为普及协同自动驾驶提供了实用方案。