ViDove: A Translation Agent System with Multimodal Context and Memory-Augmented Reasoning
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI、eess.AS
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI、eess.AS
机构 * Department of Bioengineering, Imperial College London(帝国理工学院伦敦分校生物工程系) ; School of Robotics, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学机器人学院)
专题命中 多模态Agent :multimodal(title,abstract);multi-modal(abstract)
Comments 19 pages, 24 figures
专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract)
Comments 4 pages, 2 figures, SIGIR 2025 Demonstration Submission
专题命中 多模态Agent :multi-modal(title,abstract);multimodal(abstract)
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments This paper has been accepted to the NAACL 2025 Main
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments 25 pages, 13 figures
专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments AAAI-25 (Oral). Project website: https://scai.cs.jhu.edu/projects/MuMA-ToM/ Code: https://github.com/SCAI-JHU/MuMA-ToM
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted to AAAI 2025 (Oral)
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments https://github.com/declare-lab/Emma-X, https://huggingface.co/declare-lab/Emma-X
专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract)
专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract)
专题命中 多模态Agent :MLLM(title,abstract);multi-modal(abstract)
Comments 9 pages, 6 figures; Submitted to IEEE Transactions on Intelligent Transportation Systems
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI、cs.MM
Comments Accepted by ACM Multimedia 2024
专题命中 多模态Agent :multi-modal(title,abstract);multimodal(abstract)
Comments 11 Pages, 5 figures
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 多模态Agent :multi-modal(title,abstract);MLLM(abstract)
Comments This work has been submitted to the IEEE for possible publication
专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments Project Page: https://sunzey.github.io/Make-it-Real/
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments ICML 2024
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments 17 pages; Accepted by ICML 2024
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI、eess.AS
Comments IROS2023, Detroit. See the project website at https://matcha-agent.github.io
专题命中 多模态Agent :multi-modal(title,abstract);multimodal(abstract)
Comments 9 pages, 9 figures, 1 table, 1 algorithm
记忆驱动的自我表露与关系转折点:人机交互的纵向多模态研究
机构 * Graduate School of Informatics, Kyoto University(京都大学信息学研究科) ; Equmenopolis, Inc.(Equmenopolis公司) ; Waseda University(早稻田大学) ; School of Informatics, Kyoto University(京都大学信息学系)
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究通过纵向多模态研究,探讨对话式人工智能系统中交互如何发展为关系。核心方法是让参与者对五个关系构建要素评分,发现对话质量影响当下愉悦感,感知记忆受关系制约,关系有崩溃和激增等转折点,揭示了人机关系建立的方式。
Comments 15 pages, 3 figures. Accepted to ICMI 2026 (International Conference on Multimodal Interaction), October 5-9, 2026, Napoli, Italy
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI;multi-modal(comments)
Comments Accepted to ICCV 2025 Workshop on Multi-Modal Reasoning for Agentic Intelligence
专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.CV、cs.AI
Comments A multi-modal, ego-centric 3D perception dataset and benchmark for holistic 3D scene understanding. Project page: http://tai-wang.github.io/embodiedscan
超越单摄像头:体育视频理解中的智能多视角推理
机构 * Zhejiang University(浙江大学) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 多模态Agent :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV
AI总结 针对体育视频多视角理解缺乏评估基准及MLLMs难以利用多视角信息的问题,引入SportMV - Bench基准,分析瓶颈所在,并提出SportMV - Agent框架,通过迭代循环实现主动视角选择等,相比最强MLLM基线有显著提升。