arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-09 至 2026-02-09 共收录 43 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 5 篇

2502.00229 2026-02-09 cs.HC 82%

When and How to Integrate Multimodal Large Language Models in College Psychotherapy: Perspectives from Multi-stakeholders

何时以及如何将多模态大语言模型整合到大学生心理治疗中:来自多利益相关者的视角

Jiyao Wang, Youyu Sheng, Qihang He, Zian Zhang, Haolong Hu, Yumei Jing, Dengbo He

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract)

AI总结 本研究探讨了多模态大语言模型在大学生心理治疗中的整合时机与方式,指出其作为辅助工具的作用,并揭示了用户接受度受社交身份和相对地位影响的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05863 2026-02-09 cs.LG cs.CL cs.RO 70%

Constrained Group Relative Policy Optimization

带约束的群体相对策略优化

Roger Girgis, Rodrigue de Schaetzen, Luke Rowe, Azalée Robitaille, Christopher Pal, Liam Paull

机构 * Mila - Quebec AI Institute(魁北克AI研究所) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 多模态Agent :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CL

AI总结 本文提出带约束的GRPO,通过拉格朗日松弛解决受约束策略优化问题,实验验证其在网格世界和机器人任务中的有效性。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06653 2026-02-09 cs.RO cs.AI 57%

RAPID: Reconfigurable, Adaptive Platform for Iterative Design

RAPID: 可重构、自适应平台用于迭代设计

Zi Yin, Fanhong Li, Shurui Zheng, Jia Liu

机构 * Zi Yin Fanhong Li Shurui Zheng Jia Liu

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 RAPID通过模块化硬件和软件栈实现机器人操作策略的快速迭代与多模态配置的高效实验

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03595 2026-02-09 cs.CV 57%

Refer-Agent: A Collaborative Multi-Agent System with Reasoning and Reflection for Referring Video Object Segmentation

Refer-Agent:一种具有推理和反思的协作多智能体系统用于指引用视频对象分割

Haichao Jiang, Tianming Liang, Wei-Shi Zheng, Jian-Fang Hu

机构 * Sun Yat-sen University(中山大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV

AI总结 Refer-Agent通过协作多智能体系统结合推理与反思机制,提升指引用视频对象分割的性能与灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02071 2026-02-09 cs.AI 57%

Human-AI Co-Embodied Intelligence for Scientific Experimentation and Manufacturing

人类-人工智能协同具身智能用于科学实验与制造

Xinyi Lin, Yuyang Zhang, Yuanhang Gan, Juntao Chen, Hao Shen, Yichun He, Lijun Li, Ze Yuan, Shuang Wang, Chaohao Wang, Rui Zhang, Na Li, Jia Liu

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本研究提出人类-人工智能协同具身智能,通过智能体-物理实验系统提升科学实验与制造的精度与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态训练与对齐 5 篇

2602.06351 2026-02-09 cs.AI cs.CV 84%

Trifuse: Enhancing Attention-Based GUI Grounding via Multimodal Fusion

Trifuse: 通过多模态融合增强基于注意力的GUI定位

Longhui Ma, Di Zhao, Siwei Wang, Zhao Lv, Miao Wang

机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学) Intelligent Game and Decision Lab, Academy of Military Sciences(智能游戏与决策实验室,军事科学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 Trifuse通过多模态融合提升GUI定位性能,整合注意力、OCR文本和图标描述语义,无需任务微调即可实现高效定位。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05885 2026-02-09 cs.IR cs.AI 83%

An item is worth one token in Multimodal Large Language Models-based Sequential Recommendation

在基于多模态大语言模型的序列推荐中,一个项目相当于一个标记

Qiyong Zhong, Jiajie Su, Ming Yang, Yunshan Ma, Xiaolin Zheng, Chaochao Chen

机构 * Zhejiang University(浙江大学) Singapore Management University(新加坡国立管理学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 Speeder通过多模态表示压缩、模态感知渐进优化和序列位置感知增强,提升多模态大语言模型在序列推荐中的效率与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06850 2026-02-09 cs.CV cs.AI cs.MM 67%

Rethinking Multi-Condition DiTs: Eliminating Redundant Attention via Position-Alignment and Keyword-Scoping

重新思考多条件DiTs:通过位置对齐和关键词范围消除冗余注意力

Chao Zhou, Tianyi Wei, Yiling Chen, Wenbo Zhou, Nenghai Yu

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出PKA框架,通过位置对齐和关键词范围注意力消除多条件生成中的冗余,提升效率并减少资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06041 2026-02-09 cs.CV 57%

Predicting Camera Pose from Perspective Descriptions for Spatial Reasoning

从透视描述预测相机姿态用于空间推理

Xuejun Zhang, Aditi Tiwari, Zhenhailong Wang, Heng Ji

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 CAMCUE通过姿态感知的多图像框架,从自然语言描述中准确预测相机姿态,提升多视角空间推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06418 2026-02-09 cs.LG q-bio.BM 50%

Adaptive Protein Tokenization

自适应蛋白质标记化

Rohit Dilip, Ayush Varshney, David Van Valen

机构 * California Institute of Technology(加州理工学院) Carnegie Mellon University(卡内基梅隆大学) Howard Hughes Medical Institute(霍华德·休斯医学研究所)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文提出了一种自适应蛋白质标记化方法,通过全局标记生成提升生成和表示任务性能,支持零样本蛋白质缩小和亲和力成熟。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他多模态 3 篇

2602.06197 2026-02-09 cs.HC cs.AI 79%

Personagram: Bridging Personas and Product Design for Creative Ideation with Multimodal LLMs

Personagram: 通过多模态大语言模型连接人设与产品设计以促进创意构思

Taewook Kim, Matthew K. Hong, Yan-Ying Chen, Jonathan Q. Li, Monica P Van, Shabnam Hakimi, Matthew Kay, Matthew Klenk

机构 * Toyota Research Institute(丰田研究院) Northwestern University(西北大学)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 Personagram利用多模态大语言模型帮助设计师探索基于人口普查的人设,提取并重新组合产品特征,提升创意构思的可行性和参与度。

Comments 22 pages, 10 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23071 2026-02-09 cs.LG 78%

Rethinking Multi-Modal Learning from Gradient Uncertainty

重新思考从梯度不确定性出发的多模态学习

Peizheng Guo, Jingyao Wang, Wenwen Qiang, Jiahuan Zhou, Changwen Zheng, Gang Hua

机构 * Institute of Software Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所) University of the Chinese Academy of Sciences, Beijing, China(中国科学院大学) Wangxuan Institute of Computer Technology, Peking University, Beijing, China(北京大学王轩计算机技术研究所) Amazon.com, Inc., Bellevue, WA, 98004, USA(亚马逊公司)

专题命中 其他多模态 :multi-modal(title,abstract)

AI总结 本文提出BOGC-MML方法,通过建模梯度不确定性提升多模态学习的优化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27282 2026-02-09 physics.optics physics.med-ph 50%

Near-perfect efficiency in X-ray phase microtomography

近完美效率的X射线相位微断层成像

Dominik John, Gregor Breitenhuber, Sami Wirtensohn, Franziska Hinterdobler, Luka Gaetani, Sara Savatović, Jens Lucht, Markus Osterhoff, Marina Eckermann, Tim Salditt, Julia Herzen

专题命中 其他多模态 :multimodal(abstract)

AI总结 本研究通过新型装置实现近完美效率的X射线相位微断层成像,提升多模态成像的效率和分辨率,推动生物医学研究。

详情

展开后加载摘要…

URL PDF HTML 收藏