arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-09 至 2026-01-09 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 5 篇

2601.04554 2026-01-09 cs.IR 82%

Exploring Recommender System Evaluation: A Multi-Modal User Agent Framework for A/B Testing

探索推荐系统评估:一种用于A/B测试的多模态用户代理框架

Wenlin Zhang, Xiangyang Li, Qiyuan Ge, Kuicai Dong, Pengyue Jia, Xiaopeng Li, Zijian Zhang, Maolin Wang, Yichao Wang, Huifeng Guo, Ruiming Tang, Xiangyu Zhao

专题命中 多模态Agent :multi-modal(title,abstract);multimodal(abstract)

AI总结 本文提出一种多模态用户代理框架,用于替代传统A/B测试,通过模拟真实用户行为提升推荐系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04692 2026-01-09 cs.CL cs.CV 81%

See, Explain, and Intervene: A Few-Shot Multimodal Agent Framework for Hateful Meme Moderation

见、解释与干预:一种少样本多模态代理框架用于仇恨表情包审查

Naquee Rizwan, Subhankar Swain, Paramananda Bhaskar, Gagan Aryan, Shehryaar Shah Khan, Animesh Mukherjee

机构 * Indian Institute of Technology (IIT), Kharagpur(印度理工学院(IIT)Khargpur分校) Simbian

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出了一种少样本多模态代理框架,用于在有限数据条件下实现通用仇恨表情包审查,通过检测、解释和干预三方面提升审查效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24385 2026-01-09 cs.CV cs.RO 79%

Forging Spatial Intelligence: A Roadmap of Multi-Modal Data Pre-Training for Autonomous Systems

锻造空间智能:面向自主系统多模态数据预训练的路线图

Song Wang, Lingdong Kong, Xiaolu Liu, Hao Shi, Wentong Li, Jianke Zhu, Steven C. H. Hoi

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Alibaba Group(阿里巴巴集团) Singapore Management University(新加坡管理学院)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出多模态数据预训练框架,旨在通过整合多传感器数据提升自主系统空间智能,解决单模态模型整合难题,并提出统一的预训练范式分类及未来发展方向。

Comments Survey; 40 pages, 7 figures, 9 tables; GitHub Repo at https://github.com/worldbench/awesome-spatial-intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04500 2026-01-09 cs.AI 70%

GUITester: Enabling GUI Agents for Exploratory Defect Discovery

GUITester: 使GUI代理用于探索性缺陷发现

Yifei Gao, Jiang Wu, Xiaoyi Chen, Yifan Yang, Zhe Cui, Tianyi Ma, Jiaming Zhang, Jitao Sang

机构 * Beijing Jiaotong University(北京交通大学) Hithink Research(慧思科技) Nanyang Technological University(南洋理工大学)

专题命中 多模态Agent :multi-modal(abstract);MLLM(abstract);分类 cs.AI

AI总结 GUITester通过解耦导航与验证的多代理框架,有效解决了探索性GUI测试中目标导向遮蔽和执行偏差归因的问题,实现了48.90%的F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05243 2026-01-09 cs.RO cs.CV 57%

Generate, Transfer, Adapt: Learning Functional Dexterous Grasping from a Single Human Demonstration

生成、迁移、适应:从单个人示范学习功能性灵巧抓取

Xingyi He, Adhitya Polavaram, Yunhao Cao, Om Deshmukh, Tianrui Wang, Xiaowei Zhou, Kuan Fang

机构 * Cornell University(康奈尔大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 CorDex通过单个人示范生成合成数据,结合多模态预测网络和局部-全局融合模块,实现对新型物体的灵巧抓取学习。

Comments Project Page: https://cordex-manipulation.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏