arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-22 至 2025-12-22 共收录 36 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 3 篇

2512.15431 2025-12-22 cs.CV 57%

Step-GUI Technical Report

Step-GUI 技术报告

Haolong Yan, Jia Wang, Xin Huang, Yeqing Shen, Ziyang Meng, Zhimin Fan, Kaijun Tan, Jin Gao, Lieyu Shi, Mi Yang, Shiliang Yang, Zhirui Wang, Brian Li, Kang An, Chenyang Li, Lei Lei, Mengmeng Duan, Danxun Liang, Guodong Liu, Hang Cheng, Hao Wu, Jie Dong, Junhao Huang, Mei Chen, Renjie Yu, Shunshan Li, Xu Zhou, Yiting Dai, Yineng Deng, Yingdan Liang, Zelin Chen, Wen Sun, Chengxu Yan, Chunqin Xu, Dong Li, Fengqiong Xiao, Guanghao Fan, Guopeng Li, Guozhen Peng, Hongbing Li, Hang Li, Hongming Chen, Jingjing Xie, Jianyong Li, Jingyang Zhang, Jiaju Ren, Jiayu Yuan, Jianpeng Yin, Kai Cao, Liang Zhao, Liguo Tan, Liying Shi, Mengqiang Ren, Min Xu, Manjiao Liu, Mao Luo, Mingxin Wan, Na Wang, Nan Wu, Ning Wang, Peiyao Ma, Qingzhou Zhang, Qiao Wang, Qinlin Zeng, Qiong Gao, Qiongyao Li, Shangwu Zhong, Shuli Gao, Shaofan Liu, Shisi Gao, Shuang Luo, Xingbin Liu, Xiaojia Liu, Xiaojie Hou, Xin Liu, Xuanti Feng, Xuedan Cai, Xuan Wen, Xianwei Zhu, Xin Liang, Xin Liu, Xin Zhou, Yifan Sui, Yingxiu Zhao, Yukang Shi, Yunfang Xu, Yuqing Zeng, Yixun Zhang, Zejia Weng, Zhonghao Yan, Zhiguo Huang, Zhuoyu Wang, Zihan Yan, Zheng Ge, Jing Li, Yibo Zhu, Binxing Jiao, Xiangyu Zhang, Daxin Jiang

机构 * GELab-Team(GELab团队)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 Step-GUI 是一种先进的 GUI 代理,通过自我进化训练管道和 GUI-MCP 协议,在保持高准确率的同时实现高效隐私保护的 GUI 自动化。

Comments 41 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07475 2025-12-22 eess.IV cs.CV 57%

Text-guided multi-stage cross-perception network for medical image segmentation

基于文本引导的多阶段跨感知网络用于医学图像分割

Gaoyu Chen, Haixia Pan

机构 * college of software(软件学院) Beihang University(北京航空航天大学)

专题命中 多模态Agent :cross-modal(abstract);分类 cs.CV

AI总结 本文提出文本引导的多阶段跨感知网络TMC,通过多阶段跨注意力模块和多阶段对齐损失提升医学图像分割的跨模态交互和语义一致性,实验表明其在多个数据集上均优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态训练与对齐 3 篇

2410.18686 2025-12-22 cs.LG 82%

Hierarchical Multimodal LLMs with Semantic Space Alignment for Enhanced Time Series Classification

具有语义空间对齐的层次多模态大语言模型用于增强的时间序列分类

Xiaoyu Tao, Tingyue Pan, Mingyue Cheng, Yucong Luo, Qi Liu, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 HiTime通过层次多模态大语言模型和语义空间对齐,提升时间序列分类的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17227 2025-12-22 cs.CV 79%

Learning When to Look: A Disentangled Curriculum for Strategic Perception in Multimodal Reasoning

学习何时观察:一种解耦的课程学习框架,用于多模态推理中的战略感知

Siqi Yang, Zilve Gao, Haibo Qiu, Fanfan Liu, Peng Shi, Zhixiong Zeng, Qingmin Liao, Lin Ma

机构 * Meituan(美团) Tsinghua University(清华大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出了一种解耦课程学习框架,通过分阶段训练提升多模态推理中的抽象推理与战略视觉感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20494 2025-12-22 cs.LG cs.MM 79%

Multimodal Representation Learning and Fusion

多模态表示学习与融合

Qihang Jin, Enze Ge, Yuhang Xie, Hongying Luo, Junhao Song, Ziqian Bi, Chia Xin Liang, Jibin Guan, Joe Yeong, Xinyuan Song, Junfeng Hao

机构 * AI Agent Lab, Vokram Group, United Kingdom(AI代理实验室,Vokram集团,英国) University of Bologna, Italy(博洛尼亚大学,意大利) University of Minnesota, United States(明尼苏达大学,美国) Singapore General Hospital, Singapore(新加坡中央医院,新加坡) Emory University, United States(埃默里大学,美国)

专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract);分类 cs.MM

AI总结 多模态学习通过融合多种数据模态提升AI系统的理解和决策能力,旨在解决数据格式差异、输入缺失及对抗攻击等问题,推动计算机视觉、自然语言处理等领域的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他多模态 1 篇

2512.17378 2025-12-22 cs.LO cs.CC 50%

When Symmetry Yields NP-Hardness: Affine ML-SAT on S5 Frames

当对称性导致NP难性:关于S5框架的仿射ML-SAT

Andreas Krebs, Arne Meier

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文证明了在S5框架下,受限于XOR和1连接词的仿射ML-SAT问题为NP难性。

Comments accepted at FoIKS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏