arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-10-02 至 2025-10-02 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 8 篇

2510.00647 2025-10-02 cs.CL 79%

MCM-DPO: Multifaceted Cross-Modal Direct Preference Optimization for Alt-text Generation

Jinlan Fu, Shenzhen Huangfu, Hao Fei, Yichong Huang, Xiaoyu Shen, Xipeng Qiu, See-Kiong Ng

机构 * National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Harbin Institute of Technology(哈尔滨工业大学) Eastern Institute of Technology(东方技术研究所)

专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CL

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08678 2025-10-02 cs.CV 79%

ATAS: Any-to-Any Self-Distillation for Enhanced Open-Vocabulary Dense Prediction

Juan Yeo, Soonwoo Cha, Jiwoo Song, Hyunbin Jin, Taesup Kim

专题命中 多模态生成 :any-to-any(title,abstract);分类 cs.CV

Comments Accepted at ICCV25

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05689 2025-10-02 cs.CV 79%

GoalFlow: Goal-Driven Flow Matching for Multimodal Trajectories Generation in End-to-End Autonomous Driving

Zebin Xing, Xingyu Zhang, Yang Hu, Bo Jiang, Tong He, Qian Zhang, Xiaoxiao Long, Wei Yin

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Horizon Robotics Nanjing University(南京大学) Huazhong University of Science & Technology(华中科技大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00046 2025-10-02 cs.CV cs.AI 62%

Reinforcement Learning-Based Prompt Template Stealing for Text-to-Image Models

Xiaotian Zou

机构 * Xiaotian Zou

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00974 2025-10-02 cs.CV 57%

JEPA-T: Joint-Embedding Predictive Architecture with Text Fusion for Image Generation

Siheng Wan, Zhengtao Yao, Zhengdao Li, Junhao Dong, Yanshu Li, Yikai Li, Linshan Li, Haoyan Xu, Yijiang Li, Zhikang Dong, Huacan Wang, Jifeng Shen

机构 * Jiangsu University(江苏大学) University of Southern California(南加州大学) Peking University(北京大学) Nanyang Technological University(南洋理工大学) Brown University(布朗大学) UC San Diego(加州大学圣地亚哥分校) Stony Brook University(石溪大学) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00911 2025-10-02 cs.LG cs.AI 57%

RiskPO: Risk-based Policy Optimization via Verifiable Reward for LLM Post-Training

Tao Ren, Jinyang Jiang, Hui Yang, Wan Tian, Minhao Zou, Guanghao Li, Zishi Zhang, Qinghao Wang, Shentao Qin, Yanjun Zhao, Rui Tao, Hui Shao, Yijie Peng

机构 * Peking University(北京大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00428 2025-10-02 cs.LG cs.AI 57%

Automated Structured Radiology Report Generation with Rich Clinical Context

Seongjae Kang, Dong Bok Lee, Juho Jung, Dongseop Kim, Won Hwa Kim, Sunghoon Joo

机构 * VUNO Inc.(VUNO公司) KAIST(韩国科学技术院) POSTECH(POSTECH大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

Comments 34 pages, 30 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00351 2025-10-02 cs.LG q-bio.BM 50%

Flow Autoencoders are Effective Protein Tokenizers

Rohit Dilip, Evan Zhang, Ayush Varshney, David Van Valen

机构 * California Institute of Technology(加州理工学院) OpenAI(开放人工智能公司) Howard Hughes Medical Institute(霍华德·休斯医学研究院)

专题命中 多模态生成 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏