arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-03 至 2026-03-03 共收录 206 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 25 篇

2603.02047 2026-03-03 cs.CV 79%

NICO-RAG: Multimodal Hypergraph Retrieval-Augmented Generation for Understanding the Nicotine Public Health Crisis

NICO-RAG:多模态超图检索增强生成用于理解尼古丁公共卫生危机

Manuel Serna-Aguilera, Raegan Anderes, Page Dobbs, Khoa Luu

机构 * University of Arkansas(亚拉巴马大学) University of Arkansas for Medical Sciences(亚拉巴马大学医学科学分校)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 NICO-RAG通过多模态超图检索增强生成,解决尼古丁公共卫生危机中的信息检索与生成问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00511 2026-03-03 cs.CV cs.LG 79%

Multimodal Adaptive Retrieval Augmented Generation through Internal Representation Learning

多模态自适应检索增强生成通过内部表示学习

Ruoshuang Du, Xin Sun, Qiang Liu, Bowen Song, Zhongqi Chen, Weiqiang Wang, Liang Wang

机构 * Shanghaitech University School of Information Science(上海科技大学信息科学学院) Chinese Academy of Sciences Institute of Automation(中国科学院自动化研究所)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MMA-RAG,通过动态评估模型内部知识置信度,提升视觉问答系统在多模态场景下的检索增强生成性能。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13104 2026-03-03 cs.LG cs.CL 79%

Equitable Electronic Health Record Prediction with FAME: Fairness-Aware Multimodal Embedding

基于FAME的公平电子健康记录预测:具有公平性的多模态嵌入

Nikkie Hooman, Zhongjie Wu, Eric C. Larson, Mehak Gupta

机构 * Department of Computer Science(计算机科学系)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

AI总结 FAME通过公平性意识的多模态嵌入框架,在电子健康记录预测中实现性能与公平性的双重优化。

Comments 21 pages, 3 figures

Journal ref Proceedings of Machine Learning Research 2025 (Machine Learning for Healthcare, ML4H)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10030 2026-03-03 cs.CR cs.AI 79%

Safeguarding Multimodal Knowledge Copyright in the RAG-as-a-Service Environment

在RAG-as-a-Service环境中保护多模态知识版权

Tianyu Chen, Jian Lou, Wenjie Wang

机构 * ShanghaiTech University(上海科技大学) Sun Yat-sen University(中山大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 AQUA是一种用于多模态RAG系统中图像知识保护的首个水印框架,通过嵌入语义信号实现高效、隐蔽的版权追溯。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01590 2026-03-03 cs.IR cs.LG 78%

IDProxy: Cold-Start CTR Prediction for Ads and Recommendation at Xiaohongshu with Multimodal LLMs

IDProxy:小红书广告与推荐中基于多模态大语言模型的冷启动CTR预测

Yubin Zhang, Haiming Xu, Guillaume Salha-Galvan, Ruiyan Han, Feiyang Xiao, Yanhua Huang, Li Lin, Yang Luo, Yao Hu

机构 * Xiaohongshu Inc.(小红书公司) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 IDProxy通过多模态大语言模型生成代理嵌入,解决广告和推荐系统中物品冷启动的CTR预测问题,实现与现有嵌入空间的对齐和端到端优化,已在小红书大规模应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04812 2026-03-03 cs.CV cs.AI cs.CL cs.LG 75%

LLaVE: Large Language and Vision Embedding Models with Hardness-Weighted Contrastive Learning

LLaVE: 大规模语言和视觉嵌入模型与基于难度加权的对比学习

Zhibin Lan, Liqiang Niu, Fandong Meng, Jie Zhou, Jinsong Su

机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) Pattern Recognition Center, WeChat AI, Tencent Inc, China(腾讯人工智能研究院) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室)

专题命中 跨模态检索 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 LLaVE通过基于难度加权的对比学习提升多模态嵌入模型性能,实现SOTA表现和强泛化能力。

Comments Accepted by Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20095 2026-03-03 cs.CV cs.CL cs.LG 73%

BioCAP: Exploiting Synthetic Captions Beyond Labels in Biological Foundation Models

BioCAP: 利用合成描述性注释超越标签在生物基础模型中的应用

Ziheng Zhang, Xinyue Ma, Arpita Chowdhury, Elizabeth G. Campolongo, Matthew J. Thompson, Net Zhang, Samuel Stevens, Hilmar Lapp, Tanya Berger-Wolf, Yu Su, Wei-Lun Chao, Jianyang Gu

机构 * The Ohio State University(俄亥俄州立大学) Duke University(杜克大学) Boston University(波士顿大学)

专题命中 跨模态检索 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL

AI总结 BioCAP通过生成合成描述性注释提升生物基础模型的性能,实现物种分类和文本-图像检索的高准确率。

Comments ICLR 2026; Project page: https://imageomics.github.io/biocap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01632 2026-03-03 cs.LG cs.AI 70%

DeLo: Dual Decomposed Low-Rank Experts Collaboration for Continual Missing Modality Learning

DeLo:双分解低秩专家协作用于持续缺失模态学习

Xiwei Liu, Yulong Li, Feilong Tang, Imran Razzak

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 DeLo通过双分解低秩专家架构解决持续缺失模态学习中的模态干扰问题,结合跨模态引导路由和任务键记忆实现高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04932 2026-03-03 cs.CV 70%

UniView: Enhancing Novel View Synthesis From A Single Image By Unifying Reference Features

UniView: 通过统一参考特征从单张图像增强新颖视角合成

Haowang Cui, Rui Chen, Jiaze Wang, Tao Guo, Zheng Qin

机构 * Tianjin University(天津大学)

专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 UniView通过统一参考特征提升单张图像新颖视角合成性能,采用检索增强系统和多模态大语言模型选择参考图像,并结合解耦三重注意力机制提高合成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01990 2026-03-03 cs.AI cs.CL cs.CV 67%

According to Me: Long-Term Personalized Referential Memory QA

根据我:长期个性化参照记忆问答

Jingbiao Mei, Jinghong Chen, Guangyu Yang, Xinyu Hou, Margaret Li, Bill Byrne

机构 * Department of Engineering, University of Cambridge, United Kingdom(剑桥大学工程系) Department of Physics, University of Cambridge, United Kingdom(剑桥大学物理系) Independent Researcher(独立研究者)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出ATM-Bench,首个多模态多来源个性化参照记忆问答基准,并提出Schema-Guided Memory方法提升记忆推理性能

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01493 2026-03-03 cs.IR cs.AI cs.CV cs.MM 67%

PhotoBench: Beyond Visual Matching Towards Personalized Intent-Driven Photo Retrieval

PhotoBench: 超越视觉匹配,迈向个性化意图驱动的图片检索

Tianyi Xu, Rong Shan, Junjie Wu, Jiadeng Huang, Teng Wang, Jiachen Zhu, Wenteng Chen, Minxin Tu, Quantao Dou, Zhaoxiang Wang, Changwang Zhang, Weinan Zhang, Jun Wang, Jianghao Lin

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 PhotoBench 是首个基于真实个人相册构建的基准,旨在通过多源意图驱动推理提升个性化图片检索能力。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19385 2026-03-03 cs.CV cs.CL cs.LG 62%

Adaptive Data Augmentation with Multi-armed Bandit: Sample-Efficient Embedding Calibration for Implicit Pattern Recognition

自适应数据增强与多臂老虎机:用于隐式模式识别的样本高效嵌入校准

Minxue Tang, Yangyang Yu, Aolin Ding, Maziyar Baran Pouyan, Taha Belkhouja, Yujia Bao

机构 * Duke University(杜克大学) Center for Advanced AI, Accenture(Accenture高级人工智能中心)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出ADAMAB框架,通过多臂老虎机机制实现样本高效的隐式模式识别,实验表明其在少样本情况下准确率提升达40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01666 2026-03-03 cs.CL cs.IR 57%

Beyond the Grid: Layout-Informed Multi-Vector Retrieval with Parsed Visual Document Representations

超越网格:基于解析视觉文档表示的布局感知多向量检索

Yibo Yan, Mingdong Ou, Yi Cao, Xin Zou, Shuliang Liu, Jiahao Huo, Yu Huang, James Kwok, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Alibaba Cloud Computing(阿里云计算)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

AI总结 ColParse通过生成布局感知的子图像嵌入和全局向量融合,实现高效多向量检索,显著降低存储需求并提升性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01048 2026-03-03 cs.SE cs.AI 57%

RepoRepair: Leveraging Code Documentation for Repository-Level Automated Program Repair

RepoRepair: 利用代码文档实现仓库级别的自动程序修复

Zhongqiang Pan, Chuanyi Li, Wenkang Zhong, Yi Feng, Bin Luo, Vincent Ng

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Human Language Technology Research Institute, University of Texas at Dallas(人机语言技术研究院,德克萨斯大学达拉斯分校)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 RepoRepair通过生成代码文档增强LLM能力,实现仓库级别的自动程序修复,取得高修复率和低成本的优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00599 2026-03-03 cs.AI cs.LG 57%

Heterophily-Agnostic Hypergraph Neural Networks with Riemannian Local Exchanger

无异质性偏见的超图神经网络与黎曼局部交换器

Li Sun, Ming Zhang, Wenxin Jin, Zhongtian Sun, Zhenhao Huang, Hao Peng, Sen Su, Philip Yu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) North China Electric Power University(华北电力大学) University of Kent(肯特大学) Beihang University(北航) University of Illinois(伊利诺伊大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI

AI总结 本文提出HealHGNN,通过黎曼几何和自适应局部交换器实现异质性无关的超图神经网络,提升长距离依赖建模和表示区分性。

Comments Accepted by WWW'26, 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00503 2026-03-03 cs.CV 57%

M$^2$: Dual-Memory Augmentation for Long-Horizon Web Agents via Trajectory Summarization and Insight Retrieval

M$^2$: 通过轨迹摘要和洞察检索实现长 horizon 网络代理的双记忆增强

Dawei Yan, Haokui Zhang, Guangda Huzhang, Yang Li, Yibo Wang, Qing-Guo Chen, Zhao Xu, Weihua Luo, Ying Li, Wei Dong, Chunhua Shen

机构 * Northwestern Polytechnical University, Xi'an, China(西北工业大学) AI Business, Alibaba Group, Hangzhou, China(阿里云人工智能业务) Xi'an University of Architecture(西安建筑科技大学) Zhejiang University, Hangzhou, China(浙江大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 M$^2$通过双记忆机制提升长 horizon 网络代理的上下文效率和决策鲁棒性,实现更高成功率和更低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06566 2026-03-03 cs.CV 57%

Dynamic Uncertainty Learning with Noisy Correspondence for Text-Based Person Search

基于噪声对应关系的动态不确定性学习用于基于文本的人脸搜索

Zequn Xie, Haoming Ji, Chengxuan Li, Lingwei Meng

机构 * Zhejiang University(浙江大学) Beijing University of Posts Telecommunications(北京邮电大学) Beijing Forestry University(北京林业大学) Northwest Normal University(西北师范大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出DURA框架,通过动态不确定性学习和关系对齐方法,提升基于文本的人脸搜索在噪声环境下的鲁棒性和检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19096 2026-03-03 cs.LG 50%

The Power of Decaying Steps: Enhancing Attack Stability and Transferability for Sign-based Optimizers

衰减步骤的力量:提升基于符号的优化器的攻击稳定性和可迁移性

Wei Tao, Yang Dai, Jincai Huang, Qing Tao

专题命中 跨模态检索 :cross-modal(abstract)

AI总结 本文提出MDCS方法,通过衰减步长提升基于符号优化器的攻击稳定性和可迁移性,理论证明其收敛率最优。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00632 2026-03-03 cs.IR cs.LG 50%

Stop Treating Collisions Equally: Qualification-Aware Semantic ID Learning for Recommendation at Industrial Scale

停止对碰撞一视同仁:面向大规模工业场景的语义ID学习方法

Zheng Hu, Yuxin Chen, Yongsen Pan, Xu Yuan, Yuting Yin, Daoyuan Wang, Boyang Xia, Zefei Luo, Hongyang Wang, Songhao Ni, Dongxu Liang, Jun Wang, Shimin Cai, Tao Zhou, Fuji Ren, Wenwu Ou

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 QuaSID通过冲突感知机制和双塔对比目标,提升大规模推荐中语义ID的碰撞处理与多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态生成 26 篇

2603.00426 2026-03-03 cs.CL cs.CV 84%

LLM-Bootstrapped Targeted Finding Guidance for Factual MLLM-based Medical Report Generation

基于大语言模型的引导式目标发现指导:用于基于事实的多模态大语言模型医疗报告生成

Cunyuan Yang, Dejuan Song, Xiaotao Pang, Qianqian Shen, Wenjie Nie, Yifan Huang, Lei Wu, Wei Han, Haishuai Wang, Jiajun Bu

机构 * Zhejiang University(浙江大学) The Second Affiliated Hospital Zhejiang University School of Medicine(浙江大学医学院附属第二医院) Hangzhou Pu Jian Medical Technology Co., Ltd.(杭州普健医疗科技有限公司)

专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出Fact-Flow框架,通过引导大语言模型生成事实准确的医疗报告,利用LLM自动生成标注数据集,提升医疗报告生成的事实准确性。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06764 2026-03-03 cs.CV cs.AI 84%

SemHiTok: A Unified Image Tokenizer via Semantic-Guided Hierarchical Codebook for Multimodal Understanding and Generation

SemHiTok:一种通过语义引导的层次代码本实现的统一图像分词器,用于多模态理解和生成

Zisheng Chen, Chunwei Wang, Runhui Huang, Hongbin Xu, Xiuwei Chen, Jun Zhou, Jianhua Han, Hang Xu, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) Huawei Noah’s Ark Lab(华为诺亚实验室) University of Hong Kong(香港大学) South China University of Technology(华南理工大学)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 SemHiTok通过语义引导的层次代码本实现统一图像分词器,提升多模态理解和生成性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03292 2026-03-03 cs.SE cs.AI cs.HC 83%

Interaction2Code: Benchmarking MLLM-based Interactive Webpage Code Generation from Interactive Prototyping

Interaction2Code: 基于MLLM的交互式网页代码生成基准测试

Jingyu Xiao, Yuxuan Wan, Yintong Huo, Zixin Wang, Xinyi Xu, Wenxuan Wang, Zhiyao Xu, Yuhang Wang, Michael R. Lyu

机构 * The Chinese University of Hong Kong, China(香港中文大学) Singapore Management University, Singapore(新加坡管理学院) Renmin University of China, China(中国人民大学) Tsinghua University, China(清华大学) Southwest University, China(西南大学)

专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 Interaction2Code提出首个基于MLLM的交互式网页代码生成基准测试,识别MLLM在交互生成中的四个限制并提出四种增强策略。

Comments Published in the Proceedings of the 40th IEEE/ACM International Conference on Automated Software Engineering (ASE 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01965 2026-03-03 cs.LG q-bio.QM 82%

CoVAE: correlated multimodal generative modeling

CoVAE:相关多模态生成建模

Federico Caretti, Guido Sanguinetti

机构 * Scuola Internazionale Superiore di Studi Avanzati(国际先进研究学院)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract)

AI总结 CoVAE通过捕捉多模态之间的相关性,改进了多模态生成建模,实现了准确的跨模态重建和不确定性量化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15281 2026-03-03 cs.IR cs.LG 82%

MMQ: Multimodal Mixture-of-Quantization Tokenization for Semantic ID Generation and User Behavioral Adaptation

MMQ: 多模态混合量化标记化用于语义ID生成和用户行为适应

Yi Xu, Moyu Zhang, Chenxuan Li, Zhihao Liao, Haibo Xing, Hao Deng, Jinxin Hu, Yu Zhang, Xiaoyi Zeng, Jing Zhang

机构 * Alibaba Group(阿里巴巴集团) Peking University(北京大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Wuhan University, School of Computer Science(武汉大学计算机学院)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract)

AI总结 MMQ通过多模态混合量化标记化方法,解决推荐系统中多模态协同、特定性和行为适应的挑战,提升语义ID生成和用户行为适应能力。

Journal ref Proceedings of the Nineteenth ACM International Conference on Web Search and Data Mining, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24365 2026-03-03 cs.CV cs.AI 81%

Uni-X: Mitigating Modality Conflict with a Two-End-Separated Architecture for Unified Multimodal Models

Uni-X: 通过双端分离架构缓解多模态冲突以实现统一多模态模型

Jitai Hao, Hao Liu, Xinyan Xiao, Qiang Huang, Jun Yu

机构 * School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院) Baidu Inc.(百度公司)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 Uni-X通过双端分离和中间共享的架构缓解多模态冲突,提升统一多模态模型的训练效率和性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00207 2026-03-03 cs.CV cs.AI 81%

VisRef: Visual Refocusing while Thinking Improves Test-Time Scaling in Multi-Modal Large Reasoning Models

VisRef: 通过思考进行视觉再聚焦以提高多模态大推理模型的测试时间扩展

Soumya Suvra Ghosal, Youngeun Kim, Zhuowei Li, Ritwick Chaudhry, Linghan Xu, Hongjing Zhang, Jakub Zablocki, Yifan Xing, Qin Zhang

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Amazon(亚马逊) Physion Labs(Physion实验室)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 VisRef通过视觉再聚焦提升多模态大推理模型测试时间扩展性能,有效解决视觉依赖任务中推理性能下降问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01253 2026-03-03 cs.CV 79%

Cross-Modal Guidance for Fast Diffusion-Based Computed Tomography

跨模态引导用于快速扩散基于计算机断层扫描

Timofey Efimov, Singanallur Venkatakrishnan, Maliha Hossain, Haley Duba-Sullivan, Amirkoushyar Ziabari

专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出一种无需重新训练扩散模型的跨模态引导方法,用于提升稀疏视图中子CT的重建质量。

Comments Accepted at the IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06027 2026-03-03 cs.CV eess.IV 79%

OSDM-MReg: Multimodal Image Registration based One Step Diffusion Model

OSDM-MReg: 基于一步扩散模型的多模态图像配准

Xiaochen Wei, Weiwei Guo, Wenxian Yu, Feiming Wei, Dongying Li

机构 * Shanghai Key Laboratory of Intelligent Sensing and Recognition(上海智能感知与识别重点实验室) Shanghai Jiao Tong University(上海交通大学) Center of Digital Innovation(数字创新中心)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 OSDM-MReg通过一步扩散模型和多模态融合策略,实现多模态图像配准的高效准确配准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00905 2026-03-03 cs.CV 70%

pySpatial: Generating 3D Visual Programs for Zero-Shot Spatial Reasoning

pySpatial: 为零样本空间推理生成3D视觉程序

Zhanpeng Luo, Ce Zhang, Silong Yong, Cunxi Dai, Qianwei Wang, Haoxi Ran, Guanya Shi, Katia Sycara, Yaqi Xie

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Pittsburgh(匹兹堡大学) University of Michigan(密歇根大学)

专题命中 多模态生成 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 pySpatial通过生成3D视觉程序,使大语言模型在无需微调的情况下实现零样本空间推理,并在基准测试和实际导航中表现出色。

Comments Accepted at ICLR 2026, Project Page: Our project: https://pySpatial.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07940 2026-03-03 cs.CV cs.AI cs.CL cs.LG cs.MM 70%

TTOM: Test-Time Optimization and Memorization for Compositional Video Generation

TTOM:测试时优化与记忆化用于组合视频生成

Leigang Qu, Ziyang Wang, Na Zheng, Wenjie Wang, Liqiang Nie, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 TTOM通过测试时优化与记忆化机制,提升组合视频生成的跨模态对齐能力,实现高效且可扩展的实时生成。

Comments ICLR 2026 Camera-ready. Project page: https://ttom-t2v.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏