arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-01-16 至 2026-01-16 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 3 篇

2509.14981 2026-01-16 cs.CV 57%

SPATIALGEN: Layout-guided 3D Indoor Scene Generation

SPATIALGEN: 布局引导的3D室内场景生成

Chuan Fang, Heng Li, Yixun Liang, Jia Zheng, Yongsen Mao, Yuan Liu, Rui Tang, Zihan Zhou, Ping Tan

机构 * Hong Kong University of Science and Technology(香港科技大学) Manycore Tech Inc(Manycore科技公司)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 SPATIALGEN通过布局引导的多视角多模态扩散模型生成高质量3D室内场景,解决现有方法在视觉质量、多样性及语义一致性方面的不足。

Comments 3D scene generation; diffusion model; Scene reconstruction and understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22974 2026-01-16 cs.CV 57%

RealCamo: Boosting Real Camouflage Synthesis with Layout Controls and Textual-Visual Guidance

RealCamo: 通过布局控制和文本-视觉引导提升真实伪装合成

Chunyuan Chen, Yunuo Cai, Shujuan Li, Weiyun Liang, Bin Wang, Jing Xu

机构 * College of Artificial Intelligence, Nankai University, Tianjin, China(人工智能学院,南开大学,天津,中国) School of Data Science, Fudan University, Shanghai, China(数据科学学院,复旦大学,上海,中国)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 RealCamo通过布局控制和文本-视觉引导提升真实伪装合成,解决现有方法在伪装效果和背景一致性上的不足。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10708 2026-01-16 cs.LG math.ST stat.TH 50%

High-accuracy and dimension-free sampling with diffusions

高精度和无维度的扩散采样

Khashayar Gatmiry, Sitan Chen, Adil Salim

机构 * UC Berkeley(伯克利大学) Harvard University(哈佛大学)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出了一种基于低次近似与插值方法的扩散模型求解器,实现了高精度采样且不依赖环境维度。

详情

展开后加载摘要…

URL PDF HTML 收藏