arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-06 至 2026-02-06 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 8 篇

2509.13646 2026-02-06 cs.HC 78%

Vistoria: A Multimodal System to Support Fictional Story Writing through Instrumental Text-Image Co-Editing

Vistoria:一种多模态系统,通过仪器文本-图像协同编辑支持虚构故事写作

Kexue Fu, Jingfei Huang, Long Ling, Sumin Hong, Yihang Zuo, Ray LC, Toby Jia-jun Li

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 Vistoria通过多模态协同编辑提升虚构故事创作的表达力和创造力,使作家能更自由地探索故事发展方向。

Comments Change the format of the first page

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02276 2026-02-06 cs.LG cs.AI cs.CL q-bio.QM 62%

CellForge: Agentic Design of Virtual Cell Models

CellForge: 虚拟细胞模型的代理设计

Xiangru Tang, Zhuoyun Yu, Jiapeng Chen, Yan Cui, Daniel Shao, Weixu Wang, Fang Wu, Yuchen Zhuang, Wenqi Shi, Zhi Huang, Arman Cohan, Xihong Lin, Fabian Theis, Smita Krishnaswamy, Mark Gerstein

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 CellForge通过多代理协作自主设计虚拟细胞模型,生成高竞争力的计算方法,推动计算生物学的自主科学方法开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05998 2026-02-06 cs.CV 57%

VisRefiner: Learning from Visual Differences for Screenshot-to-Code Generation

VisRefiner: 从视觉差异中学习以实现截图到代码生成

Jie Deng, Kaichun Yao, Libo Zhang

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 VisRefiner通过学习视觉差异提升截图到代码生成的准确性和自我完善能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05339 2026-02-06 cs.CV cs.LG 57%

Consistency-Preserving Concept Erasure via Unsafe-Safe Pairing and Directional Fisher-weighted Adaptation

通过不安全-安全配对和方向性Fisher加权适应进行一致性保持的概念擦除

Yongwoo Kim, Sungmin Cha, Hyunsoo Kim, Jaewon Lee, Donghyun Kim

机构 * Korea University(韩国大学) New York University(纽约大学) Korea Institute of Science(韩国科学技术院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出PAIR框架,通过不安全-安全配对和方向性Fisher加权适应,实现对有害概念的精细化擦除,保持生成内容的结构和语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05013 2026-02-06 cs.GR cs.CV 57%

Untwisting RoPE: Frequency Control for Shared Attention in DiTs

解开RoPE:多模态和共享注意力中的频率控制

Aryan Mikaeili, Or Patashnik, Andrea Tagliasacchi, Daniel Cohen-Or, Ali Mahdavi-Amiri

机构 * Simon Fraser University(西蒙弗雷泽大学) Tel Aviv University(特拉维夫大学) University of Toronto(多伦多大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文通过分析RoPE的频率结构,提出方法调节RoPE频率带以实现更符合语义的共享注意力,从而有效控制风格迁移与内容复制的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04886 2026-02-06 cs.LG cs.AI cs.CE stat.ML 57%

Denoising diffusion networks for normative modeling in neuroimaging

去噪扩散网络在神经影像规范建模中的应用

Luke Whitbread, Lyle J. Palmer, Mark Jenkinson

机构 * Australian Institute for Machine Learning (AIML), Adelaide University(澳大利亚机器学习研究所(AIML),阿德莱德大学) South Australian Health and Medical Research Institute (SAHMRI)(南澳大利亚健康与医学研究机构(SAHMRI)) School of Computer Science and Information Technology, Adelaide University(计算机科学与信息技术学院,阿德莱德大学) School of Public Health, Adelaide University(公共卫生学院,阿德莱德大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出基于去噪扩散概率模型(DDPMs)的神经影像规范建模方法,通过统一条件密度估计器实现多变量依赖关系建模,提升高维数据下的校准性能和可扩展性。

Comments 55 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05855 2026-02-06 cs.RO cs.LG 50%

A Hybrid Autoencoder for Robust Heightmap Generation from Fused Lidar and Depth Data for Humanoid Robot Locomotion

一种用于人形机器人运动的融合激光雷达和深度数据的鲁棒高度图生成的混合自编码器

Dennis Bank, Joost Cordes, Thomas Seel, Simon F. G. Ehlers

机构 * Institute of Mechatronic Systems, Leibniz University Hannover(机械系统研究所,莱比锡洪堡大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出了一种混合自编码器,通过融合激光雷达和深度数据生成鲁棒的高度图,以提升人形机器人在非结构化环境中的运动性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03405 2026-02-06 quant-ph cs.LG 50%

Enhancing Quantum Diffusion Models for Complex Image Generation

增强量子扩散模型用于复杂图像生成

Jeongbin Jo, Santanam Wishal, Shah Md Khalil Ullah, Shan Zeng, Dikshant Dulal

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出混合量子-经典U-Net架构,结合自适应非局部可观测量,以提升复杂图像生成的性能和可扩展性。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏