arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-10 至 2025-12-10 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 7 篇

2512.08257 2025-12-10 cs.LG eess.IV 82%

Geometric-Stochastic Multimodal Deep Learning for Predictive Modeling of SUDEP and Stroke Vulnerability

几何-随机多模态深度学习用于SUDEP和中风易感性的预测建模

Preksha Girish, Rachana Mysore, Mahanthesha U, Shrey Kumar, Misbah Fatimah Annigeri, Tanish Jain

机构 * Dept. of Artificial Intelligence & Machine Learning(人工智能与机器学习系) B.N.M Institute of Technology(B.N.M技术学院) Dept. of Computer Science Engineering(计算机科学与工程系)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出几何-随机多模态深度学习框架,通过整合多种生物信号建模SUDEP和中风易感性,提升预测准确性和可解释性生物标志物。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11136 2025-12-10 hep-ph hep-ex hep-th nucl-ex nucl-th 79%

Heavy-flavor multimodal fragmentation to $S$-wave pentacharms at next-generation hadron colliders

重味多模碎片化到下一代强子对撞机的S波五重态

Francesco Giovanni Celiberto

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 研究了在下一代强子对撞机中通过多模碎片化产生S波五重态的机制及现象学影响。

Comments 49 pages, 9 figures, 245 references, published in Eur. Phys. J. C. One novel set of multimodal (direct multicharm and diquark-like initial-scale inputs) "PentaQuarks with 5 heavy Quarks" (PQ5Q1.0) NLO collinear fragmentation functions released in LHAPDF format and publicly available from https://github.com/FGCeliberto/Collinear_FFs/

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02239 2025-12-10 cs.CV cs.AI 73%

MiniGPT-5: Interleaved Vision-and-Language Generation via Generative Vokens

MiniGPT-5:通过生成性vokens实现交错的视觉-语言生成

Kaizhi Zheng, Xuehai He, Xin Eric Wang

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) University of California, Santa Barbara(加州大学圣芭芭拉分校)

专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 MiniGPT-5通过生成性vokens实现交错的视觉-语言生成,显著提升多模态生成任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08897 2025-12-10 cs.CV 57%

UniLayDiff: A Unified Diffusion Transformer for Content-Aware Layout Generation

UniLayDiff: 一种统一的扩散变换器用于内容感知的布局生成

Zeyang Liu, Le Wang, Sanping Zhou, Yuxuan Wu, Xiaolong Sun, Gang Hua, Haoxiang Li

机构 * College of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院) Amazon.com, Inc.(亚马逊公司) Pixocial Technology(Pixocial技术)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 UniLayDiff通过统一的扩散变换器框架,首次实现了内容感知布局生成任务的端到端统一生成,提升了布局质量和生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08534 2025-12-10 cs.CV 57%

PaintFlow: A Unified Framework for Interactive Oil Paintings Editing and Generation

PaintFlow:一种用于交互式油画创作与生成的统一框架

Zhangli Hu, Ye Chen, Jiajun Yao, Bingbing Ni

机构 * Zhangli Hu, Ye Chen, Jiajun Yao, Bingbing Ni(张立虎、陈叶、姚佳君、倪炳炳)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 PaintFlow提出了一种统一框架,通过多模态输入实现交互式油画创作与编辑,利用空间对齐、语义增强和自监督风格迁移技术,提升油画生成与编辑的风格一致性与艺术表现力。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08506 2025-12-10 cs.CV 57%

OCCDiff: Occupancy Diffusion Model for High-Fidelity 3D Building Reconstruction from Noisy Point Clouds

OCCDiff:基于点云的高保真3D建筑重建的占用扩散模型

Jialu Sui, Rui Liu, Hongsheng Zhang

机构 * Department of Geography, Faculty of Social Science, the University of Hong Kong(地理系,社会科学学院,香港大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 OCCDiff通过潜在扩散和函数自动编码器生成高保真3D建筑重建,结合点编码器与多任务训练提升鲁棒性与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19523 2025-12-10 cs.LG cs.AI 57%

Language Models for Controllable DNA Sequence Design

用于可控DNA序列设计的语言模型

Xingyu Su, Xiner Li, Yuchao Lin, Ziqian Xie, Degui Zhi, Shuiwang Ji

机构 * Texas A&M University(德克萨斯大学) University of Texas Health Science Center at Houston(德克萨斯大学健康科学中心(休斯顿))

专题命中 多模态生成 :cross-modal(abstract);分类 cs.AI

AI总结 ATGC-Gen是一种用于可控DNA序列设计的语言模型,通过跨模态编码整合生物信号,提升序列生成的可控性和生物相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏