arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-05 至 2026-02-05 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4 篇

2601.21006 2026-02-05 physics.plasm-ph 78%

A joint diffusion approach to multi-modal inference in inertial confinement fusion

一种联合扩散方法用于惯性约束聚变中的多模态推断

Michael S. Jones, Justin Kunimune, Daniel Casey, Bogdan Kustowski, Eugene Kur, Kelli Humbird

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 本文提出JointDiff方法,通过联合扩散统一正向建模、逆向推断和输出填补,提升惯性约束聚变实验的多模态推断精度与可转移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00508 2026-02-05 eess.SP 78%

Quadrature Over-the-Air-Computing for Multimodal Dual-Stream Signal Processing

正交空天地计算用于多模双流信号处理

Hyeon Seok Rou, Kengo Ando, Giuseppe Thadeu Freitas de Abreu, David González G

专题命中 多模态生成 :multimodal(title);multi-modal(abstract)

AI总结 Q-OTAC通过利用复信号的同相和正交分量,实现双流同时计算,提升计算效率,适用于多模B5G应用。

Comments Accepted at the IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13462 2026-02-05 cs.SD cs.MM eess.AS 73%

SAVGBench: Benchmarking Spatially Aligned Audio-Video Generation

SAVGBench: 多模态空间对齐音频视频生成基准测试

Kazuki Shimada, Christian Simon, Takashi Shibuya, Shusuke Takahashi, Yuki Mitsufuji

机构 * Sony AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 多模态生成 :multimodal(abstract);audio-visual(abstract);分类 cs.MM、eess.AS

AI总结 SAVGBench提出了一种新的基准测试方法,用于评估空间对齐音频视频生成任务的性能,通过引入专门的数据集和对齐度量标准,评估不同生成模型的对齐效果。

Comments 5 pages, 2 figures, accepted for publication in IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03112 2026-02-05 cs.RO 50%

A Unified Candidate Set with Scene-Adaptive Refinement via Diffusion for End-to-End Autonomous Driving

通过扩散生成场景自适应候选集的统一候选集用于端到端自动驾驶

Zhengfei Wu, Shuaixi Pan, Shuohan Chen, Shuo Yang, Yanjun Huang

机构 * School of Automotive Studies, Tongji University, Shanghai, China(同济大学汽车学院)

专题命中 多模态生成 :multimodal(abstract)

AI总结 CdDrive通过扩散生成场景自适应候选集,提升端到端自动驾驶的候选集设计与轨迹平滑性

详情

展开后加载摘要…

URL PDF HTML 收藏