arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4979 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4979 篇

2505.18979 2026-05-26 cs.LG 78%

Dynamic Optimization and Safety Indicator Injection for Jailbreaking Text-to-Image Models with Multimodal Safety Filters

动态优化与安全指示注入:针对多模态安全过滤器的文本到图像模型越狱方法

Zixuan Chen, Hao Lin, Ke Xu, Xinghao Jiang, Tanfeng Sun

机构 * Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 提出OptJail框架,通过动态提示优化与自适应安全指示注入,绕过文本和图像过滤器,实现高成功率越狱,并揭示多模态防御的系统性漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16104 2026-05-18 q-bio.GN q-bio.QM 78%

StateXDiff: Cell State-Contextualized Multimodal Diffusion for Single-Cell Perturbation Prediction

StateXDiff: 单细胞扰动预测的细胞状态-上下文化多模态扩散框架

Peiting Shi, Ningfeng Que, Xianzhe Huang, Xiaofei Wang, Jianzhong Jeff Xi

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 StateXDiff通过整合转录组与蛋白质特征,构建多模态细胞状态表示,并利用条件扩散模型生成药物扰动特异性变化,提升单细胞扰动预测的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24550 2026-05-18 cs.LG cs.SD 78%

Training-Free Multimodal Guidance for Video to Audio Generation

无需训练的多模态引导用于视频到音频生成

Eleonora Grassucci, Giuliano Galadini, Giordano Cicchetti, Aurelio Uncini, Fabio Antonacci, Danilo Comminiello

机构 * Dept. of Information Engineering, Electronics, and Telecomm., Sapienza University of Rome, Italy(信息工程、电子与电信系,罗马大学萨皮恩扎)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本文提出无需训练的多模态引导机制,用于视频到音频扩散生成,通过模态嵌入跨度强制视频、音频和文本的一致对齐,提升生成质量与多模态对齐效果。

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14159 2026-05-15 cs.RO 78%

MIMIC-D: Multi-modal Imitation for MultI-agent Coordination with Decentralized Diffusion Policies

MIMIC-D: 多模态模仿用于多智能体协调的去中心化扩散策略

Dayi Dong, Maulik Bhatt, Seoyeon Choi, Negar Mehr

机构 * Department of Mechanical Engineering, University of California Berkeley(加州大学伯克利分校机械工程系)

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 本文提出MIMIC-D,通过去中心化扩散策略实现多智能体多模态模仿学习,解决了传统方法在多模态任务中协调效率低的问题。

Comments 8 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13309 2026-05-14 eess.SP 78%

SimART: A Unified and Open Real-world Multimodal Simulation Platform for 6G Integrated Sensing and Communication

SimART:一个统一的开放现实多模态仿真平台用于6G集成感知与通信

Kang Yan, Yuqi Cao, Jiaqi Li, Luping Xiang, Kun Yang

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 SimART通过整合机器人学、光线追踪和无线评估引擎,提供一个可重复的多模态仿真平台,支持6G集成感知与通信的多方面需求,包括场景构建和信道知识图生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11387 2026-05-13 cs.LG cs.RO 78%

Behavioral Mode Discovery for Fine-tuning Multimodal Generative Policies

多模态生成策略细调中的行为模式发现

Alberta Longhini, David Emukpere, Jean-Michel Renders, Seungsu Kim

机构 * Naver Labs Europe(纳维尔实验室欧洲分部) Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本文提出一种无监督的行为模式发现框架,用于在强化学习细调多模态生成策略时保持行为多样性,通过互信息作为内在奖励提升任务成功率。

Journal ref International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08138 2026-05-12 cs.LG 78%

DataArc-SynData-Toolkit: A Unified Closed-Loop Framework for Multi-Path, Multimodal, and Multilingual Data Synthesis

DataArc-SynData-Toolkit:多路径、多模态和多语言数据合成的统一闭环框架

Zhichao Shi, Cehao Yang, Hao Zhou, Xiaojun Wu, Huajie Li, Xuhui Jiang, Chengjin Xu, Yuanzhuo Wang, Jian Guo

机构 * DataArc Tech Ltd.(DataArc科技有限公司) IDEA Research(IDEA研究院) International Digital Economy Academy(国际数字经济学院) School of Advanced Interdisciplinary Sciences, UCAS(北京大学交叉学科研究院) Institute of Computing Technology, CAS(中国科学院计算技术研究所) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本文提出DataArc-SynData-Toolkit,通过统一的合成范式和模块化架构,解决现有合成数据工具在流程复杂、标准碎片化和多模态扩展性方面的不足,提升数据生成效率和质量。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10647 2026-04-23 cs.RO 78%

OmniUMI: Towards Physically Grounded Robot Learning via Human-Aligned Multimodal Interaction

OmniUMI: 通过人对齐的多模态交互实现物理基础的机器人学习

Shaqi Luo, Yuanyuan Li, Youhao Hu, Chenhao Yu, Chaoran Xu, Jiachen Zhang, Guocai Yao, Tiejun Huang, Ran He, Zhongyuan Wang

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) MAIS & NLPR, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing Institute of Technology(北京理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 OmniUMI通过人对齐的多模态交互实现物理基础的机器人学习,整合视觉、触觉和力觉数据,提升接触密集操作的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11931 2026-04-23 cs.RO 78%

MATT-Diff: Multimodal Active Target Tracking by Diffusion Policy

MATT-Diff:基于扩散策略的多模态主动目标跟踪

Saida Liu, Nikolay Atanasov, Shumon Koga

机构 * Department of Computer Science and Systems Engineering, Kobe University(神户大学计算机科学与系统工程系) Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电子与计算机工程系)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本文提出MATT-Diff,一种基于扩散策略的多模态主动多目标跟踪控制策略,通过视觉Transformer和注意力机制实现多目标跟踪与再获取。

Comments Camera-ready version for L4DC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16558 2026-04-21 cs.LG 78%

Cross-Modal Generation: From Commodity WiFi to High-Fidelity mmWave and RFID Sensing

跨模态生成:从商品WiFi到高保真毫米波和RFID传感

Zhixiong Yang, Long Jing, Yao Li, Shuli Cheng, Guoxuan Chi, Chenyu Wen

机构 * Xinjiang University(新疆大学) Northwest University(西北大学) Tsinghua University(清华大学)

专题命中 多模态生成 :cross-modal(title,abstract)

AI总结 本文提出RF-CMG方法,利用丰富的WiFi数据生成高保真毫米波和RFID数据,通过高频指导与低频约束解耦生成过程,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07422 2026-04-10 cs.LG 78%

Multimodal Large Language Models for Multi-Subject In-Context Image Generation

多模态大语言模型用于多主体上下文图像生成

Yucheng Zhou, Dubing Chen, Huan Zheng, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学,科技学院,计算机与信息科学系,智慧城市物联网国家重点实验室)

专题命中 多模态生成 :multimodal(title);MLLM(abstract)

AI总结 本文提出MUSIC模型,通过视觉链式思维机制和空间布局规划方法,解决多主体上下文图像生成中的主体缺失和语义漂移问题,并在多主体场景中取得显著优势。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05181 2026-04-08 cs.LG 78%

General Multimodal Protein Design Enables DNA-Encoding of Chemistry

通用多模态蛋白质设计使化学编码成为可能

Jarrid Rector-Brooks, Théophile Lambert, Marta Skreta, Daniel Roth, Yueming Long, Zi-Qi Li, Xi Zhang, Miruna Cretu, Francesca-Zhoufan Li, Tanvi Ganapathy, Emily Jin, Avishek Joey Bose, Jason Yang, Kirill Neklyudov, Yoshua Bengio, Alexander Tong, Frances H. Arnold, Cheng-Hao Liu

机构 * California Institute of Technology(加州理工学院) Mila – Québec AI Institute(Mila – 魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Université Paris-Saclay(巴黎-萨克雷大学) McGill University(麦吉尔大学) University of Cambridge(剑桥大学) University of Oxford(牛津大学) Imperial College London(伦敦帝国理工学院) Institut Courtois(库尔图瓦研究所) LawZero AITHYRA FutureHouse

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 DISCO模型通过多模态设计实现蛋白质序列和三维结构的协同优化,能够设计出新型血红素酶,催化新的化学反应,拓展了遗传编码转化的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07297 2026-03-31 cs.LG q-bio.QM 78%

MM-DADM: Multimodal Drug-Aware Diffusion Model for Virtual Clinical Trials

MM-DADM:多模态药物感知扩散模型用于虚拟临床试验

Qian Shao, Bang Du, Zepeng Li, Qiyuan Chen, Jiahe Chen, Hongxia Xu, Jimeng Sun, Jian Wu, Jintai Chen

机构 * Zhejiang University(浙江大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本文提出MM-DADM,一种多模态药物感知扩散模型,用于生成个性化药物诱导ECG。通过动态交叉注意模块融合外部物理知识,解决形态真实性和病理灵活性的平衡问题,并利用因果特征编码器提取纯药理表示,提升模拟准确性和召回率。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14139 2026-03-31 cs.RO 78%

FlexiCup: Wireless Multimodal Suction Cup with Dual-Zone Vision-Tactile Sensing

FlexiCup: 无线多模态吸盘 with 双区视觉-触觉感知

Junhao Gong, Shoujie Li, Kit-Wa Sou, Changqing Guo, Hourong Huang, Tong Wu, Yifan Xie, Chenxin Liang, Chuqiao Lyu, Xiaojun Liang, Wenbo Ding

机构 * Shenzhen Ubiquitous Data Enabling Key Lab, Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,深圳泛在数据赋能重点实验室) Peng Cheng Laboratory(鹏城实验室)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 FlexiCup通过无线电子集成双区视觉-触觉传感,实现接触感知操控,验证了传感与驱动解耦的有效性,同时在不同气动原理下均表现出色。

Comments Accepted by IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12015 2026-03-24 cs.GR 78%

M^3ashy: Multi-Modal Material Synthesis via Hyperdiffusion

M^3ashy:基于超扩散的多模态材料合成

Chenliang Zhou, Zheyuan Hu, Alejandro Sztrajman, Yancheng Cai, Yaru Liu, Cengiz Oztireli

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 本文提出M^3ashy框架,通过超扩散和神经场实现复杂真实材料的高质量重建,支持多种条件下的材料合成,并贡献了新的材料数据集和BRDF评估指标。

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, Vol. 40, No. 16, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14615 2026-03-20 cs.RO 78%

Accelerated Multi-Modal Motion Planning Using Context-Conditioned Diffusion Models

利用上下文条件扩散模型加速多模态运动规划

Edward Sandra, Lander Vanroye, Dries Dirckx, Ruben Cartuyvels, Jan Swevers, Wilm Decré

机构 * Department of Mechanical Engineering, KU Leuven(卢森堡鲁文大学机械工程系) Department of Computer Science, KU Leuven(卢森堡鲁文大学计算机科学系)

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 本文提出CAMPD模型,通过上下文感知的扩散模型实现高效的多模态运动规划,适用于多样场景且无需重新训练,展示出在未见环境中生成高质量轨迹的能力。

Comments Accepted for publication at the 2026 IEEE International Conference on Robotics & Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14199 2026-03-17 cond-mat.mtrl-sci 78%

Millimeter-Scale, Atomically Controlled 2D Topological Insulators Revealed by Multimodal Spectroscopy

毫米级、原子级控制的二维拓扑绝缘体通过多模式光谱揭示

Woojoo Lee, Qiang Gao, Yufei Zhao, Hui Li, Albert Tsui, Yichao Zhang, Yunhe Bai, Haoran Lin, Khanh Duy Nguyen, Gabriele Berruto, Gangbin Yan, Jianchen Dang, Tongyao Wu, Hossein Rokni, Thomas S. Marchese, Ying Shirley Meng, Chao-Xing Liu, Xiao-Xiao Zhang, Chong Liu, Pinshane Y. Huang, Mark C. Hersam, Binghai Yan, Shuolong Yang

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 研究通过多模式光谱揭示了毫米级原子级控制的二维拓扑绝缘体,展示了Bi2Te3和MnBi2Te4/Bi2Te3异质结构的电子结构和拓扑边缘态,验证了其作为稳健二维拓扑绝缘体的特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13440 2026-03-17 cs.LG cs.IT math.IT 78%

Improving Channel Estimation via Multimodal Diffusion Models with Flow Matching

通过多模态扩散模型与流匹配改进信道估计

Xiaotian Fan, Xingyu Zhou, Le Liang, Xiao Li, Shi Jin

机构 * School of Information Science and Engineering, Southeast University(信息科学与工程学院,东南大学) Purple Mountain Laboratories(紫金山实验室)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本文提出基于流匹配和扩散变压器的多模态信道估计框架MultiCE-Flow,通过融合LiDAR、相机和位置数据生成语义条件,利用稀疏试点作为结构条件,实现高保真信道重建,优于传统方法和生成模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09394 2026-03-12 cs.HC 78%

EyeAgent: An Agentic AI System for Multimodal Clinical Decision Support in Ophthalmology

EyeAgent:一种用于眼科多模态临床决策支持的智能AI系统

Danli Shi, Xiaolan Chen, Bingjie Yan, Weiyi Zhang, Pusheng Xu, Jiancheng Yang, Ruoyu Chen, Siyu Huang, Bowen Liu, Xinyuan Wu, Meng Xie, Ziyu Gao, Yue Wu, Senlin Lin, Kai Jin, Xia Gong, Yih Chung Tham, Xiujuan Zhang, Li Dong, Yuzhou Zhang, Jason Yam, Guangming Jin, Xiaohu Ding, Haidong Zou, Yalin Zheng, Zongyuan Ge, Mingguang He

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 EyeAgent通过整合53种眼科工具提升诊断准确率,实现多模态临床决策支持,为眼科AI系统提供新范式。

Comments 28 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05433 2026-03-11 cs.LG cs.NE 78%

Multimodal LLM-assisted Evolutionary Search for Programmatic Control Policies

多模态大语言模型辅助进化搜索用于程序化控制策略

Qinglong Hu, Xialiang Tong, Mingxuan Yuan, Fei Liu, Zhichao Lu, Qingfu Zhang

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本研究提出多模态大语言模型辅助进化搜索方法,用于生成透明且可验证的程序化控制策略,通过结合视觉反馈与进化搜索提高策略发现效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01479 2026-03-11 cs.RO 78%

Multimodal Adversarial Quality Policy for Safe Grasping

多模态对抗质量策略用于安全抓取

Kunlin Xie, Chenghao Li, Haolan Zhang, Nak Young Chong

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本文提出多模态对抗质量策略,通过双补丁优化和梯度平衡策略实现安全抓取,提升多模态环境下机器人抓取的安全性和鲁棒性。

Comments submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04466 2026-03-06 cs.RO cs.LG 78%

Act-Observe-Rewrite: Multimodal Coding Agents as In-Context Policy Learners for Robot Manipulation

动作-观察-重写:多模态编码代理作为机器人操作的上下文政策学习者

Vaishak Kumar

机构 * General Bionix, Inc.(通用生物交叉公司)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 AOR框架通过生成可执行代码使机器人操作策略学习无需演示或奖励工程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22246 2026-02-27 cs.CR cs.LG 78%

Self-Purification Mitigates Backdoors in Multimodal Diffusion Language Models

自净化缓解多模态扩散语言模型中的后门

Guangnian Wan, Qi Li, Gongfan Fang, Xinyin Ma, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 DiSP通过在推理过程中选择性屏蔽视觉标记,有效去除多模态扩散语言模型中的后门,无需额外模型或干净数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11627 2026-02-26 cond-mat.str-el cond-mat.mes-hall cond-mat.mtrl-sci 78%

Dynamic competition between phason and amplitudon observed by ultrafast multimodal scanning tunneling microscopy

相位振荡与振幅波之间的动态竞争通过超快多模扫描隧道显微镜观测

Seokjin Bae, Arjun Raghavan, Soyeun Kim, Kejian Qu, Chengxi Zhao, Daniel P. Shoemaker, Ziqiang Wang, Fahad Mahmood, Barry Bradlyn, Vidya Madhavan

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 通过超快多模扫描隧道显微镜观测到相位振荡与振幅波之间的动态竞争,揭示了量子材料中集体激发的生成与灭绝机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15857 2026-02-24 cs.IR 78%

Large-scale Benchmarks for Multimodal Recommendation with Ducho

基于Ducho的多模态推荐系统大规模基准测试

Matteo Attimonelli, Danilo Danese, Angela Di Fazio, Daniele Malitesta, Claudio Pomo, Tommaso Di Noia

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本文首次提出基于Ducho的多模态推荐系统大规模基准测试,通过统一实验环境评估多模态特征提取器的性能。

Comments Accepted in Expert Systems with Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16871 2026-02-12 cs.RO 78%

HOGraspFlow: Taxonomy-Aware Hand-Object Retargeting for Multi-Modal SE(3) Grasp Generation

HOGraspFlow: 一种基于分类意识的多模态SE(3)抓取生成方法

Yitian Shi, Zicheng Guo, Rosa Wolf, Edgar Welte, Rania Rayyes

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 多模态生成 :multi-modal(title,abstract)

AI总结 HOGraspFlow通过多模态SE(3)抓取生成方法,在无需显式几何先验的情况下实现高保真的抓取合成。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08830 2026-02-10 cs.HC 78%

Enhancing Generative AI Image Refinement with Scribbles and Annotations: A Comparative Study of Multimodal Prompts

通过草图和注释增强生成式AI图像细化:多模态提示的比较研究

Hyerim Park, Phuong Thao Tran, Andre Luckow, Ceenu George, Michael Sedlmair, Malin Eiband

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本研究通过比较多模态提示,探讨草图和注释如何提升生成式AI图像细化,提出原型并揭示设计师在多模态策略中的偏好。

Comments 22 pages, 14 figures. Preprint of an accepted IUI '26 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04780 2026-02-10 cs.LG cond-mat.dis-nn 78%

Dynamical Regimes of Multimodal Diffusion Models

多模态扩散模型的动力学区域

Emil Albrychiewicz, Andrés Franco Valiente, Li-Ching Chen

机构 * Leinweber Institute for Theoretical Physics(莱因韦伯理论物理研究所) Department of Physics, University of California, Berkeley, CA, 94720-7300, USA(加州大学伯克利分校物理系) Theoretical Physics Group, Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室理论物理组) Department of Radiation Oncology, University of California, San Francisco(加州大学旧金山分校放射肿瘤科) Computational Precision Health, University of California San Francisco(加州大学旧金山分校计算精准健康)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 多模态扩散模型通过耦合动态机制,揭示生成过程中的时间层次结构及同步间隙现象,为生成模型的稳定性提供理论框架。

Comments 40 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06597 2026-02-09 cs.LG 78%

DiTS: Multimodal Diffusion Transformers Are Time Series Forecasters

DiTS:多模态扩散变换器是时间序列预测器

Haoran Zhang, Haixuan Liu, Yong Liu, Yunzhong Qiu, Yuxuan Wang, Jianmin Wang, Mingsheng Long

机构 * School of Software, BNRist, Tsinghua University(软件学院、BNRist、清华大学)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 DiTS通过双流Transformer块处理时间序列的内生和外生变量依赖,实现高效生成预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13646 2026-02-06 cs.HC 78%

Vistoria: A Multimodal System to Support Fictional Story Writing through Instrumental Text-Image Co-Editing

Vistoria:一种多模态系统,通过仪器文本-图像协同编辑支持虚构故事写作

Kexue Fu, Jingfei Huang, Long Ling, Sumin Hong, Yihang Zuo, Ray LC, Toby Jia-jun Li

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 Vistoria通过多模态协同编辑提升虚构故事创作的表达力和创造力,使作家能更自由地探索故事发展方向。

Comments Change the format of the first page

详情

展开后加载摘要…

URL PDF HTML 收藏