arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-20 至 2026-02-20 共收录 34 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 3 篇

2602.06530 2026-02-20 cs.CV cs.CR 79%

Universal Anti-forensics Attack against Image Forgery Detection via Multi-modal Guidance

面向图像伪造检测的通用反取证攻击框架 via 多模态指导

Haipeng Li, Rongxuan Peng, Anwei Luo, Shunquan Tan, Changsheng Chen, Anastasia Antsiferova

机构 * Shenzhen University, China(深圳大学) Nanyang Technological University, Singapore(南洋理工大学) Shenzhen MSU-BIT University, China(深圳MSU-BIT大学) Lomonosov Moscow State University's Institute for Artificial Intelligence, Russia(罗蒙诺索夫莫斯科国立大学人工智能研究所)

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出ForgeryEraser框架,通过多模态指导损失实现对图像伪造检测器的通用反取证攻击,揭示了VLMs依赖性带来的对抗性漏洞,并展示了对先进AIGC检测器的性能影响。

Comments 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15943 2026-02-20 cs.CV 70%

Boosting Medical Visual Understanding From Multi-Granular Language Learning

通过多粒度语言学习提升医学视觉理解

Zihan Li, Yiqing Wang, Sina Farsiu, Paul Kinahan

机构 * University of Washington(华盛顿大学) Duke University(杜克大学)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出MGLL框架,通过多粒度语言学习提升医学影像的视觉理解能力,改进多标签和跨粒度对齐,提升下游任务性能。

Comments Accepted by ICLR 2026. 40 pages

Journal ref The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17645 2026-02-20 cs.LG cs.AI cs.CL cs.CV 67%

Pushing the Frontier of Black-Box LVLM Attacks via Fine-Grained Detail Targeting

通过细粒度细节靶向推动大视觉-语言模型攻击的前沿

Xiaohan Zhao, Zhaoyi Li, Yaxin Luo, Jiacheng Cui, Zhiqiang Shen

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 通过细粒度细节靶向改进M-Attack,显著提升黑盒攻击效果,成功率达100%

Comments Code at: https://github.com/vila-lab/M-Attack-V2

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 1 篇

2602.17599 2026-02-20 cs.CV cs.MM cs.SD 84%

Art2Mus: Artwork-to-Music Generation via Visual Conditioning and Large-Scale Cross-Modal Alignment

Art2Mus: 通过视觉条件和大规模跨模态对齐进行艺术品到音乐生成

Ivan Rinaldi, Matteo Mendula, Nicola Fanelli, Florence Levé, Matteo Testi, Giovanna Castellano, Gennaro Vessio

机构 * University of Bari Aldo Moro(巴里大学阿尔多·莫罗大学) Catalonia's Telecommunications Technology Centre(加泰罗尼亚电信技术中心) University of Picardie Jules Verne(皮卡第大学朱利·瓦内大学)

专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM

AI总结 ArtToMus通过直接视觉条件生成音乐,无需图像到文本转换,实现艺术品到音乐的跨模态对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 3 篇

2602.17252 2026-02-20 cs.CV cs.SY eess.IV eess.SY 79%

A Multi-modal Detection System for Infrastructure-based Freight Signal Priority

基于基础设施的货运信号优先的多模态检测系统

Ziyan Zhang, Chuheng Wei, Xuanpeng Zhao, Siyan Li, Will Snyder, Mike Stas, Peng Hao, Kanok Boriboonsomsin, Guoyuan Wu

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于激光雷达和摄像头的多模态货运车辆检测系统,通过混合传感架构和卡尔曼滤波实现稳定实时性能,用于支持基于基础设施的货运信号优先应用。

Comments 12 pages, 15 figures. Accepted at ICTD 2026. Final version to appear in ASCE Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17068 2026-02-20 cs.LG cs.SY eess.SY 78%

Spatio-temporal dual-stage hypergraph MARL for human-centric multimodal corridor traffic signal control

时空双阶段超图多智能体强化学习用于以人为中心的多模式走廊交通信号控制

Xiaocai Zhang, Neema Nassir, Milad Haghani

机构 * Department of Infrastructure Engineering, Faculty of Engineering and Information Technology, The University of Melbourne, VIC 3010, Australia(工程与信息技术学院基础设施工程系,墨尔本大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出STDSH-MARL方法,通过时空双阶段超图注意力机制和混合动作空间,提升走廊交通信号对多模式旅行者和公共交通的适应性与优先级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17231 2026-02-20 cs.CV 57%

HiMAP: History-aware Map-occupancy Prediction with Fallback

HiMAP: 基于历史的无跟踪地图占用预测与回退

Yiming Xu, Yi Yang, Hao Cheng, Monika Sester

机构 * Institute of Cartography and Geoinformatics, Leibniz University Hannover(莱比锡大学汉诺威分校制图与地理信息学研究所) Institute of Information Processing, Leibniz University Hannover(莱比锡大学汉诺威分校信息处理研究所) Faculty of Geo-Information Science and Earth Observation, University of Twente(埃因霍温大学地球信息科学与地球观测系)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 HiMAP通过无需跟踪的轨迹预测框架,在MOT失败时提供可靠预测,实现无ID的高精度未来轨迹生成。

Comments Accepted in 2026 IEEE International Conference on Robotics and Automation

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 5 篇

2602.17168 2026-02-20 cs.CV 83%

BadCLIP++: Stealthy and Persistent Backdoors in Multimodal Contrastive Learning

BadCLIP++: 多模态对比学习中隐蔽且持久的后门

Siyuan Liang, Yongcheng Jing, Yingjie Wang, Jiaxing Huang, Ee-chien Chang, Dacheng Tao

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 BadCLIP++通过语义融合触发器和参数稳定技术,实现了多模态对比学习中隐蔽且持久的后门攻击,实验显示其在低污染率下具有高攻击成功率。

Comments 25 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17584 2026-02-20 cs.LG 82%

Canonicalizing Multimodal Contrastive Representation Learning

规范多模态对比表示学习

Sharut Gupta, Sanyam Kansal, Stefanie Jegelka, Phillip Isola, Vikas Garg

专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract)

AI总结 研究通过正交映射统一多模态对比模型的表示空间,实现跨模态的一致性对齐。

Comments 78 pages, 57 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16876 2026-02-20 cs.LG stat.ML 82%

ML-driven detection and reduction of ballast information in multi-modal datasets

基于机器学习的多模态数据集中的冗余信息检测与减少

Yaroslav Solovko

机构 * Independent Researcher(独立研究者)

专题命中 跨模态检索 :multi-modal(title);multimodal(abstract);cross-modal(abstract)

AI总结 本文提出了一种多模态框架,用于检测和减少数据集中的冗余信息,通过多种方法整合信号,实现特征空间的高效修剪,提升机器学习效率。

Comments 20 pages, 27 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17402 2026-02-20 cs.AI 70%

A Contrastive Variational AutoEncoder for NSCLC Survival Prediction with Missing Modalities

用于NSCLC生存预测的对比变分自编码器,具有缺失模态

Michele Zanitti, Vanja Miskovic, Francesco Trovò, Alessandra Laura Giulia Pedrocchi, Ming Shen, Yan Kyaw Tun, Arsela Prelaj, Sokol Kosta

机构 * Department of Electronic Systems, Aalborg University, Copenhagen, Denmark(电子系统系,奥胡斯大学) Department of Electronics, Information and Bioengineering, Politecnico di Milano, Milan, Italy(电子、信息与生物工程系,米兰理工学院) Department of Medical Oncology, Istituto Nazionale dei Tumori, Milan, Italy(医学肿瘤学系,国家肿瘤研究所)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出了一种多模态对比变分自编码器,用于NSCLC生存预测,通过整合多种数据模态并处理缺失数据,提高预测的鲁棒性和准确性。

Comments Accepted at The 13th IEEE International Conference on Big Data (IEEE BigData 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16964 2026-02-20 cs.IR 50%

SAGE: Structure Aware Graph Expansion for Retrieval of Heterogeneous Data

SAGE:面向异构数据检索的结构感知图扩展

Prasham Titiya, Rohit Khoja, Tomer Wolfson, Vivek Gupta, Dan Roth

专题命中 跨模态检索 :cross-modal(abstract)

AI总结 SAGE通过构建结构感知的图扩展框架,在异构数据检索中提升召回率,采用混合检索与代理策略实现多模态证据链检索。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 1 篇

2602.17558 2026-02-20 cs.CV 83%

RetouchIQ: MLLM Agents for Instruction-Based Image Retouching with Generalist Reward

RetouchIQ: 基于指令的图像修复MLLM代理与通用奖励模型

Qiucheng Wu, Jing Shi, Simon Jenni, Kushal Kafle, Tianyu Wang, Shiyu Chang, Handong Zhao

机构 * Adobe Research(Adobe研究院)

专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 RetouchIQ通过通用奖励模型提升指令基于图像编辑的语义一致性和感知质量,展现灵活可解释的编辑能力。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 10 篇

2602.14879 2026-02-20 cs.CV cs.AI 81%

CT-Bench: A Benchmark for Multimodal Lesion Understanding in Computed Tomography

CT-Bench:一种用于CT中多模态病变理解的基准测试

Qingqing Zhu, Qiao Jin, Tejas S. Mathai, Yin Fang, Zhizheng Wang, Yifan Yang, Maame Sarfo-Gyamfi, Benjamin Hou, Ran Gu, Praveen T. S. Balamuralikrishna, Kenneth C. Wang, Ronald M. Summers, Zhiyong Lu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 CT-Bench是一个用于CT多模态病变理解的基准测试,包含病变图像和元数据集以及多任务视觉问答基准测试,通过评估多种多模态模型并展示其在临床中的应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17108 2026-02-20 cs.CL 79%

Projective Psychological Assessment of Large Multimodal Models Using Thematic Apperception Tests

基于主题知觉测试的大型多模态模型项目性心理评估

Anton Dzega, Aviad Elyashar, Ortal Slobodin, Odeya Cohen, Rami Puzis

机构 * Faculty of Computer and Information Science, Ben-Gurion University of the Negev(本·古里安大学计算机与信息科学学院) Department of Computer Science, Shamoon College of Engineering(沙莫恩工程学院计算机科学系) School of Education, Ben-Gurion University of the Negev(本·古里安大学教育学院) Department of Nursing Sciences, Ben-Gurion University of the Negev(本·古里安大学护理科学系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本研究通过主题知觉测试评估大型多模态模型的人格特质,发现其在人际动态和自我概念理解上表现良好,但在攻击性感知和调节方面存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16742 2026-02-20 cs.LG cs.AI 79%

DeepVision-103K: A Visually Diverse, Broad-Coverage, and Verifiable Mathematical Dataset for Multimodal Reasoning

DeepVision-103K: 一种视觉多样、覆盖面广且可验证的数学数据集,用于多模态推理

Haoxiang Sun, Lizhen Xu, Bing Zhao, Wotao Yin, Wei Wang, Boyu Yang, Rui Wang, Hu Wei

机构 * Alibaba Group(阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 DeepVision-103K是一个用于多模态推理的视觉多样、覆盖面广且可验证的数学数据集,通过增强模型的视觉反思和推理能力推动多模态推理发展。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17354 2026-02-20 cs.IR 78%

Training-free Graph-based Imputation of Missing Modalities in Multimodal Recommendation

无需训练的基于图的多模态推荐中缺失模态的补全

Daniele Malitesta, Emanuele Rossi, Claudio Pomo, Tommaso Di Noia, Fragkiskos D. Malliaros

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出无需训练的基于图的多模态推荐中缺失模态补全方法,通过图特征插值提升多模态推荐性能。

Comments Accepted in IEEE Transactions on Knowledge and Data Engineering (IEEE TKDE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16163 2026-02-20 cs.NI 71%

Collection: UAV-Based Wireless Multi-modal Measurements from AERPAW Autonomous Data Mule (AADM) Challenge in Digital Twin and Real-World Environments

基于AERPAW自主数据中继无人机的无线多模测量收集:数字孪生与现实环境中的AADM挑战

Md Sharif Hossen, Cole Dickerson, Ozgur Ozdemir, Anil Gurses, Mohamed Rabeek Sarbudeen, Thomas Zajkowski, Ahmed Manavi Alam, Everett Tucker, William Bjorndahl, Fred Solis, Sadaf Javed, Anirudh Kamath, Xiangyao Tang, Joarder Jafor Sadique, Kevin Liu Hermstein, Kaies Al Mahmud, Jose Angel Sanchez Viloria, Skyler Hawkins, Yuqing Cui, Annoy Dey, Yuchen Liu, Ali Gurbuz, Joseph Camp, Rizwan Ahmad, Jacobus van der Merwe, Ahmed Ibrahim Mohamed, Gil Zussman, Mehmet Kurum, Namuduri Kamesh, Zhangyu Guan, Dimitris Pados, George Sklivanitis, Ismail Guvenc, Mihail Sichitiu, Magreth Mushi, Rudra Dutta

专题命中 多模态评测 :multi-modal(title)

AI总结 本文提出基于AERPAW自主数据中继无人机的无线多模测量数据集,用于数字孪生与现实环境中的自主无线实验基准。

Comments 10 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17096 2026-02-20 cs.AI 70%

Agentic Wireless Communication for 6G: Intent-Aware and Continuously Evolving Physical-Layer Intelligence

面向6G的代理无线通信:意图感知与持续演化的物理层智能

Zhaoyang Li, Xingzhi Jin, Junyu Pan, Qianqian Yang, Zhiguo Shi

机构 * College of Information Science and Electronic Engineering, Zhejiang University(信息科学与电子工程学院,浙江大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出基于LLM的代理AI用于6G物理层,通过意图感知和持续演进实现自主通信决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16979 2026-02-20 cs.CV cs.CL cs.LG 62%

Characterizing the Predictive Impact of Modalities with Supervised Latent-Variable Modeling

基于监督潜在变量建模的模态预测影响分析

Divyam Madaan, Sumit Chopra, Kyunghyun Cho

机构 * New York University(纽约大学) Grossman School of Medicine(格罗斯曼医学院) Genentech(基因泰克) CIFAR(加拿大弗雷德里克·班克特研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 PRIMO是一种监督潜在变量插补模型,用于量化多模态学习中缺失模态的预测影响,通过方差度量评估模态对预测的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17586 2026-02-20 cs.RO cs.AI cs.LG 57%

Conditional Flow Matching for Continuous Anomaly Detection in Autonomous Driving on a Manifold-Aware Spectral Space

基于流匹配的连续异常检测:面向自动驾驶的流形感知频谱空间

Antonio Guillen-Perez

机构 * Independent Researcher(独立研究者)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI

AI总结 Deep-Flow通过流匹配技术在频谱空间中实现连续异常检测,利用运动学平滑性和低秩流形约束,提升自动驾驶安全验证的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16747 2026-02-20 cs.LG cs.AI 57%

LiveClin: A Live Clinical Benchmark without Leakage

LiveClin: 一种无泄漏的实时临床基准

Xidong Wang, Shuqi Guo, Yue Shen, Junying Chen, Jian Wang, Jinjie Gu, Ping Zhang, Lei Liu, Benyou Wang

机构 * The Chinese University of Hong Kong, ShenZhen(香港中文大学(深圳)) Ant Healthcare, Ant Group(蚂蚁集团) Zhejiang University(浙江大学) The Ohio State University(俄亥俄州立大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 LiveClin通过实时更新的临床病例基准,评估医学大语言模型在真实临床场景中的表现,揭示其在复杂医疗任务中的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16870 2026-02-20 cs.RO cs.DB 50%

Boreas Road Trip: A Multi-Sensor Autonomous Driving Dataset on Challenging Roads

Boreas Road Trip:一个针对挑战性道路的多传感器自动驾驶数据集

Daniil Lisus, Katya M. Papais, Cedric Le Gentil, Elliot Preston-Krebs, Andrew Lambert, Keith Y. K. Leung, Timothy D. Barfoot

机构 * University of Toronto Institute of Aerospace Studies(多伦多大学航空航天研究学院) Trimble(Trimble公司)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 Boreas Road Trip数据集通过多传感器数据评估自动驾驶算法在挑战性道路条件下的性能。

Comments 23 pages, 15 figures, 12 tables, submitted to The International Journal of Robotics Research (IJRR)

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 多模态Agent 1 篇

2602.16895 2026-02-20 cs.HC 71%

Connecting the Dots: Surfacing Structure in Documents through AI-Generated Cross-Modal Links

连接点:通过AI生成的跨模态链接揭示文档结构

Alyssa Hwang, Hita Kambhamettu, Yue Yang, Ajay Patel, Joseph Chee Chang, Andrew Head

专题命中 多模态Agent :cross-modal(title)

AI总结 本文提出通过AI生成跨模态链接的框架,帮助用户更高效地理解和整合复杂文档中的信息。

Comments 40 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 多模态训练与对齐 7 篇

2602.17196 2026-02-20 cs.CV 83%

EntropyPrune: Matrix Entropy Guided Visual Token Pruning for Multimodal Large Language Models

EntropyPrune: 基于矩阵熵的视觉令牌修剪用于多模态大语言模型

Yahong Wang, Juncheng Wu, Zhangkai Ni, Chengmei Yang, Yihang Liu, Longzhen Yang, Yuyin Zhou, Ying Wen, Lianghua He

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) University of California, Santa Cruz(加州大学圣克ruz分校) East China Normal University(华东师范大学) Shanghai Eye Disease Prevention and Treatment Center(上海眼病预防与治疗中心)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 EntropyPrune通过矩阵熵指导的视觉令牌修剪方法,提升多模态大语言模型的推理效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09201 2026-02-20 cs.LG cs.AI cs.CL 81%

Multimodal Prompt Optimization: Why Not Leverage Multiple Modalities for MLLMs

多模态提示优化:为何不利用多种模态为大语言模型服务

Yumin Choi, Dongki Kim, Jinheon Baek, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出多模态提示优化问题,提出MPO框架,通过联合优化和贝叶斯策略提升多模态提示效果,验证其在图像、视频等多模态任务中的优越性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15162 2026-02-20 eess.SP cs.AI cs.LG 79%

Multimodal Wireless Foundation Models

多模态无线基础模型

Ahmed Aboulfotouh, Hatem Abou-Zeid

机构 * Department of Electrical and Software Engineering(电气与软件工程系) University of Calgary(卡尔加里大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出首个多模态无线基础模型,能处理IQ流和图像类无线模态,支持多种无线任务,展示了其在不同模态上的广泛应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17088 2026-02-20 cs.LG 67%

MeGU: Machine-Guided Unlearning with Target Feature Disentanglement

MeGU:基于目标特征解耦的机器引导反学习

Haoyu Wang, Zhuo Huang, Xiaolong Wang, Bo Han, Zhiwei Lin, Tongliang Liu

机构 * School of Automation, Beijing Institute of Technology(自动化学院,北京理工大学) Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) Department of Computer Science, Hong Kong Baptist University(计算机科学系,香港 Baptist 大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);MLLM(abstract)

AI总结 MeGU通过目标特征解耦实现受控反学习,利用多模态大语言模型进行概念感知的重新对齐,以提升反学习效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17536 2026-02-20 physics.acc-ph cs.AI 57%

Toward a Fully Autonomous, AI-Native Particle Accelerator

迈向完全自主的、原生AI粒子加速器

Chris Tennant

机构 * Jefferson Laboratory(杰弗逊实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出通过AI共同设计构建完全自主的粒子加速器,旨在实现自主运行和最大化性能。

Comments 14 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17478 2026-02-20 cs.CV 57%

QuPAINT: Physics-Aware Instruction Tuning Approach to Quantum Material Discovery

QuPAINT:一种面向量子材料发现的物理感知指令微调方法

Xuan-Bac Nguyen, Hoang-Quan Nguyen, Sankalp Pandey, Tim Faltermeier, Nicholas Borys, Hugh Churchill, Khoa Luu

机构 * CVIU Lab, University of Arkansas, USA(Arkansas大学计算机视觉实验室) University of Utah, USA(犹他大学) Department of Physics, University of Arkansas, USA(Arkansas大学物理系)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 QuPAINT通过物理感知指令微调方法,提升量子材料发现的多模态表征能力,建立标准化评估基准。

Comments Project page: https://uark-cviu.github.io/projects/qupaint/

详情

展开后加载摘要…

URL PDF HTML 收藏