arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-09 至 2025-12-09 共收录 102 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 18 篇

2512.07141 2025-12-09 cs.CV cs.CL 62%

Think-Reflect-Revise: A Policy-Guided Reflective Framework for Safety Alignment in Large Vision Language Models

思考-反思-修订:一种基于策略的反思框架,用于大型视觉语言模型的安全对齐

Fenghua Weng, Chaochao Lu, Xia Hu, Wenqi Shao, Wenjie Wang

机构 * Shanghaitech University(上海科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 TRR通过策略引导的反思框架提升大型视觉语言模型的安全对齐,显著提高安全响应率至87.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06848 2025-12-09 cs.CL cs.CV 62%

AquaFusionNet: Lightweight VisionSensor Fusion Framework for Real-Time Pathogen Detection and Water Quality Anomaly Prediction on Edge Devices

AquaFusionNet:轻量级视觉传感器融合框架,用于边缘设备上的实时病原体检测和水质异常预测

Sepyan Purnama Kristanto, Lutfi Hakim, Hermansyah

机构 * Department of Informatics Engineering, Politeknik Negeri Banyuwangi(信息工程系,普特里克国家理工学院巴扬威angi分校) Balai Besar Teknik Kesehatan Lingkungan dan P2B Surabaya(环境与P2B技术研究所Surabaya)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 AquaFusionNet通过跨模态融合提升边缘设备上病原体检测和水质异常预测的准确率与效率。

Comments 9Pages, 3 figure, Politeknik Negeri Banyuwangi

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07021 2025-12-09 cs.LG cs.AI 57%

Transferring Clinical Knowledge into ECGs Representation

将临床知识转移到ECG表示中

Jose Geraldo Fernandes, Luiz Facury de Souza, Pedro Robles Dutenhefner, Gisele L. Pappa, Wagner Meira

机构 * Department of Computer Science(计算机科学系) Universidade Federal de Minas Gerais(巴西矿务联邦大学) Depart. of Math. and Comp. Sc.(数学与计算机科学系) Albion College(阿尔比恩学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种三阶段训练方法,将多模态临床数据转化为ECG表示,提升分类模型的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06662 2025-12-09 cs.CV 57%

Personalized Image Descriptions from Attention Sequences

基于注意力序列的个性化图像描述

Ruoyu Xue, Hieu Le, Jingyi Xu, Sounak Mondal, Abe Leite, Gregory Zelinsky, Minh Hoai, Dimitris Samaras

机构 * Stony Brook University(石溪大学) UNC-Charlotte(北卡罗来纳大学夏洛特分校) The University of Adelaide(阿德莱德大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 DEPER通过建模个性化注意力序列,实现了基于视觉-语言模型的个性化图像描述生成,提升了描述质量与人类对齐性。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05979 2025-12-09 physics.chem-ph cs.AI cs.DM cs.LG 57%

Accelerating Materials Discovery: Learning a Universal Representation of Chemical Processes for Cross-Domain Property Prediction

加速材料发现:学习化学过程的通用表示以实现跨领域性质预测

Mikhail Tsitsvero, Atsuyuki Nakao, Hisaki Ikebata

机构 * CrowdChem, Inc.(CrowdChem公司)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出了一种通用的过程图表示,通过多模态图神经网络实现跨领域性质预测,展示了大规模学习的通用表示在专门任务中的高效迁移能力。

Comments 22 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14670 2025-12-09 cs.CV 57%

Gene-DML: Dual-Pathway Multi-Level Discrimination for Gene Expression Prediction from Histopathology Images

Gene-DML:双路径多级判别用于从组织病理图像预测基因表达

Yaxuan Song, Jianan Fan, Hang Chang, Weidong Cai

机构 * The University of Sydney, Australia(悉尼大学) Lawrence Berkeley National Laboratory, USA(伯克利国家实验室)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 Gene-DML通过双路径多级判别方法,提升组织病理图像与基因表达谱的跨模态对齐,实现高精度的基因表达预测。

Comments Accepted by The IEEE/CVF Winter Conference on Applications of Computer Vision 2026 (WACV2026). Code and data available at https://github.com/YXSong000/Gene-DML

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 6 篇

2512.06225 2025-12-09 physics.app-ph 78%

Curation and Dissemination of Complex Multi-modal Data Sets for Radiation Detection, Localization, and Tracking

辐射检测、定位与跟踪的复杂多模态数据集的整理与传播

Nicolas Abgrall, Mark S. Bandstra, Reynold J. Cooper, Marco Salathe, Brian J. Quiter, Rajesh Sankaran, Yongho Kim, Sean Shahkarami

专题命中 其他多模态 :multi-modal(title,abstract)

AI总结 本文介绍了PANDAWN传感器网络,展示了其在多模态数据整理与传播方面的应用,以促进辐射检测、定位和跟踪算法的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07153 2025-12-09 eess.SY cs.SY q-bio.QM 71%

A Structured Review of Fixed and Multimodal Sensing Techniques for Bat Monitoring

蝙蝠监测中固定与多模态传感技术的结构化综述

Maatla Sefawe, Sravya Ganti, Julianna Segalla, Erwei He, Isaac Tourner, Julia Gersey

专题命中 其他多模态 :multimodal(title)

AI总结 本文综述了蝙蝠监测中固定与多模态传感技术的优缺点,为未来研究提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07733 2025-12-09 cs.CV 57%

SpatialDreamer: Incentivizing Spatial Reasoning via Active Mental Imagery

SpatialDreamer: 通过主动心理意象激励空间推理

Meng Cao, Xingyu Li, Xue Liu, Ian Reid, Xiaodan Liang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·宾·扎耶德人工智能大学) Sun Yat-sen University(孙中山大学)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV

AI总结 SpatialDreamer通过主动心理意象和几何策略优化,提升多模态大语言模型在复杂空间推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07040 2025-12-09 cs.LG cs.CV 57%

Transformation of Biological Networks into Images via Semantic Cartography for Visual Interpretation and Scalable Deep Analysis

通过语义制图将生物网络转换为图像以实现可视化解释和可扩展深度分析

Sakib Mostafa, Lei Xing, Md. Tauhidul Islam

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 Graph2Image通过将生物网络转换为图像,实现可扩展的深度分析和可视化解释,提升分类准确率并揭示生物一致性模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01268 2025-12-09 cs.CL cs.LG 57%

Deep Learning and Machine Learning, Advancing Big Data Analytics and Management: Unveiling AI's Potential Through Tools, Techniques, and Applications

深度学习与机器学习:推动大数据分析与管理,通过工具、技术和应用揭示人工智能的潜力

Pohsun Feng, Ziqian Bi, Yizhu Wen, Xuanhe Pan, Benji Peng, Ming Liu, Jiawei Xu, Keyu Chen, Junyu Liu, Caitlyn Heqi Yin, Sen Zhang, Jinlang Wang, Qian Niu, Ming Li, Tianyang Wang, Xinyuan Song, Zekun Jiang

机构 * National Taiwan Normal University(国立台湾师范大学) Indiana University(印第安纳大学) University of Hawaii(夏威夷大学) Kyoto University(京都大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) Georgia Institute of Technology(佐治亚理工学院) Rutgers University(罗格斯大学) Purdue University(普渡大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Emory University(埃默里大学) Sichuan University(四川大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文探讨深度学习与机器学习在大数据分析中的应用,通过工具和技术揭示AI潜力,强调伦理与公平性,推动各领域创新。

Comments This book contains 155 pages and 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06829 2025-12-09 cs.RO 50%

MagicSkin: Balancing Marker and Markerless Modes in Vision-Based Tactile Sensors with a Translucent Skin

MagicSkin: 通过透明皮肤平衡标记与无标记模式在基于视觉的触觉传感器中的应用

Oluwatimilehin Tijani, Zhuo Chen, Jiankang Deng, Shan Luo

机构 * Robot Perception Lab, Centre for Robotics Research, Department of Engineering, King’s College London(机器人感知实验室,机器人研究研究中心,工程系,伦敦国王学院) Imperial College London(帝国理工学院伦敦校区)

专题命中 其他多模态 :multimodal(abstract)

AI总结 MagicSkin通过半透明标记平衡标记与无标记模式,提升触觉传感器在物体分类、纹理识别和力预测中的性能。

Comments Submitted to ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏