arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

共收录 77 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 融合架构与评测 77 篇

2607.24232 2026-07-28 cs.IR 新提交 50%

Strategy-Aware Parameter-Efficient Adaptation for LLM-based Auto-Bidding

基于大语言模型的自动出价的策略感知参数高效适配

Songyue Cai, Lianyu Wang, Shan Gu, Ziru Xu, Jian Xu, Xiaofeng Zhu, Bo Zheng

专题命中 融合架构与评测 :multi-modal fusion(abstract)

AI总结 研究广告自动出价问题,提出SAGE框架,通过位置增强、文本对齐和约束门控LoRA三个组件,实现参数高效多模态对齐,在大规模基准实验中性能卓越,调整参数少,消融研究验证各组件贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23822 2026-07-28 cs.LG 新提交 50%

DriveDNA: A Large-Scale Multimodal Naturalistic Driving Dataset and Benchmark for Driving Style Identification

DriveDNA:用于驾驶风格识别的大规模多模态自然驾驶数据集及基准测试

Yuhang Wang, Lingyao Li, Hao Zhou

机构 * University of South Florida(南佛罗里达大学) University of Arizona(亚利桑那大学)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 该研究引入DriveDNA数据集及基准测试用于驾驶风格识别,定义驾驶风格为车辆在相似条件下的特定行为模式,通过三个核心任务评估,对比多种基线方法得出学习表示更优,视频模型有路线泄漏问题,强调可靠评估需考虑多方面因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22884 2026-07-28 cs.CL 新提交 50%

CHiPS: Character Histograms and Positional Signals for Lightweight Authorship Attribution in Romanian Texts

CHiPS:罗马尼亚语文本中用于轻量级作者归属的字符直方图和位置信号

Sanda-Maria Avram, George C. Ţurcaş

机构 * Faculty of Mathematics and Computer Science, Babeş-Bolyai University(巴比什-波雅依大学数学与计算机科学学院)

专题命中 融合架构与评测 :decision-level fusion(abstract)

AI总结 该研究针对罗马尼亚语文本提出CHiPS轻量级字符级作者归属方法,研究两种互补写作风格指纹,包括字符直方图分类器和位置信号分类器,还介绍了融合变体等,通过实验探讨受限字符证据在严格泄漏控制下的效果。

Comments 17 pages, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22779 2026-07-28 cs.LG cs.AI 新提交 50%

Multimodal Surface EMG Hand Gesture Recognition Using Query-Based Transformers for Prosthetic Control

使用基于查询的变压器进行多模态表面肌电手势识别以用于假肢控制

Federico Del Pup, Elisa Tentori, Manfredo Atzori

机构 * Department of Information Engineering, University of Padua(帕多瓦大学信息工程系) Padova Neuroscience Center, University of Padua(帕多瓦大学帕多瓦神经科学中心) Department of Biomedical Sciences, University of Padua(帕多瓦大学生物医学科学系) Department of Neuroscience, University of Padua(帕多瓦大学神经科学系) Information Systems Institute, University of Applied Sciences Western Switzerland (HES-SO Valais)(瑞士西部应用科学大学(HES-SO瓦莱州)信息系统研究所)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 研究针对表面肌电手势识别用于假肢控制时当前架构的局限,提出EMG-CrossFormer,通过级联交叉注意力融合层组合单模态编码器表示,经实验验证该方法能提升仅sEMG解码及多模态融合下的手势识别性能。

Comments GitHub repository: see https://github.com/deepPNClab/emg-crossformer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20517 2026-07-24 cs.LG 新提交 50%

Multimodal CoLRAG-TF: Triple-Filtered Retrieval for Complex PDFs

多模态CoLRAG-TF:复杂PDF的三重过滤检索

Takato Yasuno

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 研究针对异构PDF集合检索增强生成的挑战,提出多模态CoLRAG-TF四轴融合架构,集成多种技术。构建多模态索引,经贝叶斯优化确定融合权重。实验显示其检索召回率高,多跳答案相似性提升显著,还适用于视觉输入,提供通用框架。

Comments 18 pages, 8 tables, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10798 2026-07-14 cs.CL 新提交 50%

Trust Before Fusion: QIMG-7 and Source-Aware Resolution for Polluted Multimodal RAG

融合前的信任:用于受污染多模态RAG的QIMG-7和源感知分辨率

Saadeldine Eletter, Owais Aijaz, Preslav Nakov

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 研究多模态检索增强生成中受污染内容问题,提出QIMG-7基准。针对朴素多模态融合脆弱问题,提出源感知信任分辨率(SATR),Field-Selector变体效果最佳,结果支持选择性信任,显式文本可靠性建模是收益主要驱动因素。

Comments 23 pages, 6 figures, 23 tables. Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02734 2026-07-07 cs.CL cs.AI 新提交 50%

Echoes of Unrest: A Multimodal NLP Framework for Early Warning of Fake News and Violence-Driven Mob Activity

动荡的回声:用于假新闻和暴力驱动的暴民活动早期预警的多模态NLP框架

Md. Maruf Bangabashi, Tahmid Hasan, Golam Mahmud, Md. Mostafijur Rahman, Md. Toufiqur Rahman, Jahanur Biswas

机构 * Department of Computer Science and Engineering, Dhaka International University(达卡国际大学计算机科学与工程系) Department of Computer Science and Engineering, Bangladesh University of Engineering and Technology(孟加拉国工程技术大学计算机科学与工程系)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 针对社交媒体上错误信息传播引发危害的问题,提出多语言、多模态NLP框架。通过融合多基准数据集创建数据集,集成多种技术进行多模态融合,实验显示该框架在早期错误信息检测中有效。

Comments Accepted for publication as a book chapter (Taylor & Francis, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25998 2026-07-02 cs.CR 新提交 50%

BlowLive: Blow-Based Multi-Factor Biometrics with Liveness Detection and Revocability

BlowLive:基于吹气的多因素生物识别与活体检测及可撤销性

Eyasu Getahun Chekole, Howard Halim, Daniël Reijsbergen, Jianying Zhou

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 提出BlowLive框架,融合吹气声学信号与面部生物特征,采用模糊提取器生成稳定密钥进行认证,并引入多普勒频移活体检测,实现高精度、强安全与可撤销性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31332 2026-07-01 cs.AI 新提交 50%

CryoACE: An Atom-centric Framework for Accurate and Automated Model Building in Cryo-EM

CryoACE: 面向冷冻电镜中精确自动模型构建的原子中心框架

Minzhang Li, Mingrui Li, Weichen Qin, Qihe Chen, Sixian Shen, Yuan Pei, Jiakai Zhang, Jingyi Yu

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 提出CryoACE框架,通过原子中心重建范式和无需训练的引导机制,实现冷冻电镜密度图中均质与异质结构的精确原子模型构建,显著优于现有方法。

Journal ref ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21690 2026-06-24 cs.CR cs.CL cs.LG 新提交 50%

A Hybrid, Multi-Layered Pipeline for Phishing and Threat Classification: Independently Validated URL and NLP Engines with a Calibrated Multi-Channel Fusion Stage

用于钓鱼和威胁分类的混合多层管道:独立验证的URL和NLP引擎与校准的多通道融合阶段

Saifelden M. Ismail, Aser O. Ibrahim, Omar A. Mahmoud

机构 * Department of Communications and Information Engineering(通讯与信息工程系) Zewail City of Science and Technology(泽瓦尔科学与技术城)

专题命中 融合架构与评测 :decision-level fusion(abstract)

AI总结 提出一种混合管道,分别对URL和文本模态使用独立引擎评分并融合结果,在10,677封邮件基准测试中达到F1=0.914,并将真实垃圾邮件误报率降至3.6%。

Comments Graduation project, Zewail City of Science and Technology. Code and documentation: https://github.com/XHCFS/cybersiren. Whole-system fusion results use proxy URL and header channels; treat integrated metrics as preliminary

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23213 2026-06-23 cs.LG 新提交 50%

Deep learning-based detection of cessation of breathing in pre-term infants

基于深度学习的早产儿呼吸停止检测

Dineo Serame, Lionel Tarassenko, Mauricio Villarroel

机构 * Institute of Biomedical Engineering, Department of Engineering Science, University of Oxford(牛津大学工程科学系生物医学工程研究所)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 本研究利用深度学习模型,基于阻抗呼吸描记、心电图和光电容积描记信号,检测早产儿呼吸暂停相关呼吸停止事件,发现信号模态比架构复杂度更重要,单模态IP模型性能最优。

Comments 14 pages main text, 8 figures. Submitted to IEEE Journal of Biomedical and Health Informatics (JBHI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22171 2026-06-23 cs.LG 新提交 50%

Beyond Time Series: Spatial Reasoning for Epidemic Forecasting via Multimodal Learning

超越时间序列:基于多模态学习的空间推理用于流行病预测

Diana Guadalupe Gomez, Chenwei Wu, Zhiyi Wang, Liyue Shen, Alexander Rodríguez

机构 * University of Michigan(密歇根大学)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 提出M-SPICE框架,通过注意力机制融合区域级时序数据与空间辅助信号,在COVID-19、流感和ILI预测任务上超越现有基线。

Comments To appear in the Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026), AI for Science Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21066 2026-06-23 cs.CL 新提交 50%

Demographic Metadata as Construct-Irrelevant Noise in DistilBERT-Based Automated Essay Scoring

人口统计元数据作为基于DistilBERT的自动作文评分中的构念无关噪声

Teik Peng Ch'ng, Hui Na Chua

机构 * Sunway University(Sunway大学) Faculty of Engineering and Technology(工程与技术学院)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 研究通过ASAP 2.0数据集,发现将人口统计元数据与文本简单拼接会显著降低DistilBERT评分模型的预测准确性和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20603 2026-06-23 cs.CY 新提交 50%

A Survey of Large Language Models for Perception and Measurement of Human Psychology

大型语言模型在人类心理感知与测量中的综述

Yudong Li, Xiaoyi Chen, Jiawei Cai, Zehao Zhong, Haoyang Yang, Huajin Tang, Linlin Shen

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 本文系统综述了大型语言模型(LLMs)作为人类心理测量工具的应用,从理论可行性、测量方法和应用效果三个维度构建分析框架,探讨其在人格评估和心理健康评价中的有效性及局限。

Comments Accepted by IEEE Transactions on Cognitive and Developmental Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17115 2026-06-17 cs.LG cs.AI q-bio.QM 新提交 50%

Probing, Fusion, and Trustworthiness: A Systematic Evaluation of Foundation Model Representations for Multimodal Cancer Analysis

探测、融合与可信度:基础模型表示在多模态癌症分析中的系统评估

Jingyu Hu, Giuseppe Tripodi, Reed Naidoo, Sarah F. McGough, Tapabrata Chakraborti

机构 * The Alan Turing Institute(艾伦·图灵研究所) University of Bristol(布里斯托大学) University of Manchester(曼彻斯特大学) The Institute of Cancer Research(癌症研究所) Genentech(基因泰克)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 系统评估基础模型表示在计算病理学任务中的性能,发现图像和组学表示互补,多模态融合在单模态不占优时有效,并利用共形预测验证了不确定性感知推理的临床价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16684 2026-06-16 cs.CL 新提交 50%

Progressive Knowledge-Guided Large Language Model Framework for Bearing Fault Diagnosis

渐进式知识引导的大型语言模型框架用于轴承故障诊断

Jinghan Wang, Gaoliang Peng, Yanjun Chen, Wei Zhang, Wentao Wu, Tianchen Liu

机构 * Harbin Institute of Technology, China(哈尔滨工业大学,中国) Eastern Institute of Technology, China(东方技术研究所,中国)

专题命中 融合架构与评测 :information fusion(abstract)

AI总结 提出渐进式物理引导多尺度振动信号处理框架,通过81维测量描述符、故障自适应分割和隐式知识编码,在四个数据集上实现98.49%诊断精度并降低12.6倍计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11420 2026-06-11 cs.CL cs.SI 新提交 50%

Context-Aware Multimodal Claim Verification in Spoken Dialogues

口语对话中的上下文感知多模态声明验证

Chaewan Chun, Delvin Ce Zhang, Dongwon Lee

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Sheffield(谢菲尔德大学)

专题命中 融合架构与评测 :multimodal fusion(abstract)

AI总结 提出MAD2基准和上下文感知多模态融合方法,验证对话音频中的声明,发现对话结构比虚假信息框架对验证更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏