arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6929 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6929 篇

2608.06246 2026-08-07 cs.LG 新提交 50%

A Six-Dimensional Taxonomy of Post-Training Adaptation Techniques with Applications in AI Governance

用于人工智能治理的后训练适应技术的六维分类法

Fardin Afdideh, Fernando Seoane, Farhad Abtahi

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本综述构建了后训练适应技术的六维分类法,梳理技术间关系,为AI治理提供术语支持,并指出该领域的开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05238 2026-08-07 cs.LG 新提交 50%

Decoupling Perception from Description: Computation-Grounded Representation Alignment between Multivariate Time Series and Language

感知与描述解耦:多变量时间序列与语言间的计算基础表示对齐

Xinran Feng, Yi Xie, Chao Zhang, Ruikun Li, Wanyun Ling, Ziyue Li, Chenxi Liu

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 该研究针对多模态时间序列语言对齐的三难困境,提出CGTime模型,通过计算处理感知、LLM处理描述,在多变量理解任务上优于更大的通用模型。

Comments 46 pages, 9 figures, including supplementary material. Submitted to AAAI 2027. Xinran Feng and Yi Xie contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05595 2026-08-07 quant-ph cs.DC cs.LG 新提交 50%

How Much Reconstruction Does Quantum Machine Learning Need? Late Fusion of Independently Trained Quantum Subcircuits

量子机器学习需要多少重构?独立训练量子子电路的后期融合

Prabhjot Singh, Adel N. Toosi, Rajkumar Buyya

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 针对电路切割量子机器学习中重构成本过高的问题,提出后期融合方法,其准确率与完全重构差距极小但成本指数级降低,且鲁棒性更强,是重构的高效替代方案。

Comments 11 pages, 6 figures. Includes technical appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03344 2026-08-05 cond-mat.mtrl-sci physics.app-ph physics.ins-det 新提交 50%

Picometre-scale real-time drift correction in TEM and STEM by dynamic control of the specimen stage for atomic-resolution imaging

用于原子分辨率成像的透射电子显微镜(TEM)与扫描透射电子显微镜(STEM)中通过动态控制样品台实现皮米级实时漂移校正

Christophe Gatel, Julien Dupuy, Teresa Hungria, Martin J. Hytch

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本研究开发无需硬件修改的动态控制软件框架,通过控制样品台实现皮米级实时漂移校正,提升TEM、STEM成像质量,支持原子分辨率成像及各类实验应用。

Comments 27 pages, 9 figures. Submitted to Ultramicroscopy Christophe Gatel: Writing original draft, Software, Methodology, Investigation, Data treatment, Conceptualization, Resources, Funding acquisition. Julien Dupuis: Software, Conceptualization, Methodology. Teresa Hungria: STEM experiment, Review & editing. Martin Hytch: Review & editing, Data treatment, Resources, Funding acquisition

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00368 2026-08-04 eess.SP 新提交 50%

Agent-Native Task-Oriented Communication with Joint Token Compression Coding and Modulation

面向智能体原生的任务导向通信:联合令牌压缩编码与调制

Zhuoran Xiao, Yihang Huang, Tianyu Jiao, Xiaohua Xu, Yin Xu

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 该研究针对无线令牌通信系统的原生设计缺口,提出AI原生语义通信框架JTCM,通过两阶段训练实现任务导向的令牌传输,可降低传输开销并提升任务精度与鲁棒性。

Comments This paper is accepted by IEEE Globecom 2026, to appear

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01102 2026-08-04 cs.RO 新提交 50%

CAAT: Contact-Aware Attention Scaling and Tactile Masking for Data-Efficient Contact-Rich Manipulation

CAAT:用于数据高效接触丰富型操作的接触感知注意力缩放与触觉掩码方法

Jiaming Jiang, Yuzhe Huang, Hao Liang, Pei Lin, Shengcheng Luo, Fanrong Dong, Jiaping Wu, Chenxi Xiao, Wanlin Li, Ziyuan Jiao

机构 * ShanghaiTech University(上海科技大学) Beihang University(北京航空航天大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) Zhejiang University(浙江大学) BUPT(北京邮电大学)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 该研究针对接触丰富型操作中视觉-触觉策略缺乏接触感知先验的问题,提出CAAT框架,通过注意力缩放和动态触觉掩码提升策略性能,在仿真和真实实验中均显著优于现有方法。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02573 2026-08-04 astro-ph.IM 新提交 50%

Foundation Models for Astrophysics

天体物理学领域的基础模型

Xiaosheng Zhao, Yuan-Sen Ting

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 本章介绍面向天文领域的基础模型,阐述其核心是可迁移表示,指出当前天文领域此类模型的可迁移性验证案例较少,未来需进一步探索提升路径。

Comments Invited chapter for the edited book "Machine Learning Techniques for Astrophysics and Cosmology" (Eds. Cosimo Bambi, Vinay Kashyap, Swarnim Shashank, Naoki Yoshida, Springer Singapore, expected in 2026). Submitted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29008 2026-08-03 stat.ML cs.LG 新提交 50%

Persistent Convolution: A Topological Framework for AI Alignment Testing and Semantic Space Characterization

持久卷积:用于AI对齐测试和语义空间表征的拓扑框架

Tyler Ashoff, Jordan Rodu

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本研究开发了一种基于拓扑的多模态对齐测试,以提升不透明AI模型部署、选择与比较的可解释性,助力AI对齐测试与语义空间表征。

Comments Code available at github.com/tylerashoff/persiscope (PyPI: persiscope)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19683 2026-08-03 cs.RO 版本更新 50%

GPA-RAM: Grasp-Pretraining Augmented Robotic Attention Mamba for Spatial Task Learning

GPA-RAM:用于空间任务学习的抓取预训练增强型机器人注意力Mamba

Juyi Sheng, Yangjun Liu, Sheng Xu, Zhixin Yang, Tiantian Xu, Mengyuan Liu

机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School(国家一般人工智能重点实验室,北京大学深圳研究生院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院) State Key Laboratory of Internet of Things for Smart City, University of Macau(智慧城市物联网重点实验室,澳门大学)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 该研究提出GPA-RAM框架,通过GPA增强模仿策略并开发RAM实现高效计算,在多机器人平台的空间操纵任务中显著提升成功率,兼顾精度与实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25175 2026-07-30 cs.MA 版本更新 50%

Agentic AI-enabled discovery across large-scale sleep physiology

基于智能体的人工智能助力大规模睡眠生理学研究

Rahul Thapa, Umaer Hanif, Robin Guillard, Andreas Brink-Kjaer, Adrien Specht, Matteo Saibene, Magnus Ruud Kjaer, Harrison G. Zhang, Federico Bianchi, Elisabeth Roxane M. Heremans, Eric C. Landsness, Emmanuel Mignot, James Zou

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 研究利用人工智能睡眠联合科学家环境,在约124,000份PSG记录上进行五个案例研究,揭示睡眠与疾病风险、临床分类及自身调节的联系,展示智能体人工智能助力大规模、多模态睡眠生理学发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25339 2026-07-29 cs.IR 新提交 50%

SPARC: Sequence-aware Progressive Attribute Routing and Compression Framework for Generative Recommendation

SPARC:用于生成式推荐的序列感知渐进式属性路由与压缩框架

Chang Liu, Changfa Wu, Hui Qian, Binbin Cao, Jian Wu, Yuliang Yan, Han Zhu, Bo Zheng

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 研究针对生成式推荐中现有离散语义ID问题,提出SPARC框架,通过建模序列依赖、路由多表示到插槽及轻量级交互,在不增输入长度下丰富用户历史表示,实验证明其性能优于基线,改进源于上下文条件信息保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24260 2026-07-28 cs.LG 新提交 50%

KAP: Bridging the Knowledge Selection-Runtime Consumption Gap in LLM Systems

KAP:弥合大语言模型系统中知识选择与运行时消耗的差距

Shuo Wang, Fang Xi, Wenyuan Huang, Qing Wang, Junming Su

机构 * QiYuanLab(启元实验室)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 研究大语言模型系统中知识选择与运行时消耗的差距,提出知识访问规划(KAP)范式,通过建立通用中间表示编译知识信号控制KV访问,以GraphSpec实例化,改变长上下文生成扩展轨迹,提升运行时消耗效率。

Comments 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24232 2026-07-28 cs.IR 新提交 50%

Strategy-Aware Parameter-Efficient Adaptation for LLM-based Auto-Bidding

基于大语言模型的自动出价的策略感知参数高效适配

Songyue Cai, Lianyu Wang, Shan Gu, Ziru Xu, Jian Xu, Xiaofeng Zhu, Bo Zheng

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 研究广告自动出价问题,提出SAGE框架,通过位置增强、文本对齐和约束门控LoRA三个组件,实现参数高效多模态对齐,在大规模基准实验中性能卓越,调整参数少,消融研究验证各组件贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21899 2026-07-27 cs.SD 新提交 50%

CODA: Cascaded Online Discontinuity-Aware Alignment for Real-Time Image-Based Score Following

CODA:用于基于图像的实时乐谱跟随的级联在线不连续感知对齐

Yining Yang, Ruogu Chen, Jie Han

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文针对实时乐谱跟随难题,提出CODA系统。它利用乐谱级联结构增强预测一致性,通过静音驱动中断模式实现不连续恢复。在多模态乐谱数据集钢琴基准测试中,CODA在实时吞吐量下取得了领先的跟踪精度和不连续恢复性能。

Comments 8 pages, 3 figures, accepted by the International Society for Music Information Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21921 2026-07-27 cs.CE math-ph math.MP 新提交 50%

Learning Population-Level Dynamics through a Latent Fokker--Planck Model and Discrepancy Transport Maps

通过潜在福克 - 普朗克模型和差异传输映射学习总体水平动力学

Chengyang Huang, Krishna Garikipati

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 针对科学和工程系统概率分布动力学未知问题,提出总体水平推理框架,通过潜在福克 - 普朗克模型和差异传输映射恢复潜在随机动力学,经正则化联合学习,能准确重建复杂概率演化,为动力学推理提供通用框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20598 2026-07-24 eess.IV 新提交 50%

MedDiT4SR: Tri-Stream Joint Adaptation of Pre-Trained Diffusion Transformers for Medical Image Super-Resolution

MedDiT4SR:用于医学图像超分辨率的预训练扩散Transformer的三流联合自适应

Zhi Chen, Le Zhang

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 研究针对医学图像超分辨率难题,提出MedDiT4SR三流自适应框架,集成多种表示于扩散Transformer块,引入SR Adapter和SA Refiner,实验验证该框架能有效让预训练DiT模型适应不同医学成像域的超分辨率任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12338 2026-07-24 cs.LG 版本更新 50%

Wireless TokenCom: RL-Based Tokenizer Agreement for Multi-User Wireless Token Communications

无线令牌通信:基于强化学习的多用户无线令牌通信中的令牌化协议

Farshad Zeinali, Mahdi Boloursaz Mashhadi, Rahim Tafazolli

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文提出基于强化学习的混合框架,用于多用户无线TokenCom中的令牌化协议,提升语义质量和资源效率,减少视频传输中的冻结事件。

Comments Submitted to IEEE Journal for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19006 2026-07-22 cs.LG q-bio.QM 新提交 50%

Subject-Conditioned Glucose Forecasting in Type-1 Diabetes

1型糖尿病中基于个体条件的血糖预测

Giorgia Rigamonti, Mirko Paolo Barbato, Davide Marelli, Paolo Napoletano

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 研究针对1型糖尿病血糖预测问题,提出多模态深度学习架构SCGP,基于观测数据和个体表征预测血糖,通过分离特征与建模避免早期融合,实验证明其能提高预测性能,利于个性化糖尿病管理。

Comments Accepted at the IEEE EMBC 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28634 2026-07-21 cs.RO 版本更新 50%

PrimitiveVLA: Learning Reusable Motion Primitives for Efficient and Generalizable Robotic Manipulation

PrimitiveVLA:学习可复用的运动基元以实现高效且可泛化的机器人操作

Yutai Li, Shaohui Peng, Jiaming Guo, Di Huang, Zihao Zhang, Yuxuan Guo, Yunkai Gao, Siming Lan, Ling Li, Xing Hu, Yunji Chen

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) Jiangsu Key Laboratory of AI for Industries, Institute of AI for Industries, CAS(江苏人工智能工业重点实验室,人工智能工业研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Cambricon Technologies(寒武科技) Intelligent Software Research Center, Institute of Software, CAS(软件研究所智能软件研究中心,中国科学院) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出PrimitiveVLA框架,通过将视觉-语言-动作模型从直接指令到控制映射转向以基元为中心的拆解与组装范式,利用多模态规范表示和自动化流水线,提升数据效率并实现零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14842 2026-07-17 cs.RO 新提交 50%

KineFuse: Kinematic-Aware Haptic Fusion for In-Hand Occluded-Object Pose Tracking

KineFuse:用于手中遮挡物体姿态跟踪的运动感知触觉融合

Chanyoung Ahn, Jaesung Lee, Sungwoo Park, Donghyun Hwang

机构 * Center for Humanoid Research, KIST(韩国科学技术院人形机器人研究中心) Korea University(韩国大学)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 研究如何利用多手指手上的稀疏触觉信号补充预训练视觉姿态跟踪器以应对遮挡,提出运动感知手指级编码器,经多级别评估对比,验证其能提升跟踪成功率,在下游任务表现更好并提供真实世界演示。

Comments 8 pages, 10 figures. Accepted for presentation at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24395 2026-07-16 cs.LG 版本更新 50%

AvAtar: Learning to Align via Active Optimal Transport

AvAtar: 通过主动最优输运学习对齐

Qi Yu, Ruizhong Qiu, Zhichen Zeng, My T. Thai, Huan Liu, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Florida(佛罗里达大学) Arizona State University(亚利桑那州立大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出AvAtar框架,利用主动学习策略通过熵正则化最优输运的梯度影响量化候选点信息量,并采用伴随状态法高效求解,以提升对齐性能。

Comments Published as a conference paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12281 2026-07-15 cs.IR cs.LG 新提交 50%

SlimPer: Make Personalization Model Slim and Smart

SlimPer:使个性化模型变得精简且智能

Siqi Wang, Xianjie Chen, Shaofeng Deng, Albert Chen, Romil Shah, Jiawei Huang, Zhaoqin Wang, Zhang Zhang, Yiqun Liu, Meilei Jiang, Anish Dubey, Moyan Mei, Tongxin Wang, Nathan Berrebbi, Misael Manjarres, Armand Sauzay, Shardul Kothapalli, Aryaman Vinchhi, Kevin Johnstone, Juheon Lee, Gufan Yin, Ziheng Huang, Justin Lin, Mert Terzihan, Yilin Qi, Cynthia Yang, Colin Peppler, Qi Ding, Ruohan Sun, Ge Song, Litao Deng, Parichay Kapoor, Matt Ma, Huihui Cheng, Jiyuan Zhang, Yanli Zhao, Yiping Han, Fangqiu Han, Ning Yao, Arun Singh, Jordan Edwards, Zhengyu Su, Abhishek Kumar, Guangdeng Liao, Ankit Asthana

机构 * Meta Platforms, Inc.(Meta平台公司)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 研究针对工业推荐系统中Transformer架构的不足,提出SlimPer方法,将个性化排名重构成对紧凑知识库的迭代细化,可解耦模型深度与用户历史长度,统一多种特征并具可解释性,在Instagram相关业务上提升了用户参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08029 2026-07-10 cs.LG 新提交 50%

Rethinking Small VLM Quantization: From Component-Wise Analysis to Hardware-Aware Edge Deployment

重新思考小型视觉语言模型量化:从组件级分析到硬件感知边缘部署

Hyeju Shin, Chorwon Kim, Ryangsoo Kim, Hark Yoo, Jaein Kim

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本文针对小型视觉语言模型量化,提出系统评估框架,在特定硬件上验证五个假设,分离相关组件得出结论,包括量化敏感性受结构范式影响、SigLIP编码器延迟情况、大语言模型INT4量化利弊、复合量化误差特点及不同平台每焦耳智能差异。

Comments 14 pages. Accepted at the ICML 2026 Workshop on Hypothesis Testing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07927 2026-07-10 quant-ph 新提交 50%

Invariance Audits for Quantum Kernels and Variational Rewinding: A Real-to-Hermitian Taxonomy of Projector, Flag, Anchor, and Density Geometry

量子核与变分回绕的不变性审计:投影器、标志、锚和密度几何的实到厄米特分类法

Azadeh Alavi, Fatemeh Kouchmeshki, Hossein Akhoundi

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 研究量子机器学习中向量替换表示的不变性决策,开发实到厄米特分类法,形式化相关核并证明性质,通过多种实验表明量子和几何提升在不变性与任务匹配时有用,丢弃带标签信息时正确失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25998 2026-07-02 cs.CR 新提交 50%

BlowLive: Blow-Based Multi-Factor Biometrics with Liveness Detection and Revocability

BlowLive:基于吹气的多因素生物识别与活体检测及可撤销性

Eyasu Getahun Chekole, Howard Halim, Daniël Reijsbergen, Jianying Zhou

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出BlowLive框架,融合吹气声学信号与面部生物特征,采用模糊提取器生成稳定密钥进行认证,并引入多普勒频移活体检测,实现高精度、强安全与可撤销性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16517 2026-07-01 cs.LG q-bio.QM 新提交 50%

How Post-Training Shapes Biological Reasoning Models

后训练如何塑造生物学推理模型

Lukas Fesser, Hanlin Zhang, Michelle M. Li, Eric Wang, Bryan Perozzi, Shekoofeh Azizi, Sham M. Kakade, Marinka Zitnik

机构 * Harvard University(哈佛大学) Google DeepMind(谷歌DeepMind) Google Research(谷歌研究院)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 研究后训练各阶段(CPT、SFT、RL)对生物学推理模型领域内和领域外性能的影响,发现SFT提升领域内性能但损害泛化,RL可部分恢复泛化,最佳策略是短SFT加长RL。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29948 2026-06-30 cs.RO 50%

Heterogeneous Tactile Transformer

异构触觉Transformer

Jianxin Bi, Qiang Wang, Jayaram Reddy, Kelvin Lin, Soibkhon Khajikhanov, Ruihan Gao, Harold Soh

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 提出异构触觉Transformer(HTT),通过传感器特定编码器和共享Transformer主干学习跨异构传感器的共享触觉表示,利用新HPT数据集预训练,在感知和操作任务中实现可迁移表示。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27984 2026-06-29 cs.LG 新提交 50%

Dual-Learning based Penalized Multi-Align Clustering for Multi-View Incomplete and Disorderly Data

基于对偶学习的惩罚多对齐聚类用于多视图不完整与无序数据

Liang Zhao, Shubin Ma, Bo Xu, Qingchen Zhang

机构 * Dalian University of Technology(大连理工大学) Hainan University(海南大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 针对多模态数据的不完整和时间异步问题,提出基于对偶学习的惩罚多对齐聚类模型(DLPMAC),通过对偶学习保持语义和结构一致性,并利用惩罚机制实现多对多数据对齐,提升对齐精度并避免数据聚合。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27811 2026-06-29 cs.RO 新提交 50%

LXD-SLAM: LiDAR+X Dense SLAM with $\sum_{i=0}^{5}C_5^i$ Configurable Sensor Combinations

LXD-SLAM:基于LiDAR+X的密集SLAM,支持∑_{i=0}^{5}C_5^i种可配置传感器组合

Zhong Wang, Lin Zhang, Linfei Li, Ying Shen, Shaoming Zhang, Pengcheng Shi, Shengjie Zhao

机构 * Tongji University(同济大学) Wuhan University(武汉大学)

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 提出LXD-SLAM,一种以3D LiDAR为中心的多传感器融合框架,支持32种传感器组合,通过统一的迭代误差状态卡尔曼滤波和混合位姿图实现高保真、全局一致的密集建图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19785 2026-06-29 eess.SP 版本更新 50%

Radar and Acoustic Sensor Fusion using a Transformer Encoder for Robust Drone Detection and Classification

基于Transformer编码器的雷达与声学传感器融合用于鲁棒的无人机检测与分类

Gevindu Ganganath, Pasindu Sankalpa, Samal Punsara, Demitha Pasindu, Chamira U. S. Edussooriya, Ranga Rodrigo, Udaya S. K. P. Miriya Thanthrige

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 针对无人机入侵安全问题,提出雷达与声学传感器融合的Transformer编码器方法,利用原始声学信号减少参数,在户外实验中优于现有技术。

Comments Accepted at IEEE 12$^{\text{th}}$~Moratuwa Engineering Research Conference 2026 (MERCon 2026)

Journal ref IEEE 12th Moratuwa Engineering Research Conference 2026 (MERCon 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏