arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

2025-12-25 至 2025-12-25 共收录 2 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 音视频/视觉语言融合 2 篇

2512.21135 2025-12-25 cs.CV cs.AI 57%

TGC-Net: A Structure-Aware and Semantically-Aligned Framework for Text-Guided Medical Image Segmentation

TGC-Net:一种结构感知且语义对齐的文本引导医学图像分割框架

Gaoren Lin, Huangxuan Zhao, Yuan Xiong, Lefei Zhang, Bo Du, Wentao Zhu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Department of Orthopedics, Tongji Hospital, Tongji Medical College, Huazhong University of Science(同济大学同济医学学院骨科部,华中科技大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 TGC-Net通过引入语义-结构协同编码器、域增强文本编码器和视觉-语言校准模块,提升文本引导的医学图像分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20898 2025-12-25 cs.CV cs.AI 57%

DGSAN: Dual-Graph Spatiotemporal Attention Network for Pulmonary Nodule Malignancy Prediction

DGSAN:双图时空注意力网络用于肺结节恶性预测

Xiao Yu, Zhaojie Fang, Guanyu Zhou, Yin Shen, Huoling Luo, Ye Li, Ahmed Elazab, Xiang Wan, Ruiquan Ge, Changmiao Wang

专题命中 音视频/视觉语言融合 :information fusion(abstract);分类 cs.CV

AI总结 DGSAN通过双图时空注意力网络融合多模态数据,提升肺结节恶性预测的准确性和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏