arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 228 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 228 篇

2607.00573 2026-07-21 cs.CV 版本更新 57%

BrainFIBRE: A Foundation Model via Information Decomposition for Brain Microstructure

BrainFIBRE:基于信息分解的脑微结构基础模型

Zijian Dong, Yi Lin, Fang Ji, Jianxiong Zhou, Kwun Kei Ng, Juan Helen Zhou

机构 * National University of Singapore(新加坡国立大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出BrainFIBRE,首个脑微结构基础模型,通过自监督部分信息分解(SPID)和反事实候选构建(CCC)从NODDI图谱中解缠独特、协同和冗余信息,在多种预测任务上达到最优性能。

Comments ECCV 2026. Author name corrected in V2

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03614 2026-07-21 cs.LG cs.AI 版本更新 57%

Neural Global Optimization via Iterative Refinement from Noisy Samples

通过噪声样本迭代细化的神经全局优化

Qusay Muzaffar, David Levin, Michael Werman

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Tel Aviv University(特拉维夫大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出一种神经方法,通过迭代细化从噪声样本中寻找全局极小值,实验表明其在多模态测试函数上比传统方法有显著提升。

Comments 17 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19504 2026-07-21 cs.CV 版本更新 57%

FusionNet: Physics-Aware Representation Learning for Multi-Spectral and Thermal Data via Trainable Signal-Processing Priors

FusionNet:通过可训练信号处理先验对多光谱和热数据进行物理感知表示学习

Georgios Voulgaris

机构 * University of Oxford(牛津大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 研究针对水泥生产设施监测难题,提出FusionNet框架,通过整合多光谱数据,嵌入信号处理先验,经消融研究等实验验证,该框架能结合物理感知特征选择与深度学习架构,高精度检测水泥生产设施,为工业监测提供可靠框架。

Comments Accepted for publication in the IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing (JSTARS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03826 2026-07-21 q-bio.QM cs.AI 版本更新 57%

CORE -- A Cell-Level Coarse-to-Fine Image Registration Engine for Multi-stain Image Alignment

CORE——用于多染色图像对齐的细胞级粗到细图像配准引擎

Esha Sadia Nasir, Behnaz Elhaminia, Mark Eastwood, Catherine King, Owen Cain, Lorraine Harper, Paul Moss, Dimitrios Chanouzas, David Snead, Nasir Rajpoot, Adam Shephard, Shan E Ahmed Raza

机构 * Tissue Image Analytics (TIA) Centre, Department of Computer Science, University of Warwick, UK(tissue image analytics (TIA) 中心,计算机科学系,沃里克大学,英国) Department of Immunology and Immunotherapy, College of Medicine and Health, University of Birmingham, UK(免疫学与免疫治疗系,医学院与健康学院,伯明翰大学,英国) Department of Cellular Pathology, Queen Elizabeth Hospital Birmingham, UK(细胞病理学系,伯明翰女王医院,英国) Renal Unit, Queen Elizabeth Hospital Birmingham, University Hospitals Birmingham NHS Foundation Trust, UK(肾病科,伯明翰女王医院,伯明翰大学医院 NHS 基础信托,英国) Department of Applied Health Sciences, College of Medicine and Health, University of Birmingham, UK(应用健康科学系,医学院与健康学院,伯明翰大学,英国) Histofy Ltd, Coventry, UK(Histofy 有限公司,考文垂,英国)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 针对多染色组织切片细胞核水平分析,提出CORE粗到细框架,粗配准利用组织掩码提取等,细粒度用形状感知模型,细胞水平用CPD估计位移场,经多数据集评估,CORE在多方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26743 2026-07-20 cs.CV 版本更新 57%

Depth-Semantic Alignment and Affinity-Guided Fusion for Structured Radar Point Cloud Generation

深度语义对齐与亲和力引导融合的结构化雷达点云生成

Amjad Hussain, Wenjie Liu, Yuchen Tan, Fuyuan Ai, Zecheng Li, Chunyi Song, Xin Qiu

机构 * Zhejiang University(浙江大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 针对毫米波雷达点云稀疏、噪声大、结构不完整的问题,提出基于视觉-雷达融合的多模态点云生成方法,利用图像语义约束和稀疏补全策略提升点云质量,并在检测跟踪任务中验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06479 2026-07-20 cs.RO cs.CV cs.SY eess.SY 版本更新 57%

Holistic Fusion: Task- and Setup-Agnostic Robot Localization and State Estimation with Factor Graphs

整体融合:基于因子图的与任务和设置无关的机器人定位与状态估计

Julian Nubert, Turcan Tuna, Jonas Frey, Cesar Cadena, Katherine J. Kuchenbecker, Shehryar Khattak, Marco Hutter

机构 * ETH Zürich(苏黎世联邦理工学院) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) NASA Jet Propulsion Laboratory(美国国家航空航天局喷气推进实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 研究针对移动机器人定位与状态估计问题,提出整体融合方法,通过因子图公式融合多类型测量,注重局部平滑性与一致性,能在典型硬件上实现低延迟、平滑在线估计及低漂移全局定位,在多场景验证了框架有效性。

Comments 21 pages, 25 figures, 9 tables, Transactions on Robotics, accepted

Journal ref Transactions on Robotics 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13800 2026-07-17 eess.IV cs.CV 版本更新 57%

Prospective clinical indication, post-hoc report leakage, and fusion design in multi-image chest radiograph classification: a patient-clustered evaluation

多图像胸部X光片分类中的前瞻性临床指征、事后报告泄露和融合设计:患者聚类评估

Kamran Shahid, Muhammad Munwar Iqbal

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 研究多图像胸部X光片分类,用多种模型比较,含仅图像、仅指征等。评估不同模型在多指标下表现,发现前瞻性指征与报告目标关联大,排列感知融合有竞争力,事后报告文本存在问题,如造成报告标签循环等。

Comments 12 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09118 2026-07-17 cs.CV 版本更新 57%

LPCAN: Lightweight Pyramid Cross-Attention Network for Rail Surface Defect Detection Using RGB-D Data

LPCAN:用于使用RGB-D数据进行铁路表面缺陷检测的轻量级金字塔交叉注意力网络

Jackie Alex, Guoqiang Huan

机构 * St. Petersburg College(斯波伯学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 针对铁路表面缺陷检测方法局限,提出LPCANet,利用RGB-D数据,集成MobileNetv2等模块,经多模态融合与结构分析提升性能。在多数据集上评估效果显著,消融研究验证关键模块作用,为工业缺陷检测提供实用框架,未来将聚焦模型压缩。

Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12503 2026-07-16 cs.CV 版本更新 57%

DynTrace: Tracking Dynamic Object Evidence for 4D Spatio-Temporal Reasoning in MLLMs

DynTrace:用于多模态大语言模型中4D时空推理的动态对象证据跟踪

Rongxin Gao, Yuzhi Huang, Dongxuan Liu, Chu Li, Zhenye Wang, Jie Wu, Shuzhao Xie, Jingyan Jiang, Xinghao Ding, Xiaotong Tu, Yue Huang

机构 * Xiamen University(厦门大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) China University of Mining and Technology(中国矿业大学) Shenzhen Technology University(深圳技术大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 研究针对多模态大语言模型在连续动态场景感知中跟踪动态对象证据的局限,提出DynTrace框架,含DTV和DT-Token两个互补组件,能为模型提供基于几何视觉先验和结构化时空轨迹的动态对象证据,在多个基准测试中达先进水平。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05623 2026-07-16 cs.CL 版本更新 57%

NAVER LABS System Re-implementation for the IWSLT 2026 Instruction-Following Task

用于IWSLT 2026指令跟随任务的NAVER LABS系统重新实现

Anand Kamble, Aniket Tathe

机构 * NAVER LABS(NAVER实验室) Florida State University(佛罗里达州立大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 该研究为IWSLT 2026共享任务重新实现NAVER LABS系统,采用规定组件,保留三阶段方法,构建合成示例用于微调,其主要模型在EN-ZH语音翻译和英语SQA任务中取得了一定成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19873 2026-07-07 cs.CV 版本更新 57%

SIMPLER: Efficient Foundation Model Adaptation via Similarity-Guided Layer Pruning for Earth Observation

SIMPLER:通过相似性引导的层剪枝实现高效的地球观测基础模型适应

Víctor Barreiro, Johannes Jakubik, Francisco Argüello, Dora B. Heras

机构 * Centro Singular de Investigación en Tecnoloxías Intelixentes (CiTIUS), Universidade de Santiago de Compostela, Spain(智能技术研究中心(CiTIUS),圣地亚哥-德孔波斯特拉大学,西班牙) Departmento de Electrónica e Computación, Universidade de Santiago de Compostela, Spain(电子与计算系,圣地亚哥-德孔波斯特拉大学,西班牙) IBM Research Europe, Zurich, Switzerland(IBM欧洲研究院,瑞士苏黎世)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 SIMPLER通过在适应前选择有效的模型深度,减少推理和部署成本,同时在无需梯度、幅度启发式或超参数调优的情况下,通过预训练视觉变换器中更深层的表示稳定性,选择冗余层,实现参数减少79%且性能保留94%,提升训练和推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06205 2026-07-07 cs.LG cs.AI 版本更新 57%

Multi-Way Representation Alignment

多向表示对齐

Akshit Achara, Tatiana Gaintseva, Mateo Mahaut, Pritish Chakraborty, Viktor Stenby Johansson, Melih Barsbey, Emanuele Rodolà, Donato Crisostomi

专题命中 多模态训练与对齐 :any-to-any(abstract);分类 cs.AI

AI总结 研究M≥3模型的表示对齐,用广义普罗克汝斯忒斯分析构建共享正交空间,指出严格等距对齐对检索非最优,提出几何校正普罗克汝斯忒斯对齐,实验表明其提升任意到任意检索并保留实用共享参考空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18176 2026-07-07 cs.CV 版本更新 57%

Atlas is Your Perfect Context: One-Shot Customization for Generalizable Foundational Medical Image Segmentation

图谱是理想上下文:用于可泛化基础医学图像分割的一次性定制

Ziyu Zhang, Yi Yu, Simeng Zhu, Ahmed Aly, Yunhe Gao, Ning Gu, Yuan Xue

机构 * Nanjing University(南京大学) The Ohio State University(俄亥俄州立大学) Stanford University(斯坦福大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 研究医学图像中解剖结构分割问题,提出图谱引导框架AtlasSegFM,通过图谱查询配准生成提示,用冻结基础模型细化分割,经自适应融合模块结合图谱先验与模型输入及预测,实现一次性定制。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24342 2026-07-07 cs.AI 版本更新 57%

A Unified Geometric Space for Topological Alignment Between Transformer-Based Models and Human Brain Networks

基于Transformer的模型与人脑网络之间拓扑对齐的统一几何空间

Silin Chen, Yuzhong Chen, Caiwei Wang, Zifan Wang, Junhao Wang, Zifeng Jia, Keith M Kendrick, Tuo Zhang, Lin Zhao, Dezhong Yao, Tianming Liu, Xi Jiang

机构 * The Clinical Hospital of Chengdu Brain Science Institute, MOE-K Lab for NeuroInformation, Brain‑Apparatus Communication Institute, School of Life Science and Technology, University of Electronic Science and Technology of China(成都脑科学研究院临床医院,MOE-K神经信息实验室,脑-装置通信研究所,电子科技大学生命科学与技术学院) School of Automation, Northwestern Polytechnical University(西北工业大学自动化学院) Department of Biomedical Engineering, New Jersey Institute of Technology(新泽西理工学院生物医学工程系) School of Computing, University of Georgia(佐治亚大学计算机学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.AI

AI总结 提出一个模态无关、任务无关的拓扑对齐空间,通过图组织属性将Transformer模型的注意力拓扑映射到人脑固有连接网络,揭示了不同模态和规模模型的连续弧形分布及对齐特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15061 2026-07-07 cs.RO cs.CV 版本更新 57%

Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue

Ask-to-Clarify: 通过多轮对话解决指令歧义

Xingyao Lin, Xinghao Zhu, Tianyi Lu, Guojin Zhong, Sicheng Xie, Hui Zhang, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

机构 * College of Computer Science and Artificial Intelligence, Fudan University, Shanghai, China(复旦大学计算机科学与人工智能学院) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Mechanical Systems Control Lab, UC Berkeley, California, USA(伯克利机械系统控制实验室)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出Ask-to-Clarify框架,通过多轮对话解决指令歧义问题,结合视觉语言模型和扩散模型,采用两阶段知识绝缘策略训练,实现多任务中更高效的协作式具身代理。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.15277 2026-07-07 cs.CV 版本更新 57%

EPMF: Efficient Perception-aware Multi-sensor Fusion for 3D Semantic Segmentation

EPMF: 高效感知感知多传感器融合用于3D语义分割

Mingkui Tan, Zhuangwei Zhuang, Sitao Chen, Rong Li, Kui Jia, Qicheng Wang, Yuanqing Li

机构 * School of Software Engineering, South China University of Technology(南方科技大学软件工程学院) Pazhou Laboratory, Guangzhou, China(广州帕佐实验室) School of Electronic and Information Engineering, South China University of Technology(南方科技大学电子与信息工程学院) Minieye, Shenzhen, Guangdong, China(深圳Minieye公司)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 提出一种高效感知多传感器融合方法EPMF,通过透视投影对齐点云与RGB图像,利用残差融合模块和感知损失提升3D语义分割性能,在nuScenes上mIoU超越RangeFormer 0.9%。

Comments 16 pages, 12 figures, 14 tables, IEEE TPAMI 2024, extended version of the ICCV2021 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30217 2026-07-03 cs.CL 版本更新 57%

Before Thinking, Learn to Decide: Proactive Routing for Efficient Visual Reasoning

在思考之前,先学会决策:面向高效视觉推理的主动路由

Yinan Zhou, Haokun Lin, Yichen Wu, Yuxin Chen, Teng Wang, Caifeng Shan, Zhenan Sun, Chen Ma, Li Zhu, Ying Shan

机构 * Xi’an Jiaotong University(西安交通大学) ARC Lab, Tencent IEG(腾讯IEG ARC实验室) City University of Hong Kong(香港城市大学) Institute of Automation, CAS(中国科学院自动化研究所) Harvard University(哈佛大学) Nanjing University(南京大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 提出主动路由范式PRP,通过联合评估草稿模型和目标模型的能力,实现早期决策,加速多模态推理而不牺牲性能。

Comments 36 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10710 2026-07-03 cs.CV 版本更新 57%

From One-to-One to Many-to-Many: Dynamic Cross-Layer Injection for Deep Vision-Language Fusion

从一对一到多对多:面向深度视觉-语言融合的动态跨层注入

Cheng Chen, Yuyu Guo, Pengpeng Zeng, Jingkuan Song, Peng Di, Hang Yu, Lianli Gao

机构 * Tongji University(同济大学) Ant Group(蚂蚁集团) Shanghai Innovation Institute(上海创新研究院) Independent Researcher(独立研究者)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出跨层注入框架,通过自适应多投影模块和自适应门控融合机制实现视觉层与LLM的动态多对多连接,显著提升多模态理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00654 2026-07-02 cs.CV 版本更新 57%

RC-GeoCP: Geometric Consensus for Radar-Camera Collaborative Perception

RC-GeoCP:雷达-相机协同感知的几何一致性

Xiaokai Bai, Lianqing Zheng, Runwei Guan, Siyuan Cao, Songkai Wang, Huiliang Shen

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) School of Automotive Studies, Tongji University(同济大学汽车学院) Thrust of Artificial Intelligence, Hong Kong University of Science and Technology(香港科技大学人工智能研究所)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 提出首个4D雷达与相机协同感知框架RC-GeoCP,通过雷达锚定几何一致性解决深度模糊和空间分散导致的错位,实现高效通信与全局一致表示。

Comments 11 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23951 2026-06-29 cs.CV 版本更新 57%

HunyuanImage 3.0 Technical Report

HunyuanImage 3.0 技术报告

Tencent Hunyuan Foundation Model Team

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 HunyuanImage 3.0是一种统一多模态理解与生成的自回归模型,通过精心数据整理、先进架构、原生思维链、渐进预训练和激进后训练,训练出超800亿参数MoE模型(推理时激活130亿),在文本-图像对齐和视觉质量上媲美最先进模型,并开源代码和权重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17621 2026-06-26 cs.CV 版本更新 57%

PathFLIP: Fine-grained Language-Image Pretraining for Versatile Computational Pathology

PathFLIP:面向多功能计算病理学的细粒度语言-图像预训练

Fengchun Liu, Songhan Jiang, Linghan Cai, Ziyue Wang, Yongbing Zhang

机构 * Harbin Institute of Technology, Shenzhen, School of Computer Science and Technology(哈尔滨工业大学(深圳)计算机科学与技术学院) National University of Singapore, Department of Electronic and Computer Engineering(新加坡国立大学电子与计算机工程系)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出PathFLIP框架,通过将幻灯片级描述分解为区域级子描述并生成文本条件区域嵌入,实现细粒度视觉-语言对齐,在多个基准上优于现有模型且训练数据更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02877 2026-06-16 cs.CV 版本更新 57%

Pathway-Structured Privileged Distillation for Deployable Computational Pathology

面向可部署计算病理学的通路结构特权蒸馏

Yongxin Guo, Hao Lu, Onur Koyun, Muhammet Demir, Metin Gurcan

机构 * School of Medicine, Wake Forest University(威克森林大学医学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出MoPE框架,通过通路索引病理专家和记忆使用对齐,将多模态学习转化为仅组织学推理的特权蒸馏,提升全切片图像推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18227 2026-06-16 cs.LG cs.AI 版本更新 57%

Token Reduction Should Go Beyond Efficiency in Generative Models -- From Vision, Language to Multimodality

Token缩减应超越生成模型中的效率——从视觉、语言到多模态

Zhenglun Kong, Yize Li, Fanhu Zeng, Lei Xin, Shvat Messica, Xue Lin, Pu Zhao, Manolis Kellis, Hao Tang, Marinka Zitnik

机构 * Harvard University(哈佛大学) Northeastern University(东北大学) CAS(中国科学院) Wuhan University(武汉大学) MIT(麻省理工学院) Peking University(北京大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出Token缩减应超越传统效率优化,成为生成模型的基础原则,通过减少冗余token来促进多模态融合、缓解幻觉、维持长输入连贯性并提升训练稳定性。

Comments Project page: https://github.com/ZLKong/Awesome-Collection-Token-Reduction

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21335 2026-06-15 cs.LG cs.CL 版本更新 57%

Sub-Token Routing for KV Cache Compression

子令牌路由用于KV缓存压缩

Wei Jiang, Wei Wang

机构 * Futurewei Technologies(未来智科)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 提出子令牌路由方法,在保留令牌内对值向量分组并选择性保留,与令牌级压缩互补,在LLM和VLM中提升压缩性能。

Comments 17 pages, 8 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03296 2026-06-11 cs.RO cs.AI cs.LG 版本更新 57%

The Unreasonable Effectiveness of Discrete-Time Gaussian Process Mixtures for Robot Policy Learning

离散时间高斯过程混合在机器人策略学习中的惊人有效性

Jan Ole von Hartz, Adrian Röfer, Joschka Boedecker, Abhinav Valada

机构 * Department of Computer Science, University of Freiburg, Germany(弗赖堡大学计算机科学系)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 提出MiDiGap方法,利用少量演示和相机观测,通过离散时间高斯过程混合实现机器人操作策略的灵活表示与模仿学习,在长时域、高约束、动态和多模态任务上取得SOTA性能,并支持推理时引导。

Comments Submitted for publication to IEEE Transaction on Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00809 2026-06-10 cs.CV 版本更新 57%

Let ViT Speak: Generative Language-Image Pre-training

让ViT说话:生成式语言-图像预训练

Yan Fang, Mengcheng Lan, Zilong Huang, Weixian Lei, Yunqing Zhao, Yujie Zhong, Yingchen Yu, Qi She, Yao Zhao, Yunchao Wei

机构 * Beijing Jiaotong University(北京交通大学) ByteDance(字节跳动) Nanyang Technological University(南洋理工大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出GenLIP框架,通过语言建模目标直接训练ViT从视觉token预测语言token,无需对比学习或额外文本解码器,实现简单、可扩展且性能优异的视觉编码器。

Comments 27 pages, 11 figures. Code and models are available at https://github.com/YanFangCS/GenLIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11212 2026-06-09 cs.CL 版本更新 57%

ReVision: Scaling Computer-Use Agents via Temporal Visual Redundancy Reduction

ReVision:通过时间视觉冗余减少扩展计算机使用代理

Amirhossein Abaskohi, Yuhang He, Peter West, Giuseppe Carenini, Pranit Chawla, Vibhav Vineet

机构 * University of British Columbia(不列颠哥伦比亚大学) Microsoft Research(微软研究院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 ReVision通过去除冗余视觉片段,减少token使用并提升成功率,使代理能处理更长轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24388 2026-06-09 cs.CV 版本更新 57%

Causal Transfer in Medical Image Analysis

医学图像分析中的因果迁移

Mohammed M. Abdelsamea, Daniel Tweneboah Anyimadu, Tasneem Selim, Saif Alzubi, Lei Zhang, Ahmed Karam Eldaly, Xujiong Ye

机构 * University of Waterloo(滑铁卢大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文探讨了医学图像分析中因果迁移方法,整合因果推理与跨域表示学习,以解决领域偏移问题,提升临床AI的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01613 2026-06-09 cs.CV 版本更新 57%

Uncertainty-Aware Hierarchical Re-Localization in OpenStreetMap via Semantic Alignment

基于语义对齐的OpenStreetMap中不确定性感知分层重定位

Yuchen Zou, Xiao Hu, Lihuang Fang, Yuqing Tang

机构 * International Digital Economy Academy(国际数字经济学院) School of Automation Science and Engineering, Xi’an Jiaotong University(西安交通大学自动化科学与工程学院) Department of Electronic and Electrical Engineering, Southern University of Science and Technology(南方科技大学电子与电气工程系)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 提出不确定性感知分层搜索框架,利用目标级DINO-ViT令牌减少跨模态差异,通过粗FFT相关和不确定性控制的局部细化实现高效定位,在精度和速度上显著优于现有方法。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12171 2026-06-09 cs.AI 版本更新 57%

MatSciBench: Benchmarking the Reasoning Ability of Large Language Models in Materials Science

MatSciBench: 基准测试大型语言模型在材料科学中的推理能力

Junkai Zhang, Jingru Gan, Xiaoxuan Wang, Zian Jia, Changquan Gu, Jianpeng Chen, Yanqiao Zhu, Mingyu Derek Ma, Dawei Zhou, Ling Li, Wei Wang

机构 * University of California, Los Angeles Computer Science Department(加州大学洛杉矶分校计算机科学系) University of Pennsylvania Department of Materials Science and Engineering(宾夕法尼亚大学材料科学与工程系) Virginia Tech Department of Computer Science(弗吉尼亚理工大学计算机科学系)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 提出MatSciBench基准,包含1340道大学级材料科学问题,覆盖6个主领域和31个子领域,评估LLM推理能力,发现当前模型在领域知识、计算和图表理解方面存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏