arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 6903 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 6903 篇

2605.08814 2026-05-12 cs.CV 57%

Zero-Shot Chinese Character Recognition via Global-Local Dual-Branch Alignment and Hierarchical Inference

通过全局-局部双分支对齐和分层推理实现零样本中文字符识别

Wei Cao, Hao Xu, Xiaolei Diao

机构 * Jilin University, China(吉林大学,中国) University College London, UK(伦敦大学学院,英国)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出GL-HPN网络,通过统一的跨模态对齐框架学习字符图像和意象描述序列的全局和局部表示,解决零样本中文字符识别中的局部差异建模和大规模检索成本问题。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07781 2026-05-11 cs.CV 57%

Differentiable Ray Tracing with Gaussians for Unified Radio Propagation Simulation and View Synthesis

基于高斯的可微射线追踪用于统一的无线传播模拟与视图合成

Niklas Vaara, Lam Huynh, Pekka Sangi, Miguel Bordallo López, Janne Heikkilä

机构 * Center for Machine Vision and Signal Analysis, University of Oulu, Finland(奥卢大学机器视觉与信号分析中心,芬兰) CubiCasa Oy, Finland(芬兰CubiCasa公司)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种基于高斯的可微射线追踪框架,实现无线传播模拟与视图合成的统一空间表示,通过可视化重建神经场景直接计算点对点路径,保留高质量视觉渲染。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07748 2026-05-11 cs.CL 57%

TextLDM: Language Modeling with Continuous Latent Diffusion

TextLDM:基于连续潜在扩散的语言建模

Jiaxiu Jiang, Jingjing Ren, Wenbo Li, Bo Wang, Haoze Sun, Yijun Yang, Jianhui Liu, Yanbing Zhang, Shenghe Zheng, Yuan Zhang, Haoyang Huang, Nan Duan, Wangmeng Zuo

机构 * Joy Future Academy(京东探索研究院) HIT(Harbin Institute of Technology) HKUST(GZ)(Hong Kong University of Science and Technology (Guangzhou))

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 TextLDM将视觉潜在扩散框架应用于文本生成,通过Representation Alignment提升文本表示质量,在OpenWebText2上训练后优于现有扩散语言模型,匹配GPT-2性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14998 2026-05-11 cs.CV 57%

Tables Guide Vision: Learning to See the Heart through Tabular Data

表格引导视觉:通过表格数据学习看见心脏

Marta Hasny, Maxime Di Folco, Keno Bressem, Julia Schnabel

机构 * School of Computation, Information and Technology, Technical University of Munich(技术大学慕尼黑计算、信息与技术学院) Institute of Machine Learning in Biomedical Imaging, Helmholtz Munich(生物医学成像中的机器学习研究所,海德堡慕尼黑) School of Biomedical Engineering and Imaging Sciences, King’s College London(国王学院伦敦生物医学工程与成像科学学院) TUM University Hospital, Technical University of Munich(技术大学慕尼黑大学医院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于表格数据的对比学习框架,利用临床相关表格数据识别患者层面相似性,构建更有意义的配对,提升语义对齐的表示学习,并通过零样本预测验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01746 2026-05-08 cs.CV 57%

Point-SRA: Self-Representation Alignment for 3D Representation Learning

点-SRA:用于3D表示学习的自表示对齐

Lintong Wei, Jian Lu, Haozhe Cheng, Jihua Zhu, Kaibing Zhang

机构 * School of Electronics and Information, Xi’an Polytechnic University(西安理工大学电子与信息学院) School of Software, Xi’an Jiaotong University(西安交通大学软件学院) School of Computer Science, Xi’an Polytechnic University(西安理工大学计算机科学学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 Point-SRA通过自蒸馏和概率建模对齐表示,改进3D表示学习,通过不同掩码比例和MeanFlow Transformer实现互补信息提取,优于Point-MAE并在多个任务中取得优异性能。

Comments This is an AAAI 2026 accepted paper titled "Point-SRA: Self-Representation Alignment for 3D Representation Learning", spanning 13 pages in total. The submission includes 7 figures (fig1 to fig7) that visually support the technical analysis

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 2026, Vol. 40, No. 13

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01365 2026-05-05 cs.CV cs.RO 57%

VoxAfford: Multi-Scale Voxel-Token Fusion for Open-Vocabulary 3D Affordance Detection

VoxAfford:多尺度体素-标记融合用于开放词汇3D affordance检测

Haowen Sun, Shaolong Zhang, Mingyang Li, Chengzhong Ma, Xinzhe Chen, Qiongjie Cui, Xingyu Chen, Zeyang Liu, Xuguang Lan

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家级实验室,人工智能与机器人研究所,西安交通大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出VoxAfford,通过多尺度几何特征增强输出标记,提升3D affordance检测的定位精度,实验显示mIoU提升8%,并验证了零样本迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01100 2026-05-05 cs.AI 57%

A Knowledge-Driven LLM-Based Decision-Support System for Explainable Defect Analysis and Mitigation Guidance in Laser Powder Bed Fusion

基于知识的LLM决策支持系统:用于激光粉末床融合的可解释缺陷分析与缓解指导

Basit Mahmud Shahriar, Md Habibor Rahman

机构 * Department of Mechanical Engineering, University of Massachusetts Dartmouth(达特茅斯大学机械工程系)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种整合结构化缺陷知识与LLM推理的知识驱动决策支持系统,用于制造业中激光粉末床融合的可解释缺陷诊断与缓解指导。系统基于包含27种已知缺陷类型的知识库,支持模糊自然语言查询、文献支持的缺陷解释及基于编码工艺知识的缺陷原因和缓解策略指导。

Comments 28 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27437 2026-05-05 cs.CV 57%

SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning

SpatialStack:用于3D VLM空间推理的分层几何-语言融合

Jian Zhang, Shijie Zhou, Bangya Liu, Achuta Kadambi, Zhiwen Fan

机构 * XMU(厦门大学) UCLA(美国大学) Google(谷歌) UW-Madison(威斯康星大学麦迪逊分校) TAMU(德克萨斯农工大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SpatialStack框架,通过分层融合视觉、几何和语言表征,提升3D空间推理能力,实验表明其在多个基准上表现优异。

Comments CVPR 2026, Project Website: https://spatial-stack.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27105 2026-05-01 cs.CV 57%

Automated Detection of Mutual Gaze and Joint Attention in Dual-Camera Settings via Dual-Stream Transformers

通过双流Transformer实现双摄像头设置中互视与联合注意的自动检测

Jakub Kosmydel, Paweł Gajewski, Arkadiusz Białek

机构 * AGH University(AGH大学) Jagiellonian University(雅盖隆大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出双流Transformer架构,用于从同步双摄像头记录中自动检测互视与联合注意,通过冻结的注视感知骨干网络和自定义令牌融合机制,有效提升了多摄像头实验室环境下的检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14845 2026-04-30 cs.LG cs.AI 57%

Integrating Weather Foundation Model and Satellite to Enable Fine-Grained Solar Irradiance Forecasting

融合天气基础模型与卫星实现精细化太阳能辐照度预报

Ziqing Ma, Kai Ying, Xinyue Gu, Tian Zhou, Tianyu Zhu, Haifan Zhang, Peisong Niu, Zheng Wang, Cong Bai, Liang Sun

机构 * DAMO Academy, Alibaba Group(阿里集团达摩院) College of Computer Science, Zhejiang University of Technology(浙江工业大学计算机学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出Baguan-solar框架,融合全球天气基础模型与高分辨率静止卫星图像,实现千米级24小时辐照度预报,优于现有基准模型,降低RMSE 16.08%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01070 2026-04-29 cs.CL 57%

How RL Unlocks the Aha Moment in Geometric Interleaved Reasoning

如何通过强化学习解锁几何交错推理中的顿悟时刻

Xiangxiang Zhang, Caijun Jia, Siyuan Li, Dingyu He, Xiya Xiong, Zheng Sun, Honghao He, Yuchen Wu, Bihui Yu, Linzhuang Sun, Cheng Tan, Jingxuan Wei

机构 * ByteDance(字节跳动) Shenyang Institute of Computing Technology, Chinese Academy of Sciences(沈阳计算技术研究所,中国科学院) Westlake University(西交大学) University of Chinese Academy of Science(中国科学院大学) Key Laboratory of Computing Power Network and Information Security, Ministry of Education(教育部计算能力网络与信息安全重点实验室) Shandong Computer Science Center (National Supercomputer Center in Jinan)(山东省计算机科学中心(济南国家超算中心)) Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东省科学院))

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 本文探讨了在几何交错推理中,通过强化学习框架Faire克服传统监督微调的局限性,实现更深层次的因果对齐,从而提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.11544 2026-04-29 cs.RO cs.AI 57%

Visuo-Haptic Object Perception for Robots: An Overview

机器人视觉-触觉物体感知综述

Nicolás Navarro-Guerrero, Sibel Toprak, Josip Josifovski, Lorenzo Jamone

机构 * Advanced Robotics at Queen Mary (ARQ), School of Engineering and Materials Science, Queen Mary University of London(伦敦女王大学工程与材料科学学院先进机器人研究中心)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文综述了机器人视觉-触觉物体感知的现状,探讨了生物基础、传感技术、计算方法及未来研究方向,强调多模态学习的挑战与应用进展。

Comments published in Autonomous Robots

Journal ref Autonomous Robots, 27 (2023) https://link.springer.com/article/10.1007/s10514-023-10091-y

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24543 2026-04-28 cs.CV 57%

RACANet: Reliability-Aware Crowd Anchor Network for RGB-T Crowd Counting

RACANet:面向RGB-T人群计数的可靠性感知人群锚网络

Jinghao Shi, Mengqi Lei, Kunliang He, Yun Li, Wei Bao, Siqi Li

机构 * School of Computer Science, China University of Geosciences, Wuhan(中国地质大学(武汉)计算机科学学院) School of Software, Tsinghua University(清华大学软件学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出RACANet,通过两阶段融合框架解决RGB-T人群计数中跨模态融合的可靠性建模问题,引入轻量级预训练和局部锚点融合模块,提升计数精度与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24380 2026-04-28 cs.CL 57%

Structural Pruning of Large Vision Language Models: A Comprehensive Study on Pruning Dynamics, Recovery, and Data Efficiency

大型视觉语言模型的结构剪枝:对剪枝动态、恢复和数据效率的全面研究

Yiran Huang, Lukas Thede, Massimiliano Mancini, Wenjia Xu, Zeynep Akata

机构 * Technical University of Munich, Germany(慕尼黑技术大学,德国) Munich Center for Machine Learning, Germany(慕尼黑机器学习中心,德国) Helmholtz Munich, Germany(海德堡-慕尼黑赫尔姆霍尔茨研究中心,德国) University of Tübingen, Tübingen AI Center, Germany(图宾根大学,图宾根人工智能中心,德国) University of Trento, Italy(特伦托大学,意大利) Beijing University of Posts and Telecommunications, China(北京邮电大学,中国)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 本文研究了通过结构化剪枝压缩现有大型视觉语言模型的方法,发现宽度剪枝在低资源环境下表现更优,结合监督微调和隐藏状态蒸馏可实现高效恢复,仅需5%的数据即可保持95%性能。

Comments Accepted at International Journal of Computer Vision (IJCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10334 2026-04-28 cs.CV 57%

SIMPLER: H&E-Informed Representation Learning for Structured Illumination Microscopy

SIMPLER: 基于H&E的结构光照明显微镜表示学习

Abu Zahid Bin Aziz, Syed Fahim Ahmed, Gnanesh Rasineni, Mei Wang, Olcaytu Hatipoglu, Marisa Ricci, Malaiyah Shaw, Guang Li, J. Quincy Brown, Valerio Pascucci, Shireen Elhabian

机构 * Kahlert School of Computing, University of Utah, Salt Lake City, UT 84112, USA Scientific Computing \& Imaging Institute, University of Utah, Salt Lake City, UT 84112, USA Instapath Inc., Houston, TX 77021 Tulane University, Department of Biomedical Engineering, New Orleans, Louisiana, United States

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出SIMPLER框架,利用H&E作为语义锚点学习可重用的SIM表示,通过对抗、对比和重建目标逐步对齐SIM和H&E,提升跨模态任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23977 2026-04-28 cs.CV 57%

Multi-View Synergistic Learning with Vision-Language Adaption for Low-Resource Biomedical Image Classification

多视图协同学习与视觉-语言适应用于低资源生物医学图像分类

Xiaoliu Luo, Minxue Xiao, Ting Xie, Mengzhu Wang, Huiqing Qi, Joey Tianyi Zhou, Taiping Zhang, Xu Wang

机构 * Chongqing University of Technology(重庆理工大学) Collge of Computer Science, Sichuan University(四川大学计算机学院) Hebei University of Technology(河北工业大学) Nanyang Technological University(南洋理工大学) Centre for Frontier AI Research, Agency for Science, Technology and Research, Singapore(新加坡科技研究局前沿人工智能研究中心)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出多视图协同学习框架,通过视觉-语言适应提升低资源下生物医学图像分类性能,采用多粒度对比学习和结构监督增强跨模态对齐与细粒度区分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23467 2026-04-28 cs.LG cs.AI cs.AR 57%

Hybrid JIT-CUDA Graph Optimization for Low-Latency Large Language Model Inference

混合JIT-CUDA图优化用于低延迟大语言模型推理

Divakar Kumar Yadav, Tian Zhao

机构 * Department of Computer Science(计算机科学系) University of Wisconsin-Milwaukee(威斯康星大学密尔沃基分校) Milwaukee, WI, USA(美国威斯康星州密尔沃基)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种混合运行时框架,结合JIT编译与CUDA图执行,以降低启动开销并保持自回归解码的运行时灵活性,通过静态组件和动态组件的分离,有效减少短序列LLM推理的延迟和方差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23125 2026-04-28 cs.CV cs.LG 57%

Learning from Imperfect Text Guidance: Robust Long-Tail Visual Recognition with High-Noise Label

从不完美文本指导中学习:在高噪声标签下的鲁棒长尾视觉识别

Mengke Li, Haiquan Ling, Yiqun Zhang, Yang Lu, Hui Huang

机构 * CSSE, Shenzhen University(软件学院,深圳大学) SCST, Guangdong University of Technology(软件学院,广东技术大学) INFORMATICS, Xiamen University(信息学院,厦门大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出利用预训练视觉-语言模型的跨模态对齐能力,通过弱教师监督纠正长尾噪声数据中的标签-图像不一致问题,提升模型在高噪声环境下的识别性能。

Comments Accepted by CVM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.00978 2026-04-28 cs.CL 57%

AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration

AWQ:基于激活的权重量化用于LLM压缩与加速

Ji Lin, Jiaming Tang, Haotian Tang, Shang Yang, Wei-Ming Chen, Wei-Chen Wang, Guangxuan Xiao, Xingyu Dang, Chuang Gan, Song Han

机构 * MIT(麻省理工学院) Shanghai Jiao Tong University(上海交通大学) NVIDIA(英伟达) Tsinghua University(清华大学) UMass Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL

AI总结 本文提出AWQ方法,通过识别重要权重通道减少量化误差,实现低比特权重量化,提升LLM的压缩与加速性能,并在多个基准测试中表现优异。

Comments MLSys 2024 Best Paper Award. Code available at: https://github.com/mit-han-lab/llm-awq

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22281 2026-04-27 cs.CV 57%

DocPrune:Efficient Document Question Answering via Background, Question, and Comprehension-aware Token Pruning

DocPrune:通过背景、问题和理解感知的令牌修剪实现高效的文档问答

Joonmyung Choi, Sanghyeok Lee, Jongha Kim, Sehyung Kim, Dohwan Ko, Jihyung Kil, Hyunwoo J. Kim

机构 * Korea University(韩国大学) KAIST(韩国科学技术院) Adobe Research(Adobe研究院)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出DocPrune框架,通过背景、问题和理解感知的令牌修剪提升长文档理解效率,实验显示在M3DocRAG上提升了吞吐量和F1分数。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21160 2026-04-24 cs.CV 57%

Reinforcing 3D Understanding in Point-VLMs via Geometric Reward Credit Assignment

通过几何奖励信用分配强化点-视觉-语言模型的3D理解

Jingkun Chen, Ruoshi Xu, Mingqi Gao, Shengda Luo, Jungong Han

机构 * Northwestern Polytechnical University(西北工业大学) Southern University of Science and Technology(南方科技大学) The University of Sheffield(谢菲尔德大学) Hengqin Laboratory(横琴实验室) Tsinghua University(清华大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出几何奖励信用分配框架,通过分离整体监督信号并定向反馈,提升点-视觉-语言模型的3D结构对齐能力,同时引入重投影一致性项约束物理可行性,从而提升3D KPA和重投影一致性评分。

Comments 10 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03476 2026-04-24 cs.CV 57%

Anatomy-Aware Text-Visual Fusion with Dual-Perspective Prompts for Fine-Grained Lumbar Spine Segmentation

具有双视角提示的解剖感知文本-视觉融合用于细粒度腰椎分割

Sheng Lian, Jianlong Cai, Dengfeng Pan, Guang-Yong Chen, Hao Xu, Fan Zhang, Guodong Fan, Shuo Li

机构 * College of Computer and Data Science(计算机与数据科学学院) Shandong Technology and Business University(山东科技商务大学) Engineering Research Center of Big Data Intelligence (Fuzhou University)(大数据智能工程研究中心(福州大学)) The Chinese University of Hong Kong(香港中文大学) Case Western Reserve University(凯斯西储大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出ATM-Net框架,通过解剖感知文本引导的多模态融合机制,提升腰椎细粒度分割精度,实验表明其在MRSpineSeg和SPIDER数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20398 2026-04-23 cs.CL cs.LG cs.SE 57%

WebGen-R1: Incentivizing Large Language Models to Generate Functional and Aesthetic Websites with Reinforcement Learning

WebGen-R1: 通过强化学习激励大语言模型生成功能性和美观的网站

Juyong Jiang, Chenglin Cai, Chansung Park, Jiasi Shen, Sunghun Kim, Jianguo Li, Yue Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Tongyi Lab, Alibaba Group(阿里云实验室) Electronics and Telecommunications Research Institute(电子电信研究院) Ant Group(蚂蚁集团)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 本文提出WebGen-R1框架,通过强化学习生成多页面功能性和美观的网站,解决了传统方法在多页面交互和审美评估上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19857 2026-04-23 cs.LG cs.CL 57%

Rethinking Reinforcement Fine-Tuning in LVLM: Convergence, Reward Decomposition, and Generalization

重新思考LVLM中的强化微调:收敛性、奖励分解与泛化

Carter Adams, Rafael Oliveira, Gabriel Almeida, Sofia Torres

机构 * Federal University of Bahia(巴伊亚联邦大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 本文提出TA-MDP框架,分析强化微调中奖励结构对GRPO收敛性的影响,并推导奖励分解定理和泛化界限,揭示工具增强策略在分布外迁移中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19591 2026-04-23 cs.CV 57%

Structure-Semantic Decoupled Modulation of Global Geospatial Embeddings for High-Resolution Remote Sensing Mapping

全局地理嵌入的结构-语义解耦调制用于高分辨率遥感制图

Jienan Lyu, Miao Yang, Jinchen Cai, Yiwen Hu, Guanyi Lu, Junhao Qiu, Runmin Dong

机构 * Sun Yat-Sen University(中山大学) Tsinghua University(清华大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出SSDM框架,通过解耦全局地理表示为两个互补的跨模态注入路径,提升高分辨率遥感制图的结构和语义一致性,实现更准确的土地覆盖分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19631 2026-04-22 cs.CV 57%

MOSA: Motion-Guided Semantic Alignment for Dynamic Scene Graph Generation

MOSA:基于运动的语义对齐用于动态场景图生成

Xuejiao Wang, Bohao Zhang, Changbo Wang, Gaoqi He

机构 * School of Computer Science and Technology, East China Normal University, Shanghai, China(东华大学计算机科学与技术学院) School of Data Science and Engineering, East China Normal University, Shanghai, China(东华大学数据科学与工程学院)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出MOSA方法,通过融合运动特征与空间关系,提升动态场景图生成中细粒度关系建模和语义表示利用能力,优化尾部关系学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03337 2026-04-22 cs.CV 57%

Less is More: Token-Efficient Video-QA via Adaptive Frame-Pruning and Semantic Graph Integration

少即是多:通过自适应帧剪枝和语义图集成实现高效的视频问答

Shaoguang Wang, Weiyu Guo, Ziyang Chen, Yijie Xu, Xuming Hu, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州)中国) The Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科技大学,香港特别行政区,中国)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种结合自适应帧剪枝和轻量级语义图的框架,有效减少视频问答中输入token数量,提升效率并增强基模型性能。

Comments Accepted to CVPR 2026 Findings

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18573 2026-04-21 cs.CV 57%

T-REN: Learning Text-Aligned Region Tokens Improves Dense Vision-Language Alignment and Scalability

T-REN:学习文本对齐的区域标记以提高密集视觉-语言对齐和可扩展性

Savya Khosla, Sethuraman T, Aryan Chadha, Alex Schwing, Derek Hoiem

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 T-REN通过文本对齐的区域标记提升密集视觉-语言对齐和可扩展性,实验证明在多个任务中性能提升显著同时大幅降低token数量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10448 2026-04-21 cs.CL 57%

Instruction Data Selection via Answer Divergence

通过答案分歧进行指令数据选择

Bo Li, Mingda Wang, Shikun Zhang, Wei Ye

机构 * National Engineering Research Center for Software Engineering, Peking University(软件工程国家工程研究中心,北京大学) School of Computer Science, Peking University(北京大学计算机学院) PKU-CMCC(Hubei) Joint Research Lab for LLM Industrial Applications(北京大学-CMCC(湖北)大语言模型工业应用联合实验室) School of Health Sciences and Biomedical Engineering, Hebei University of Technology(河北工业大学健康科学与生物医学工程学院)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CL

AI总结 本文提出通过多样本输出的几何结构选择指令数据,通过计算答案分歧分数提升下游性能,实验表明仅使用10K个ADG选择的例子在六个基准上表现更优。

Comments Github: https://github.com/WisdomShell/ADG Project: https://wisdomshell.github.io/ADG/

Journal ref ACL2026, Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05920 2026-04-21 cs.CV 57%

High-Resolution Visual Reasoning via Multi-Turn Grounding-Based Reinforcement Learning

通过多轮基于定位的强化学习实现高分辨率视觉推理

Xinyu Huang, Yuhao Dong, Weiwei Tian, Bo Li, Rui Feng, Ziwei Liu

机构 * Fudan University(复旦大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出MGPO框架,通过多轮对话机制使LMMs在无需额外标注的情况下提升视觉定位能力,实验表明其在MME-Realworld和V*Bench任务中表现优异。

Comments Accepted by ACL(Findings) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏