Delving into Spectral Clustering with Vision-Language Representations
深入探讨基于视觉-语言表示的谱聚类
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出基于预训练视觉语言模型的神经切线核谱聚类方法,通过跨模态对齐提升图像聚类性能,实验表明在16个基准数据集上显著优于现有方法。
Comments ICLR26
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
深入探讨基于视觉-语言表示的谱聚类
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出基于预训练视觉语言模型的神经切线核谱聚类方法,通过跨模态对齐提升图像聚类性能,实验表明在16个基准数据集上显著优于现有方法。
Comments ICLR26
EcoAlign:一种经济理性框架,用于高效LVLM对齐
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI
AI总结 本文提出EcoAlign框架,通过经济理性搜索提升LVLM对齐效率,在安全、效用和成本间取得平衡,实验表明其在计算成本更低的情况下性能更优。
基于检索的解码方法用于提升开放式生成中的真实性
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG
AI总结 本文提出Retrieval-Augmented Decoding方法,通过构建紧凑的参考 grounding 空间,在推理过程中利用检索到的上下文信息调整模型logits,提升生成文本的真实性。
Comments updated experiments and presentation
FlowAD: 无人驾驶中的自体场景交互建模
机构 * AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院AutoLab) ; Baidu Inc(百度公司)
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV
AI总结 本文提出FlowAD框架,通过自体场景交互建模提升自动驾驶性能,利用场景流建模动态变化,结合新颖的FCP指标评估场景理解能力,实验表明其在碰撞率和驾驶评分上均优于现有方法。
资源理性契约主义应指导AI对齐
机构 * Harvard(哈佛大学) ; MIT(麻省理工学院) ; Google Deepmind(谷歌DeepMind) ; Australian National University(澳大利亚国立大学) ; Stanford Psychology Department(斯坦福心理学系) ; Stanford(斯坦福大学) ; Computer Science Department(计算机科学系)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
AI总结 本文提出资源理性契约主义框架,通过认知启发式方法提升AI决策效率与适应性,解决大规模契约达成成本高问题。
Comments 24 pages, 10 figures
Journal ref International Association for Safe and Ethical AI, 2026
OARS:面向生成真实世界图像超分辨率的在线对齐
机构 * ByteDance Inc.(字节跳动公司) ; Peking University(北京大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV
AI总结 OARS通过过程感知的在线对齐框架,结合COMPASS奖励模型,在线优化图像超分辨率模型,实现感知与保真度的平衡,提升真实世界图像超分辨率性能。
Comments Super-Resolution, Reinforcement Learning
超越密集未来:世界模型作为机器人操作的结构化规划器
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV
AI总结 本文提出StructVLA,通过结构化规划器提升机器人操作的可靠性,采用稀疏结构帧替代密集预测,实现视觉规划与运动控制的结合,实验显示在多个环境中的高成功率。
OpenVision 3: 一种用于理解和生成的统一视觉编码器家族
机构 * UC Santa Cruz(加州大学圣克ruz分校) ; JHU(约翰霍普金斯大学) ; UNC-Chapel Hill(北卡罗来纳大学教堂山分校) ; UC Berkeley(加州大学伯克利分校) ; NVIDIA(英伟达)
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.AI
AI总结 本文提出OpenVision 3,通过统一视觉表示实现图像理解和生成。核心架构将VAE压缩的图像潜在特征输入ViT编码器,同时训练其输出以支持重建和语义学习,从而在共享潜在空间中实现良好泛化。
EvoTok:通过残差潜在进化实现统一的图像分词器用于视觉理解和生成
机构 * University of Science and Technology of China(中国科学技术大学) ; Microsoft Corporation(微软公司)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
AI总结 EvoTok通过残差潜在进化统一图像理解和生成,实现高效视觉表征建模。
通过双向多视图提示对齐实现噪声感知的少样本学习
机构 * Southeast University(东南大学) ; AIIA, Ministry of Education, China(教育部人工智能研究院,中国)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 NA-MVP通过双向多视图提示对齐实现噪声感知少样本学习,有效区分干净与噪声线索,提升模型在噪声环境下的鲁棒性。
频率调制的视觉修复用于Matryoshka大多模态模型
机构 * Case Western Reserve University(凯斯西储大学)
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV
AI总结 本文提出FMVR策略,通过频率调制修复视觉语义,提升LMMs在减少视觉token时的推理能力,并在多个基准测试中验证其有效性。
SOTA: 自适应最优传输用于多基础模型的零样本分类
机构 * Yunnan Normal University(云南师范大学) ; Xidian University(西安电子科技大学) ; Xi’an University of Posts and Telecommunications(西安邮电大学) ; Kunming University of Science and Technology(昆明理工大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 SOTA通过自适应最优传输方法整合多基础模型,提升零样本分类性能。
神经罗盘:基于概率相对特征场的机器人搜索
机构 * Department of Computer Science, University of Freiburg(弗赖堡大学计算机科学系)
专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.LG
AI总结 本文提出ProReFF模型,通过概率相对特征场实现机器人搜索任务中的高效物体定位,实验表明其在模拟环境中比基线方法更高效,接近人类水平性能。
Comments 9 pages, 7 figures, 2 tables, submitted to IROS 2026
一种模块化感知人工智能的皮层启发架构
机构 * Independent Researcher(独立研究者)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
AI总结 本文提出了一种受皮层启发的模块化感知人工智能架构,通过分解感知为专门模块,提升可解释性和推理透明度。
Comments Accepted to the ICLR 2026 Workshop on "From Human Cognition to AI Reasoning: Models, Methods, and Applications (HCAIR)"
PromptGate:面向开放集联邦主动学习的客户端自适应视觉语言门控
机构 * University of Bonn(波恩大学) ; University Hospital Bonn(波恩大学医院) ; Clinic for Diagnostic and Interventional Radiology(诊断与介入放射科诊所)
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV
AI总结 PromptGate通过动态视觉语言模型门控框架提升开放集联邦主动学习的标注效率,实现高纯度和高召回率的样本筛选。
Comments 3 Figures, 2 Tables, 10 pages
具有4D空间-时间嵌入的自监督多模态世界模型
机构 * Ecological Intelligence Lab(生态智能实验室) ; School of Complex Adaptive Systems(复杂适应系统学院) ; University of Houston(休斯顿大学) ; Geosensing Systems Engineering & Sciences Lab(传感系统工程与科学实验室) ; Stanford University(斯坦福大学) ; Allen Institute for Artificial Intelligence(人工智能研究院) ; Spatial Intelligence Lab(空间智能实验室) ; Department of Computer Science(计算机科学系) ; Georgia Institute of Technology(佐治亚理工学院) ; Florida Museum of Natural History(佛罗里达自然历史博物馆) ; University of Florida(佛罗里达大学) ; NSF Institute for Geospatial Understanding(国家科学基金会地理理解研究所) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI
AI总结 DeepEarth通过4D空间-时间嵌入实现自监督多模态世界模型,在生态预测中取得最佳性能。
Comments 8 pages, 5 figures, 1 table. Presented at 2026 World Modeling Workshop, Mila Quebec
SIQA:迈向可靠的科学图像质量评估
机构 * TongJi University(同济大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
AI总结 SIQA提出了一种多维框架,通过SIQA-U和SIQA-S评估科学图像的科学正确性和感知清晰度,揭示模型在评分一致性与科学理解上的差异。
适配器增强的带状机用于在线多约束多模态推断调度
机构 * School of Computer Science and Engineering, Sun Yat-sen University, Guangzhou, 510006, China.(中山大学计算机科学与工程学院) ; School of Computing, Macquarie University, NSW 2109, Australia(麦考瑞大学计算机学院)
专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.LG
AI总结 M-CMAB通过多适配器增强框架,实现多模态任务调度中的多约束优化,提升推断效率和预算利用效率。
FontUse: 一种以数据为中心的方法用于风格和使用场景条件下的图像内字体设计
机构 * University of Tsukuba(茨口大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
AI总结 FontUse提出了一种以数据为中心的方法,通过构建大规模字体数据集并结合多模态模型,提升文本生成中字体风格和使用场景的控制能力。
SPINE:基于熵带正则化的令牌选择性测试时间强化学习
机构 * Monash University(墨尔本大学) ; Imperial College London(伦敦帝国理工学院)
专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.LG
AI总结 SPINE通过令牌选择性和熵带正则化提升测试时间推理稳定性与效果。
重新思考多模态大语言模型中视觉编码器混合范式以提升视觉理解
机构 * University of Waterloo(滑铁卢大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
AI总结 LEO通过轻量级融合设计提升多模态大语言模型的视觉理解能力,并在自动驾驶领域展现良好泛化性能。
Comments Accepted by TMLR
为什么RLHF对齐是浅层的?一种梯度分析
机构 * Department of Computer Science and Technology University of Cambridge(计算机科学与技术系剑桥大学)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG
AI总结 本文通过梯度分析揭示RLHF对齐浅层的原因,提出有害信息概念并设计新的目标以实现深层对齐。
EasyAnimate:基于混合窗口注意力和奖励反向传播的高性能视频生成框架
机构 * Alibaba Cloud(阿里云)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV
AI总结 EasyAnimate通过混合窗口注意力和奖励反向传播提升视频生成效率与质量,实现高性能视频生成。
Comments 10 pages, 8 figures, ACM MM 2025
事实性至关重要:当图像生成与编辑遇见结构化视觉
机构 * CUHK MMLab(香港大学多模态实验室) ; Beihang University(北京航空航天大学) ; Krea AI(Krea人工智能) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Lab(上海人工智能实验室) ; Hugging Face ; National University of Singapore(新加坡国立大学) ; ByteDance(字节跳动) ; The University of Hong Kong(香港大学)
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV
AI总结 本文提出了一种统一模型,通过整合视觉语言模型和FLUX.1 Kontext,提升结构化视觉生成与编辑的多模态理解与事实准确性。
Comments Accepted by ICLR 2026, Project page: https://structvisuals.github.io
为何1+1<1在视觉令牌修剪中:通过多目标平衡覆盖超越简单整合
机构 * East China Normal University(华东师范大学) ; Shanghai Jiao Tong University(上海交通大学) ; Chongqing Institute of East China Normal University(华东师范大学重庆研究院) ; Shanghai University of Engineering Science(上海工程技术大学)
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV
AI总结 MoB通过多目标平衡覆盖方法,解决视觉令牌修剪中提示对齐与视觉保留的权衡问题,实现高效且高性能的修剪效果。
Comments 31 pages,9 figures,conference
Journal ref Advances in Neural Information Processing Systems 39 (NeurIPS 2025)
GenAI Workbench: 人工智能辅助从多模态工程数据中分析和合成工程系统
机构 * Colorado State University(科罗拉多州立大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI
AI总结 GenAI Workbench通过整合AI技术,实现从多模态工程数据中辅助分析和合成工程系统,促进更集成和数据驱动的工程设计方法。
Comments 7 pages, 3 figures, accepted to be presented at IISE Annual Conference 2026
基于多模态大语言模型的实时游戏视频解说生成:暂停感知解码方法
机构 * School of CIT, Technical University of Munich(慕尼黑技术大学计算机信息学院) ; National Institute of Advanced Industrial Science(国家工业科学与技术研究院)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI
AI总结 本文提出两种基于提示的解码方法,利用多模态大语言模型实现实时游戏视频解说生成,通过动态间隔调整提升时间相关性与内容准确性。
Comments Accepted at LREC2026
像放射科医生一样推理:用于可验证报告生成的推理链和强化学习
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI
AI总结 BoxMed-RL通过推理链和强化学习生成可验证的放射科报告,提升报告的准确性和可解释性。
多模态强化学习中的token感知聚焦
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; The Chinese University of Hong Kong(香港中文大学) ; Nanjing University(南京大学) ; Wuhan University(武汉大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出VPPO算法,通过token感知优化提升多模态强化学习的视觉推理能力。
Comments Accepted by ICLR 2026, project page: https://github.com/huaixuheqing/VPPO-RL
NERFIFY:一个将NeRF论文转化为代码的多智能体框架
机构 * University of California, San Diego(加州大学圣地亚哥分校)
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV
AI总结 NERFIFY通过多智能体框架将NeRF论文转化为可训练的代码,提升复现效率和质量。
Comments Accepted to CVPR 2026. Project page: https://seemandhar.github.io/NERFIFY/