SecAgent: Efficient Mobile GUI Agent with Semantic Context
SecAgent:基于语义上下文的高效移动GUI代理
机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘天集团)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV
AI总结 SecAgent通过构建中文移动GUI数据集和语义上下文机制,提升移动GUI代理的效率与性能,实现高效任务处理与多语言支持。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
SecAgent:基于语义上下文的高效移动GUI代理
机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘天集团)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV
AI总结 SecAgent通过构建中文移动GUI数据集和语义上下文机制,提升移动GUI代理的效率与性能,实现高效任务处理与多语言支持。
面向多视角轨迹视频的高一致性具身世界模型
机构 * Midea Group(美的集团) ; Tongji University(同济大学) ; East China Normal University(华东师范大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.AI
AI总结 本文提出MTV-World模型,通过多视角轨迹视频控制实现精准的视觉-运动预测,解决低层次动作与真实物理交互不一致的问题,实验表明其在复杂双臂场景中表现优异。
Comments 12 pages, 5 figures
World2Rules: 一种用于航空领域学习世界治理安全规则的神经符号框架
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 多模态Agent :multimodal(abstract)
AI总结 World2Rules通过结合神经网络和符号方法,从航空多模态数据中学习安全规则,提升规则的准确性和可解释性,实验显示其在F1得分上优于纯神经和单步神经符号基线。
Comments 19 pages, 6 figures
DeepEye:一种可调节的自动驾驶数据代理系统
专题命中 多模态Agent :multimodal(abstract)
AI总结 本文提出DeepEye,一种基于工作流的生产级数据代理系统,通过统一多模态协调协议和分层推理机制,解决异构数据源联合分析和上下文爆炸问题,实现透明执行和自动化优化。
Comments SIGMOD Demo (2026)
玄武:将通用多模态模型演进为内容生态系统工业级基础模型
机构 * Computational Intelligence Dept, Hello Group Inc(Hello Group Inc. 计算智能部)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出Xuanwu VL-2B,通过三阶段训练流程平衡业务专精与通用能力,实现7项多模态指标平均67.90分,7项业务审核任务召回率94.38%,在对抗性OCR场景中超越Gemini-2.5-Pro。
Comments 41 pages, 10 figures
基于多模态上下文学习的少样本作家适应
机构 * LITIS EA4108, University of Rouen Normandy(LITIS EA4108,鲁昂诺曼底大学) ; LITIS EA4108, INSA of Rouen Normandy(LITIS EA4108,鲁昂诺曼底国立应用科学学院)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出一种基于多模态上下文学习的少样本手写体识别框架,通过少量目标作家样本实现推理时的作家适应,无需参数更新,实验在IAM和RIMES数据集上取得优于现有模型的识别效果。
ReDiPrune:基于相关性与多样性的预投影令牌剪枝用于高效的多模态大语言模型
机构 * University at Albany, SUNY(纽约州立大学奥尔巴尼分校) ; Peking University(北京大学)
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV
AI总结 ReDiPrune是一种无需训练的预投影令牌剪枝方法,通过选择信息丰富的视觉令牌提升多模态大语言模型的效率与准确性。
KARMA:面向淘宝个性化搜索的知识-行动正则化多模态对齐
机构 * Taobao \& Tmall Group of Alibaba Hangzhou China ; Taobao \& Tmall Group of Alibaba
专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI
AI总结 KARMA通过知识-行动正则化多模态对齐框架,解决个性化搜索中知识与行动冲突问题,提升语义可解性与行动指标,实现GMV增长。
通过半监督率减少实现多模态表示学习的通用类别发现
机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) ; Intellifusion Inc., Shenzhen, P.R. China(深圳云天励飞技术股份有限公司)
专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV
AI总结 本文提出SSR²-GCD框架,通过半监督率减少实现多模态表示学习,提升通用类别发现任务的结构属性和知识迁移能力。
Comments 15 pages, accepted by CVPR 2026
三模态深度学习在胶质瘤生存预测中的应用:整合组织病理学、基因表达和MRI的可行性研究
机构 * Munster Technological University(芒斯特理工大学)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文探讨了三模态深度学习在胶质瘤生存预测中的可行性,通过整合组织病理学、基因表达和MRI数据,评估了不同融合策略的效果,发现三模态早期融合在小样本下有初步的预测价值。
Comments 6 pages, 1 figure, submitted to the IEEE CBMS 2026 conference, still waiting for notification
AGFT:基于对齐的微调以提升视觉-语言模型的零样本对抗鲁棒性
机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) ; Shenzhen Loop Area Institute, Shenzhen, China(深圳市环域研究所)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出AGFT框架,通过概率预测进行文本引导对抗训练,提升视觉-语言模型的零样本对抗鲁棒性,同时保持跨模态语义结构。
Comments Accepted by CVPR 2026; Code is available at \url{https://github.com/YuboCui/AGFT}
Sigma:基于骨骼的语义信息预训练用于手语理解
机构 * School of Information Technology, Monash University(莫纳什大学信息技术学院) ; S-Lab, Nanyang Technological University(南洋理工大学S-Lab)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.CL
AI总结 Sigma提出一种统一的骨骼手语理解框架,通过语义对齐学习和预训练策略提升手语识别与翻译性能,展现语义信息预训练在多语言手语任务中的有效性。
MAPLE:多路径自适应传播与层次感知嵌入用于层次多标签图像分类
机构 * Jožef Stefan Institute(约热夫·斯特凡研究所) ; Jožef Stefan International Postgraduate School(约热夫·斯特凡国际研究生院)
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV
AI总结 MAPLE通过结合层次语义初始化、图结构编码和自适应多模态融合,有效提升遥感图像的层次多标签分类性能,在少样本场景下提升42%,参数开销仅增加2.6%。
Comments REO: Advances in Representation Learning for Earth Observation, accepted workshow paper at EurIPS
本域交叉注意机制用于大初始扰动下的相机-激光雷达外校准
机构 * School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) ; School of Integrated Circuits and Electronics, Beijing Institute of Technology(北京理工大学集成电路与电子学院)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出一种本域交叉注意机制,通过直接对齐图像块和激光雷达点云实现可靠的跨模态交互,提升在大初始扰动下的外校准精度和鲁棒性。
Comments 8 pages, 3 figures
基于Landsat的30米地表温度降尺度方法
专题命中 多模态训练与对齐 :cross-modal(abstract)
AI总结 本文提出一种渐进自训练框架,通过交叉模态融合网络在无需高精度地面数据的情况下,将Landsat地表温度降尺度至30米分辨率,提升了空间分辨率和精度。
基于对齐的无转速计转速估计与曲率自适应跟踪
专题命中 多模态训练与对齐 :multi-modal(abstract)
AI总结 本文提出ARC方法,通过统一观测表示融合多个估计器,利用曲率感知的状态依赖运动先验,实现稳定且物理合理的轨迹估计,验证了不确定性感知的时间传播的重要性。
BiMoE:受脑启发的专家用于EEG主导的情感状态识别
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 BiMoE通过脑拓扑感知划分EEG信号,利用双流编码器提取局部和全局时空特征,结合多尺度大核卷积处理PPS,动态融合专家并通过联合损失函数提升多模态情感分类性能。
Comments Accepted by ICME 2026
多模态模型在身份证文档呈现攻击检测中的应用
机构 * Security Research Group Hochschule Darmstadt, Germany
专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV
AI总结 本文探讨了将视觉和文本模态结合,利用预训练多模态模型提升身份证文档呈现攻击检测性能,但实验表明这些模型在该任务上表现不足。
REN:基于解剖学的专家混合模型用于间质性肺病诊断
机构 * Department of Computer Science, Northwestern University McCormick School of Engineering and Applied Science(西北大学麦考密克工程与应用科学学院计算机科学系) ; Division of Pulmonary and Critical Care Medicine, Northwestern University Feinberg School of Medicine(西北大学范伯格医学院肺与危重症医学科) ; Division of Rheumatology, Northwestern University Feinberg School of Medicine(西北大学范伯格医学院风湿病科) ; Simpson Querrey Lung Institute for Translational Science, Northwestern University Feinberg School of Medicine(西北大学范伯格医学院辛普森·奎雷转化科学肺研究所) ; Department of Electrical and Computer Engineering, Northwestern University McCormick School of Engineering and Applied Science(西北大学麦考密克工程与应用科学学院电气与计算机工程系) ; Machine & Hybrid Intelligence Lab, Department of Radiology, Northwestern University Feinberg School of Medicine(西北大学范伯格医学院放射科机器与混合智能实验室)
专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出REN模型,通过解剖学指导的专家混合框架提升间质性肺病诊断性能,结合多模态门控机制和深度学习特征,实现更精确的病理变化建模。
Comments 13 pages, 4 figures, 5 tables
MSG:多流生成策略用于样本高效的机器人操作
机构 * University of Freiburg(弗莱堡大学)
专题命中 其他多模态 :multi-modal(abstract);分类 cs.AI
AI总结 本文提出MSG多流生成策略,通过结合多个对象中心策略提升泛化能力和样本效率,实现在五次演示下学习高质量生成策略,性能提升89%。
通过切片吉布斯采样器高效快速地从任意概率核中采样
专题命中 其他多模态 :multimodal(abstract)
AI总结 本文提出自动切片吉布斯框架,实现对任意有限维概率核的自动马尔可夫链蒙特卡洛采样,无需用户指定截断界、提议尺度、步长调优或条件优化,适用于非标准化、非光滑、重尾和高多模态密度。
Comments 27 pages, 24 figures