UITron-Speech: Towards Automated GUI Agents Based on Speech Instructions
UITron-Speech: 向基于语音指令的自动化GUI代理迈进
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
AI总结 UITron-Speech通过语音指令和截图处理,实现首个端到端GUI代理,提升无障碍人机交互的可行性。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
UITron-Speech: 向基于语音指令的自动化GUI代理迈进
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
AI总结 UITron-Speech通过语音指令和截图处理,实现首个端到端GUI代理,提升无障碍人机交互的可行性。
对多模态大语言模型在视频理解中的可信度进行基准测试
机构 * Hefei University of Technology(合肥工业大学) ; Tsinghua University(清华大学) ; Institute of Science Tokyo(东京科学研究所)
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV
AI总结 本研究提出Trust-videoLLMs基准,评估23种视频LLMs在真实性、鲁棒性、安全性和隐私等方面的表现,揭示其在动态场景理解及现实风险缓解中的局限性。
LLaVA-UHD v3:渐进式视觉压缩用于多模态大语言模型中的高效原分辨率编码
机构 * Tsinghua University(清华大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所) ; School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院)
专题命中 VLM训练与架构 :LLaVA(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 LLaVA-UHD v3通过渐进式视觉压缩方法,实现高效原分辨率编码,减少TTFT并提升多模态大语言模型性能。
TinyChemVL:通过高效视觉标记减少和复杂反应任务推进化学视觉-语言模型
专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV
AI总结 TinyChemVL通过高效视觉标记减少和复杂反应任务提升化学视觉-语言模型的效率和推理能力,实现更高效的化学任务处理。
Comments Accepted by AAAI 2026
TimeViper: 一种用于高效长视频理解的混合Mamba-Transformer视觉语言模型
机构 * AIM3 Lab, Renmin University of China(中国人民大学人工智能实验室) ; MiLM Plus, Xiaomi Inc.(小米公司)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI
AI总结 TimeViper是一种混合Mamba-Transformer模型,通过TransV模块实现高效长视频理解,提升多模态处理能力。
Comments Project page: https://xuboshen.github.io/TimeViper; Code: https://github.com/xiaomi-research/timeviper
EM-KD: 通过不平衡视觉标记的知识蒸馏提升高效多模态大语言模型
机构 * Baidu VIS(百度视觉)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV
AI总结 EM-KD通过改进的知识蒸馏方法,有效提升高效多模态大语言模型的视觉理解和效率。
Comments accepted by AAAI 2026
TrafficLens: 多摄像头交通视频分析使用LLMs
机构 * NEC Laboratories America(NEC美国实验室) ; University of Missouri–Kansas City (UMKC)(密苏里大学-堪萨斯城分校)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
AI总结 TrafficLens通过利用多摄像头重叠区域和对象相似性检测,高效地将视频转换为文本,减少处理时间并提升交通视频分析效率。
Comments 2024 IEEE 27th International Conference on Intelligent Transportation Systems (ITSC)
基于文本的语义图像编码器
机构 * Duke University(杜克大学) ; FAIR at Meta(Meta的FAIR)
专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV
AI总结 本文提出基于文本的语义图像编码器,通过文本指导生成图像表示,提升视觉-语言模型在多个基准测试中的性能,并提高推理效率。
Comments 20 pages, 6 figures
从文本到多模态:探索大型语言模型在医疗实践中的演变与影响
机构 * Kyoto University(京都大学) ; Georgia Institute of Technology(佐治亚理工学院) ; National Taiwan Normal University(台湾师范大学) ; Indiana University(印第安纳大学) ; Hong Kong University of Science(香港科学大学) ; The University of Texas at Dallas(德克萨斯大学达拉斯分校) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Cornell University(康奈尔大学) ; University of Liverpool(利物浦大学) ; University of Edinburgh(爱丁堡大学) ; Zhejiang University(浙江大学) ; Purdue University(Purdue 大学) ; Emory University, Atlanta, GA, USA(埃默里大学) ; West China Biomedical Big Data Center, West China Hospital, Sichuan University, Chengdu, China(西京生物大数据中心,四川大学西京医院,成都,中国)
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
AI总结 本文探讨了多模态大型语言模型在医疗实践中的发展与影响,分析其在医疗影像、临床决策支持等领域的应用及面临的挑战。
Comments 12 pages, 1 figure
FANoise:奇异值自适应噪声调制用于鲁棒多模态表示学习
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.AI、cs.LG
AI总结 FANoise通过自适应噪声注入策略提升多模态表示学习的鲁棒性和性能
Comments 13 pages, 5 figures, accept to AAAI2026
动态模板选择用于输出标记生成优化:基于MLP和Transformer的方法
专题命中 VLM训练与架构 :grounding(abstract)
AI总结 本文提出动态模板选择方法,通过MLP和Transformer路由策略优化输出标记生成,实现成本降低与响应质量的平衡。
Comments 20 pages, 4 figures, includes production-scale experiments across OpenAI GPT-4, Google Gemini, and Anthropic Claude; code available upon request
从舌尖上的遗忘检索查询中无监督建模可记忆性
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; Adobe Media and Data Science Research(Adobe媒体与数据科学研究)
专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出首个大规模无监督数据集,通过舌尖上的遗忘检索查询建模视觉内容的可记忆性,并展示了其在回忆生成和ToT检索任务中的优越表现。
Comments Accepted at WACV 2026
FITRep: 通过大语言模型实现的注意力引导的项目表示
机构 * Meituan(美团)
专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI
AI总结 FITRep通过引入注意力引导的白盒表示框架,利用多模态大语言模型实现细粒度项目去重,提升了广告点击率和每千次展示成本。