Best-of-Q: Improving VLM agents with Q-function Action Ranking at Inference
Best-of-Q: 通过推理中的Q函数动作排名提升VLM代理
专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI
AI总结 Best-of-Q通过在推理过程中利用Q函数动作排名提升VLM代理性能,显著提高任务成功率。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
Best-of-Q: 通过推理中的Q函数动作排名提升VLM代理
专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);分类 cs.AI
AI总结 Best-of-Q通过在推理过程中利用Q函数动作排名提升VLM代理性能,显著提高任务成功率。
达尔文记忆:一种无训练的自调节记忆系统用于GUI代理进化
机构 * Didichuxing Co. Ltd(滴滴出行有限公司) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Tianjin University(天津大学) ; Sun Yat-sen University(中山大学) ; Fudan University(复旦大学)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
AI总结 达尔文记忆系统通过自进化架构提升GUI代理的执行稳定性与成功率,无需额外训练或架构开销。
视觉-语言-动作(VLA)模型:概念、进展、应用与挑战
机构 * Cornell University(康奈尔大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; University of the Peloponnese(希腊皮洛斯大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);vision language model(abstract);分类 cs.CV
AI总结 本文综述了视觉-语言-动作(VLA)模型的概念、进展、应用与挑战,探讨了其在自动驾驶、医疗机器人等领域的应用及未来发展方向。
语言、视觉和动作表征的一致性
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI
AI总结 研究通过训练Transformer智能体执行自然语言指令,发现语言、视觉和动作表征在跨模态中呈现部分共享的语义结构,支持模态无关的语义组织。
MemoryVLA: 视觉-语言-动作模型中用于机器人操作的感知-认知记忆
机构 * Department of Automation, BNRist, Tsinghua University(自动化系、BNRist、清华大学) ; Dexmal ; MEGVII Technology(MEGVII技术) ; Tianjin University(天津大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; StepFun
专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV
AI总结 MemoryVLA通过结合感知与认知记忆机制,提升机器人操作中长时间跨度任务的性能,实现对时间依赖任务的高效处理。
Comments ICLR 2026 | The project is available at https://shihao1895.github.io/MemoryVLA
PhoStream:面向移动场景的多模态助手实时流基准测试
机构 * CUHK MMLab(CUHK 多模态实验室) ; Huawei Research(华为研究) ; City University of Hong Kong(城市大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV
AI总结 PhoStream是首个面向移动场景的多模态助手实时流基准测试,通过统一屏幕内外场景评估视频、音频和时间推理能力,揭示了大语言模型在决定何时发言上的局限性。
Comments 18 pages