arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-24 至 2026-08-24 共收录 7 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 7 篇

2608.20975 2026-08-24 cs.AI 新提交 83%

Belief Without Behavior: Measuring the Translation of Theory of Mind into Coordinated Social Action in Vision-Language Models

无行为的信念:测量视觉-语言模型中心智理论到协同社会行动的转化

Tonglin Yan, Gregoire Sergeant-Perthuis, David Rudrauf

机构 * CIAMS, Université Paris-Saclay(巴黎萨克雷大学 CIAMS) CQSB, Sorbonne Université(索邦大学 CQSB)

专题命中 GUI与屏幕智能体 :vision-language model(title);VLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出基准MOSAIC评估视觉-语言模型的心智理论到协同社会行动的转化,发现多数模型存在瓶颈,而带显式ToM模块的PCM-LLM表现优异,证实显式信念-行动耦合的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20797 2026-08-24 cs.AI 新提交 81%

Automated Trajectory Evaluation for Mobile Agents via Step-Level Consequence Reasoning and Aggregation

基于步骤级结果推理与聚合的移动智能体自动轨迹评估

Pengshuai Yang, Zijing Gao, Xue Yu, Benhui Zhuang, Bo Yuan, Junlan Feng

机构 * Jiutian Research(九天研究院) China Mobile(中国移动)

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);分类 cs.AI

AI总结 本研究提出CRATE(含安全评估扩展版CRATE-S)这一VLM-as-judge框架,通过步骤级推理解决移动智能体轨迹评估的上下文过载与安全缺失问题,在AndroidWorld、MobileRisk数据集上取得优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20763 2026-08-24 cs.CV cs.AI 新提交 81%

CARD: Diagnosing Belief to Action Routing Failures in Vision Language Models

CARD:诊断视觉语言模型中从信念到行动的路由故障

Souptik Kumar Majumdar, Fabian Kögel, Andreas Bulling

机构 * Universität Stuttgart(斯图加特大学)

专题命中 GUI与屏幕智能体 :vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出跨轴路由诊断(CARD)方法,在新型协作网格世界基准Relay Chain上诊断发现视觉语言模型(VLMs)存在未将信念表征纳入下一次行动预测的关键路由故障,相关成果为改进VLMs的信念-行动路由提供了依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20707 2026-08-24 cs.IR 新提交 67%

Towards Faithful Simulation of Human Shopping Behavior

面向人类购物行为的忠实模拟

Jiakai Tang, Yan Mi, Jing Yu, Yang Zhang, See-Kiong Ng, Qi Cao, Fei Sun, Xu Chen, Wen Chen, Jian Wu, Han Zhu, Bo Zheng

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn)

AI总结 本文针对现有用户购物行为模拟器的记忆与优化挑战,提出分层记忆的RecVerse智能体,结合轨迹级RL优化,发布USB数据集,在模拟性能上显著优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21247 2026-08-24 cs.CV cs.RO 新提交 57%

Just Noticeable Difference Modeling for Token Compression in Vision-Language-Action Models

视觉-语言-动作模型中用于令牌压缩的刚可察觉差异建模

Zhuoyuan Li, Rui Zhao, Jin Wang, Hanwei Zhu, Cong Zhang, Giuseppe Valenzise, Weisi Lin, Kin-Man Lam

机构 * The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学) Bytedance Inc.(字节跳动公司) Shandong University(山东大学) CNRS(法国国家科学研究中心) CentraleSupelec(中央理工学院) Université Paris-Saclay(巴黎萨克雷大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 本文针对视觉-语言-动作模型的令牌压缩问题,提出Action-JND方法,通过动作容忍度准则优化压缩,在LIBERO基准实验中提升了激进压缩下的压缩可靠性。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28645 2026-08-24 cs.HC cs.AI 版本更新 57%

Looks Right, Works Right: A Project-Level Benchmark for Multi-Screen Mobile App Generation

看起来对,运行起来对:面向多屏移动应用生成的项目级基准测试

Fan Wu, Cuiyun Gao, Yiming Huang, Yang Xiao, Yujia Chen, Qing Liao

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

AI总结 针对现有设计转代码基准的局限,提出首个项目级多屏移动应用生成基准MobileForge,通过五轴评估及两种测试方法,发现前沿多模态LLM构建的应用存在导航、保真度和可维护性问题。

Comments Accepted by EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21355 2026-08-24 cs.RO 新提交 50%

ViTacPhys: Physical Property-Aware Grasping from Human Visual-Tactile Demonstrations

ViTacPhys:基于人类视觉-触觉演示的感知物体物理属性的抓取方法

Yiwen Liu, Yujun Zhu, Kui Jia, Zhao Liao, Yangwei You, Shuaijun Wang

机构 * Xiaomi Robotics(小米机器人)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 该研究提出ViTacPhys视觉-触觉框架,可从人类演示中估计物体物理属性,迁移至机器人后实现高抓取成功率,力曲线更贴合人类遥操作。

Comments 11 pages, 7 figures. Project page: this https URL (https://vitacphys.github.io/ViTacPhys/)

详情

展开后加载摘要…

URL PDF HTML 收藏