arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Tencent(腾讯)

2026-05-01 至 2026-05-01 共收录 4
2604.27955 2026-05-01 cs.AI cs.CV

GUI Agents with Reinforcement Learning: Toward Digital Inhabitants

具有强化学习的图形用户界面代理:迈向数字居民

Junan Hu, Jian Liu, Jingxiang Lai, Jiarui Hu, Yiwei Sheng, Shuang Chen, Jian Li, Dazhao Du, Song Guo

机构 * Shandong University(山东大学) The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University(香港大学) Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯)

AI总结 本文探讨了强化学习与GUI代理的结合,提出分类体系及趋势分析,旨在指导下一代鲁棒GUI自动化及基础设施发展。

Comments Project Page: https://github.com/Steve2457/Awesome-RL-GUI-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17196 2026-05-01 cs.CL cs.AI cs.LG

Understanding and Improving Length Generalization in Hierarchical Sparse Attention Models

理解并改进层次稀疏注意力模型中的长度泛化

Jiaqi Leng, Xiang Hu, Junxiong Wang, Jianguo Li, Wei Wu, Yucheng Lu

机构 * Fudan University(复旦大学) Tencent AI Lab(腾讯AI实验室) Cornell University(康奈尔大学) Ant Group(蚂蚁集团) Ant International(蚂蚁国际) NYU Shanghai(纽约大学上海分校)

AI总结 本文通过系统分析揭示了层次稀疏注意力模型中长度泛化的核心设计原则,提出三种关键组件:非线性Chunk编码器、旁路残差路径和预训练中的稀疏选择,从而在RULER和BABILong数据集上实现了免训练的长度外推。

Comments ICLR 2026 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27043 2026-05-01 cs.CL

CL-bench Life: Can Language Models Learn from Real-Life Context?

CL-bench Life: 语言模型能否从真实生活情境中学习?

Shihan Dou, Yujiong Shen, Chenhao Huang, Junjie Ye, Jiayi Chen, Junzhe Wang, Qianyu He, Shichun Liu, Changze Lv, Jiahang Lin, Jiazheng Zhang, Ming Zhang, Shaofan Liu, Tao Ji, Zhangyue Yin, Cheng Zhang, Huaibing Xie, Jianglu Hu, Jingcheng Deng, Lincheng Li, Minda Hu, Shaolei Wang, Syrus Zhao, Weichao Wang, Yan Lei, Yang Liu, Yanling Xiao, Yiting Liu, Zenan Xu, Zhen Guo, Ziliang Zhao, Pluto Zhou, Tao Gui, Qi Zhang, Xuanjing Huang, Yu-Gang Jiang, Di Wang, Shunyu Yao

机构 * Hunyuan Team, Tencent(文生图团队,腾讯) Fudan University(复旦大学)

AI总结 CL-bench Life通过405个情境-任务对和5348条验证标准,评估语言模型处理真实生活场景的能力,发现现有模型在复杂、混乱的真实情境推理上仍面临巨大挑战。

Comments 50 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22500 2026-05-01 cs.CV cs.AI

OR-VSKC: Resolving Visual-Semantic Knowledge Conflicts in Operating Rooms with Synthetic Data-Guided Alignment

OR-VSKC:通过合成数据引导对齐解决手术室中的视觉-语义知识冲突

Weiyi Zhao, Xiaoyu Tan, Liang Liu, Sijia Li, Youwei Song, Xihe Qiu

机构 * Shanghai University of Engineering Science(上海工程技术大学) Tencent YouTu Lab(腾讯优图实验室) Clinical Research Unit, Zhongshan Hospital of Fudan University(复旦大学中山医院临床研究部)

AI总结 本文提出OR-VSKC基准,通过合成数据引导对齐解决手术室中的视觉-语义知识冲突,评估多模态大语言模型的可靠性,并展示微调后的模型在未见视角上的鲁棒性。

Comments 13 pages, 5 figures. The dataset and appendix are available at https://github.com/zgg2577/VS-KC

详情

展开后加载摘要…

URL PDF HTML 收藏