arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Tencent(腾讯)

2026-03-26 至 2026-03-26 共收录 7
2603.24533 2026-03-26 cs.LG cs.AI cs.CV

UI-Voyager: A Self-Evolving GUI Agent Learning via Failed Experience

UI-Voyager:一种通过失败经验自我进化的GUI代理学习

Zichuan Lin, Feiyu Liu, Yijun Yang, Jiafei Lyu, Yiming Gao, Yicheng Liu, Zhicong Lu, Yangbin Yu, Mingyu Yang, Junyou Li, Deheng Ye, Jie Jiang

机构 * Tencent(腾讯)

AI总结 本文提出UI-Voyager,一种两阶段自我进化的移动GUI代理,通过拒绝微调和组相对自蒸馏提升GUI任务的效率和性能,实验显示其在AndroidWorld上达到81.0%的Pass@1成功率。

Comments Code and models are available at https://github.com/ui-voyager/UI-Voyager

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22171 2026-03-26 cs.CR cs.AI

Enhancing Jailbreak Attacks on LLMs via Persona Prompts

通过人格提示增强大语言模型的劫持攻击

Zheng Zhang, Peilin Zhao, Deheng Ye, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tencent(腾讯)

AI总结 本文通过遗传算法生成人格提示,有效降低大语言模型拒绝率,提升劫持攻击成功率,揭示人格提示对模型安全机制的影响。

Comments Workshop on LLM Persona Modeling at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24051 2026-03-26 cs.CL

FinToolSyn: A forward synthesis Framework for Financial Tool-Use Dialogue Data with Dynamic Tool Retrieval

FinToolSyn: 一种用于金融工具使用对话数据的前向合成框架,具有动态工具检索

Caishuang Huang, Yang Qiao, Rongyu Zhang, Junjie Ye, Pu Lu, Wenxi Wu, Meng Zhou, Xiku Du, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) FiT, Tencent(腾讯FiT) Zhejiang University(浙江大学)

AI总结 本文提出FinToolSyn框架,通过动态工具检索生成高质量金融对话数据,构建43,066个工具库并合成148k对话实例,提升金融场景下的工具调用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23911 2026-03-26 cs.CL cs.AI cs.LG

Self-Distillation for Multi-Token Prediction

多令牌预测的自蒸馏

Guoliang Zhao, Ruobing Xie, An Wang, Shuaipeng Li, Huaibing Xie, Xingwu Sun

机构 * Large Language Model Department, Tencent(腾讯大语言模型部门)

AI总结 本文提出MTP-D自蒸馏方法,提升多令牌预测头接受率并保持主头性能,通过循环扩展策略进一步提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23896 2026-03-26 cs.CV

MMTIT-Bench: A Multilingual and Multi-Scenario Benchmark with Cognition-Perception-Reasoning Guided Text-Image Machine Translation

MMTIT-Bench: 一个具有认知-感知-推理引导的多语言多场景文本-图像机器翻译基准

Gengluo Li, Chengquan Zhang, Yupu Liang, Huawen Shen, Yaping Zhang, Pengyuan Lyu, Weinong Wang, Xingyu Wan, Gangyan Zeng, Han Hu, Can Ma, Yu Zhou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Tencent(腾讯) Nankai University(南开大学) University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University of Science and Technology(南京理工大学)

AI总结 MMTIT-Bench通过1400张覆盖14种非英语和非中文语言的图像,评估端到端文本-图像机器翻译的鲁棒性,并提出CPR-Trans数据范式提升翻译推理能力。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18996 2026-03-26 cs.CV

Learning Cross-View Object Correspondence via Cycle-Consistent Mask Prediction

通过循环一致性掩码预测学习跨视角物体对应关系

Shannan Yan, Leqi Zheng, Keyu Lv, Jingchen Ni, Hongyang Wei, Jiajun Zhang, Guangting Wang, Jing Lyu, Chun Yuan, Fengyun Rao

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室) USTC(中国科学技术大学)

AI总结 本文提出基于条件二值分割的框架,通过循环一致性训练目标视角预测掩码并重建源视角掩码,实现无标注的自监督学习,提升跨视角物体对应性能。

Comments The paper has been accepted to CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14951 2026-03-26 cs.CV

Morph: A Motion-free Physics Optimization Framework for Human Motion Generation

Morph:一种无需运动的物理优化框架用于人类运动生成

Zhuo Li, Mingshuang Luo, Ruibing Hou, Xin Zhao, Hao Liu, Hong Chang, Zimo Liu, Chen Li

机构 * WeChat, Tencent Inc(微信,腾讯公司) Key Laboratory of Intelligent Information Processing of Chinese Academy of Sciences (CAS), Institute of Computing Technology, CAS, China(中国科学院智能信息处理重点实验室(CAS),计算技术研究所,CAS,中国) Peng Cheng Laboratory, China(鹏城实验室,中国) University of Chinese Academy of Sciences, China(中国科学院大学,中国) MoE Key Laboratory of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(人工智能MoE重点实验室,人工智能研究院,上海交通大学)

AI总结 本文提出Morph框架,通过运动生成器和运动物理细化模块提升运动的物理合理性,无需昂贵真实运动数据,实验显示其在文本到运动和音乐到舞蹈生成任务中达到最先进的运动质量。

Comments Accepted by ICCV 2025, 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏