arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Tencent(腾讯)

2026-08-06 至 2026-08-06 共收录 3
2608.04828 2026-08-06 cs.CL 新提交

Skill-Use: Can LLMs Actually Use Skills in Agentic Harnesses?

技能使用:智能体框架中的大语言模型(LLM)真的能使用技能吗?

Jinyi Han, Yuanjian Xu, Ying Liao, Xinyi Wang, Zishang Jiang, Zixiang Di, Fanyang Lu, Zhichao Hu, Yanghua Xiao

机构 * East China Normal University(华东师范大学) Hong Kong University of Science and Technology(香港科技大学) Fudan University(复旦大学) Tencent Hunyuan(腾讯混元)

AI总结 本研究推出Skill-Use基准,评估智能体在渐进式披露下的技能使用,发现8个LLM在两个框架下的SU分数仅0.613,技能使用是依赖框架的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04574 2026-08-06 cs.CL 新提交

When Memory Lies: An Empirical Study of Spatial Memory Staleness in VLM Agents

当记忆“说谎”:VLM智能体中空间记忆过时的实证研究

Yushi Sun, Yanjie Zhang

机构 * Tencent LIGHTSPEED(腾讯光速工作室)

AI总结 该研究通过动态FrozenLake测试平台,探究了VLM智能体的空间记忆过时问题,发现文本可解性不代表视觉接地、信任过时记忆存在安全隐患、审核无法完全消除差距,明确了相关核心挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04570 2026-08-06 cs.CL 新提交

The Personalization Mirage: How LLMs Fabricate User Profiles, and Why Self-Monitoring Misleads

个性化的幻影:大语言模型如何伪造用户画像,以及自我监测为何会产生误导

Yushi Sun, Yanjie Zhang, Rui Sheng

机构 * Tencent LIGHTSPEED(腾讯光速实验室)

AI总结 该研究推出MirageBench,发现12款LLMs普遍存在过度推断用户画像的问题,还揭示了自我监测反转现象,表明外部验证比模型自我报告更可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏