arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Tencent(腾讯)

2026-07-31 至 2026-07-31 共收录 5
2607.28263 2026-07-31 cs.CL 新提交

Understanding Is Done Early: A Depth Division of Labor in Large Language Models and Its Use for Unbounded-Context Memory

理解在早期完成:大语言模型的深度分工及其在无界上下文记忆中的应用

Hanzuo Liu, Xuan Qi, Chunyu Liu, Haotian Zhong, Yulong Wang, Rayying, Key, Alex Lamb, Mingyu Gao

机构 * Tsinghua University(清华大学) Tencent(腾讯)

AI总结 该研究提出CoMem方法,利用大语言模型的深度分工构建无界上下文记忆,在RULER、LoCoMo等基准上性能优于全上下文KV-Direct,内存占用低、预填充速度快,证明长上下文记忆可沿层轴组织。

Comments 19 pages, 4 figures, 27 tables. Submitted to ACL Rolling Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28033 2026-07-31 cs.AI 新提交

DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness

DataClawEval:面向真实工业场景的数据工程智能体基准测试

Debin Meng, Jiaming Yang, Zefang Zong, Tengyue Xu, Haining Xie, Yang Li, Peng Chen

机构 * Tencent(腾讯) Xidian University(西安电子科技大学) South China Normal University(华南师范大学)

AI总结 DataClawEval是首个针对真实工业数据工程场景的智能体基准,含100项跨5种引擎的任务,用确定性脚本评分,评估16个前沿智能体发现最强模型仅得74.9分,自主数据工程仍是挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27687 2026-07-31 cs.AI 新提交

Rehearse: Stepping Back from the Confidence Cliff in Self-Improving Autoresearch

Rehearse:从自改进自动研究中的置信度悬崖后退

Jiazhen Ji, Shouhong Ding

机构 * Tencent(腾讯)

AI总结 该研究发现自动研究中存在置信度悬崖问题,提出Rehearse方法通过聚焦过往尝试结果记忆提升判断准确率,在三个任务的4000次训练运行预算下改善了终点性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27360 2026-07-31 cs.AI 新提交

SkillMentor: LLM Agent Self-Evolution via Learning Blind-Spot Diagnosis

SkillMentor:基于盲点诊断的大语言模型智能体自我进化

Xiaoyi Bao, Yuanzhen Xie, Yunzhi Tan, Jinghang Gu, Zhongqing Wang, Chu-Ren Huang, Bo Hu, Zang Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Platform and Content Group, Tencent(腾讯平台与内容事业群) Soochow University(苏州大学)

AI总结 本文提出SkillMentor,将盲点诊断作为独立于执行的可学习智能体能力,通过强化学习训练导师策略,在AppWorld和BFCLv3上使执行器性能平均提升44.2%,实现无需更新执行器的智能体自我进化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27283 2026-07-31 cs.LG cs.AI cs.SE 新提交

Benchmarking the Residual: What Long-Horizon Evaluations Add Beyond Matched Short-Task Performance

评估残差:长时序评估在匹配短任务性能之外的补充作用

Chao Peng, Zhiheng Lyu, Peijie Dong, Hande Dong, Qiang Lin

机构 * Tencent(腾讯)

AI总结 该论文提出时序残差概念,指出长时序基准需将全任务成功与短阶段基线预测比较,以解释长任务失败的原因。

详情

展开后加载摘要…

URL PDF HTML 收藏