arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Tencent(腾讯)

2026-08-03 至 2026-08-03 共收录 2
2607.29211 2026-08-03 cs.CL 新提交

Knowing When to Quit: Diagnosing and Training LLMs to Abort Futile Reasoning

何时该放弃:诊断与训练大语言模型以中止无效推理

Xinyan Guan, Jiali Zeng, Chunlei Xin, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun, Fandong Meng

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Weixin AI, Tencent Inc(腾讯微信人工智能)

AI总结 该研究针对大语言模型在超能力任务上产生无效推理的问题,提出CaRL方法对齐模型行为与能力边界,实验验证其可减少无效推理且不牺牲任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29196 2026-08-03 cs.CL 新提交

Hy-MultiTurn: A Six-Dimensional Benchmark for Deep Multi-Turn Dialogue Understanding

Hy-MultiTurn:用于深度多轮对话理解的六维度基准

Eileen Ye, Jiawen Tao, Yaoming Li, Chenxu Liu, Wenhan Yu, Yaxin Fan, Xiaokun Yuan, Mengzhou Wu, Yanbing Jiang, Maxm Pan

机构 * Tencent(腾讯) Peking University(北京大学)

AI总结 Hy-MultiTurn是含六种评估模式的中文深度多轮对话理解基准,含209个长对话任务,评估22种前沿模型发现其具挑战性,GPT-5.5仅41.1%响应达标且无模型全模式最优

Comments 33 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏