arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Google(谷歌)

2026-08-24 至 2026-08-24 共收录 3
2608.21021 2026-08-24 cs.CL cs.AI cs.NI 新提交

Free-Text Evaluation of LLMs for 5G Domain Knowledge and Fault Analysis using LLM-as-Judge

基于LLM作为评判者的5G领域知识与故障分析大模型自由文本评估

Rishiraj Sengupta, Sotiris Chatzimiltis, Mohammad Shojafar, Xiatian Zhu

机构 * Surrey Institute for People-Centered Artificial Intelligence(萨里以人为本人工智能研究院) Google(谷歌)

AI总结 本文以自由文本格式评估Claude-Haiku-4.5等三个轻量型LLM的5G领域知识与故障分析能力,发现其故障诊断准确率超90%但规范召回不足,Gemini-3.1-Flash-Lite效率最优适合生产部署。

Comments 6pages, 4figures. Accepted for presentation in IEEE CSCN conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17378 2026-08-24 cs.LG cs.AI 版本更新

Efficient Exploration at Scale

大规模高效探索

Seyed Mohammad Asghari, Chris Chute, Vikranth Dwaracherla, Xiuyuan Lu, Mehdi Jafarnia, Victor Minden, Zheng Wen, Benjamin Van Roy

机构 * Google(谷歌) DeepMind(深度思维)

AI总结 本文提出一种在线学习算法,通过增量更新奖励和语言模型提升强化学习从人类反馈中的数据效率,采用小幅度正向激励、信念神经网络和信息导向探索等机制,实验表明在少于20k标签下达到200k标签的性能,预计1M标签可匹配1B标签的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10282 2026-08-24 cs.RO 版本更新

Update-Free On-Policy Steering via Verifiers

基于验证器的免更新在线策略引导

Maria Attarian, Ian Vyse, Jasper Gerigk, Evgenii Opryshko, Yifan Ruan, Anas Almasri, Sumeet Singh, Yilun Du, Igor Gilitschenski, Claas Voelcker

机构 * University of Toronto(多伦多大学) Google DeepMind(谷歌DeepMind) University of Alberta(阿尔伯塔大学) UTAustin(得克萨斯大学奥斯汀分校) Harvard University(哈佛大学)

AI总结 提出UF-OPS方法,利用策略评估中的验证器函数引导基础策略选择高成功概率动作,无需更新参数即可提升黑箱扩散策略性能,在5个真实任务中平均成功率提升49%。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏