arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Georgia Institute of Technology(佐治亚理工学院)

2026-08-24 至 2026-08-24 共收录 4
2608.21204 2026-08-24 cs.RO cs.LG 新提交

Beyond Imitation: Self-Improving Robot Policies via Off-Policy Q-Planning

超越模仿:基于离线Q规划的机器人策略自改进

Varun Giridhar, Anant Khandelwal, Jeremy A. Collins, Ignat Georgiev, Animesh Garg

机构 * Georgia Institute of Technology(佐治亚理工学院)

AI总结 该研究提出Q规划方法,为大型视觉运动BC策略配备离线Q函数,通过仅微调Q函数实现自改进,在仿真和真实机器人任务中均显著提升机器人操作性能,且优于多种对比方法。

Comments Project page with videos: this https URL (https://varungiridhar.github.io/qplanning/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20631 2026-08-24 cs.AI 新提交

Weighted Memory Tree: Remembering What Matters for Long-Horizon LLM Agents

加权记忆树:为长视野大语言模型智能体记住重要信息

Quang Dao, Purvi Kathalkar, Kenneth Eaton

机构 * Rose-Hulman Institute of Technology(罗斯-霍曼理工学院) Georgia Institute of Technology(佐治亚理工学院) Georgia Tech Research Institute(佐治亚理工学院研究院)

AI总结 提出加权记忆树(WMT)分层记忆系统,在GAIA-Text数据集上使LLM智能体准确率平均提升9.97个百分点、令牌用量减32.8%,可抑制低效用内容与不可靠信息传播。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20488 2026-08-24 cs.LG 新提交

Metag: A dataset to build agentic meta-reviewing capabilities

Metag:用于构建智能体元评审能力的数据集

Anirudh Sundar, Min Chen, Divya Tadimeti, Gemma Zhang, Alice Li, Nigel Boachie Kumankumah, Pavan Uttej Ravva, Sadid Hasan, Somya Chatterjee, Pruthvi Prakash Navada, Xiao Wang, Yue Kang, Sulaiman Vesal, Larry Heck

机构 * Georgia Institute of Technology(佐治亚理工学院) Microsoft(微软公司)

AI总结 本文推出Metag数据集,用于构建元评审智能体,助力元评审员快速确认作者对评审意见的回应及变更位置,提升同行评审透明度与可追溯性。

Comments 23 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20686 2026-08-24 cs.AI cs.LG cs.LO hep-ph 新提交

CDRL: Certification-Driven Reinforcement Learning for Neutrino Flavor Model Discovery

CDRL:用于中微子味模型发现的认证驱动强化学习

Piyush Jha, Jake Rudolph, Victoria Knapp-Pérez, Max Fieg, Aishik Ghosh, Vijay Ganesh

机构 * School of Physics, Georgia Institute of Technology(佐治亚理工学院物理学院) University of California, Irvine(加利福尼亚大学欧文分校) Halluminate(哈卢米奈特公司) Fermilab(费米国家加速器实验室) Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)

AI总结 本研究提出CDRL框架,利用符号推理工具的结构化反馈将失败证书转为可重用约束,在中微子味模型发现任务上,较现有RL方法大幅提升有效模型与中微子模型发现率,减少候选评估量,还可提取可解释规则作为软约束进一步提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏