Plan Verification for LLM-Based Embodied Task Completion Agents
基于大语言模型的体感任务完成代理的计划验证
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 本文提出基于自然语言提示的体感任务代理计划验证框架,通过迭代修正提升动作序列质量,实现高召回率和精确度。
高校专区
基于大语言模型的体感任务完成代理的计划验证
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 本文提出基于自然语言提示的体感任务代理计划验证框架,通过迭代修正提升动作序列质量,实现高召回率和精确度。
一种自适应的、解耦的表示方法用于多维MRI重建
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 本文提出了一种自适应解耦的多维MRI重建方法,通过学习特征表示和潜在扩散模型,实现无需任务特定训练的高效重建。
SoundnessBench: 一种用于神经网络验证器的声学基准
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Georgia Institute of Technology(佐治亚理工学院) ; Duke University(杜克大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of California, Riverside(加州大学河滨分校)
AI总结 SoundnessBench通过构建包含隐藏反例的基准,用于评估神经网络验证器的正确性。
Comments TMLR (December 2025)
MM-SpuBench:迈向更好地理解多模态大语言模型中伪偏差的深入研究
机构 * University of Virginia(弗吉尼亚大学) ; Purdue University(普渡大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 MM-SpuBench通过分析多模态大语言模型中的伪偏差,揭示其存在与缓解的挑战,提供公开基准以促进相关技术发展。
Comments Accepted at KDD 2026 (Dataset and Benchmark Track)
为LLM代理强制执行时间约束
机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Illinois at Urbana-Champaign, USA(伊利诺伊大学厄巴纳-香槟分校,美国) ; Meta
AI总结 Agent-C通过运行时保证确保LLM代理遵守时间安全属性,提高任务实用性并实现完美安全性。