JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution
JIT-Agent:通过即时测试框架演进扩展测试框架智能
机构 * LV-NUS Lab(LV-NUS实验室)
AI总结 JIT-Agent是首个专为即时生成智能体测试框架设计的模型,可定制、修复、自我演进测试框架,提升DeepSeek、GLM等模型在多基准任务的性能,确立测试框架智能为智能体能力的独立可扩展维度。
高校专区
JIT-Agent:通过即时测试框架演进扩展测试框架智能
机构 * LV-NUS Lab(LV-NUS实验室)
AI总结 JIT-Agent是首个专为即时生成智能体测试框架设计的模型,可定制、修复、自我演进测试框架,提升DeepSeek、GLM等模型在多基准任务的性能,确立测试框架智能为智能体能力的独立可扩展维度。
智能体游戏开发:用于扩展世界模型的可验证轨迹数据引擎
机构 * Cardinal AI Lab(卡迪纳尔人工智能实验室) ; University of California, Berkeley(加州大学伯克利分校) ; Hong Kong University of Science and Technology(香港科技大学) ; National University of Singapore(新加坡国立大学) ; HPC-AI Lab(高性能计算与人工智能实验室)
AI总结 本文指出扩展世界模型的传统策略效率低,提出将游戏开发作为可验证轨迹数据引擎,构建RLHEV后训练范式,为空间世界模型提供高质量奖励信号与长程轨迹数据。
ReliableRAG:通过可靠性引导推理链对抗检索增强生成中的错误信息
机构 * College of Software, Jilin University(吉林大学软件学院) ; College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) ; Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education, College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院 教育部符号计算与知识工程重点实验室) ; College of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院) ; National University of Singapore(新加坡国立大学) ; School of Computer Science, Zhuhai College of Science and Technology(珠海科技学院计算机学院)
AI总结 ReliableRAG是首个通过细粒度评估三元组缓解多跳问答中欺骗性错误信息的可靠性驱动框架,可提升RAG系统的事实可靠性与鲁棒性。