MAESTRO: Multi-Agent Evaluation Suite for Testing, Reliability, and Observability
MAESTRO:多智能体评估套件用于测试、可靠性与可观测性
机构 * Beihang University(北航大学)
专题命中 代码评测 :repository(abstract);分类 cs.AI
AI总结 MAESTRO通过统一接口评估多智能体系统的测试、可靠性和可观测性,揭示架构对资源配置和性能权衡的核心影响。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
MAESTRO:多智能体评估套件用于测试、可靠性与可观测性
机构 * Beihang University(北航大学)
专题命中 代码评测 :repository(abstract);分类 cs.AI
AI总结 MAESTRO通过统一接口评估多智能体系统的测试、可靠性和可观测性,揭示架构对资源配置和性能权衡的核心影响。
LLMs中被忽视的安全漏洞:恶意智能优化算法请求及其突破
机构 * Xidian University(西安电子科技大学) ; Victoria University of Wellington(威灵顿维多利亚大学) ; Westlake University(西湖大学)
专题命中 代码评测 :code generation(abstract);分类 cs.CL
AI总结 本研究揭示了LLMs在恶意智能优化算法请求中的安全漏洞,提出MOBjailbreak方法并评估了其对主流模型的攻击效果,强调了对齐技术在防范滥用中的重要性。