Qiskit QuantumKatas: Adapting Microsoft's Quantum Computing exercises for LLM evaluation
Qiskit QuantumKatas: 为LLM评估改编微软的量子计算练习
机构 * IBM Research(IBM研究院)
AI总结 本文将微软的QuantumKatas量子计算课程从Q#移植到Qiskit,并构建评估框架,用于系统评估大型语言模型在量子计算任务上的能力。
大厂专区
Qiskit QuantumKatas: 为LLM评估改编微软的量子计算练习
机构 * IBM Research(IBM研究院)
AI总结 本文将微软的QuantumKatas量子计算课程从Q#移植到Qiskit,并构建评估框架,用于系统评估大型语言模型在量子计算任务上的能力。
大规模智能体系统渗透测试的经验教训
机构 * IBM Research(IBM研究院)
AI总结 本文通过对2025年专有智能体产品的两次渗透测试,评估了AI智能体的安全态势是否有所改善,并指出许多安全漏洞并非全新,而是反映了先前计算系统中长期存在的重复性弱点类别。
Comments Accepted at SAGAI 2026
超越最终答案:多智能体工业工作流中的轨迹级幻觉审计
机构 * IBM ; Columbia University(哥伦比亚大学)
AI总结 提出Trajel数据集和评估框架,通过五类幻觉分类法审计多智能体工业工作流中的轨迹级幻觉,发现现有基准忽略的常见失败模式,并证明轨迹感知检测优于标准事后验证。
JobBench:使智能体工作符合人类意愿
机构 * University of Washington(华盛顿大学) ; University of California, Santa Barbara(加州大学圣芭芭拉分校) ; Stanford University(斯坦福大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Northwestern University(西北大学) ; University of Notre Dame(圣母大学) ; University of California, Berkeley(加州大学伯克利分校) ; Michigan State University(密歇根州立大学) ; MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) ; Bake AI ; King Abdulaziz City for Science and Technology(国王阿卜杜勒阿齐兹科技城) ; Western Washington University(西雅图华盛顿大学) ; University of Chicago(芝加哥大学)
AI总结 提出JobBench基准,通过专家识别的高优先级工作流程评估AI智能体,以人类需求为中心而非经济价值,覆盖35个职业的130个任务,使用事实锚定的评分链评估,最强模型仅达45.9%,旨在推动从替代到增强的劳动力市场影响。
通过QLoRA微调将工具知识内化到小型语言模型中
机构 * Columbia School of General Studies, Columbia University, NY, USA(哥伦比亚大学泛研学院) ; Columbia Engineering, Columbia University, NY, USA(哥伦比亚大学工程学院) ; IBM Research, NY, USA(IBM研究院)
AI总结 本文研究通过QLoRA参数高效微调将工具知识内化到小型语言模型中,在AssetOpsBench基准上,微调后的Gemma 4 E4B和Qwen3-4B模型在无描述推理下优于有完整工具描述的未微调基线,输入长度减少82.6%,规划分数提升。