Humans are Missing from AI Coding Agent Research
AI编码智能体研究中缺失了人类
AI总结 该文指出AI编码智能体研究当前缺失人类维度,主张转向以人为中心的编码智能体,明确了人机交互的四个核心层面并提出相关研究方向。
作者
Natural Language Processing
AI编码智能体研究中缺失了人类
AI总结 该文指出AI编码智能体研究当前缺失人类维度,主张转向以人为中心的编码智能体,明确了人机交互的四个核心层面并提出相关研究方向。
基础的裂痕:看似微小的架构选择会影响长上下文扩展
机构 * Ai2 ; Carnegie Mellon University(卡内基梅隆大学) ; University of Washington(华盛顿大学)
AI总结 该研究发现,Olmo、Llama、Qwen等稠密模型系列的四个微小架构决策会复合降低长上下文性能,结合三个及以上选择可使性能降47%,经17万余GPU小时训练发布OlmPool,其部分模型长上下文性能优于Llama 3。
Comments 29 pages; accepted to COLM 2026
PACE:智能体能力评估的代理框架
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Salesforce AI Research(Salesforce人工智能研究)
AI总结 提出PACE框架,通过从非智能体评测中选取原子实例构建代理基准,以低成本高精度预测智能体基准性能,在14个模型上实现MAE<4%、Spearman>0.80。
Decomposer: 学习将符号音乐反编译为程序
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出Decomposer框架,通过两阶段方法(合成数据微调+强化学习优化)将符号音乐反编译为可读、可编辑的程序,在MIDI重建保真度和代码可读性上优于基线。
Comments Project page: https://yewon-kim.com/decomposer
PPT-Eval: 面向PowerPoint任务的计算机使用智能体基准
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Microsoft(微软) ; UMass Amherst(马萨诸塞大学阿默斯特分校) ; Google(谷歌) ; Snowflake
AI总结 提出PPT-Eval基准,包含120个PowerPoint任务,并设计基于评分标准的评估框架,通过部分评分和自然语言反馈衡量智能体表现,发现现有最强模型仅达45%成功率。
Comments Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026
离散化奖励模型
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Meta Superintelligence Labs(Meta超级智能实验室)
AI总结 针对奖励模型过度敏感导致策略不佳的问题,提出一种基于蒙特卡洛dropout的无训练离散化算法,在保持判别能力的同时降低过度敏感性,减少奖励黑客行为并提升策略效果。
基于LLM并行文本生成的低延迟实时音频游戏解说系统
机构 * The University of Tokyo(东京大学) ; National Institute of Advanced Industrial Science and Technology(产业技术综合研究所) ; Technical University of Munich(慕尼黑工业大学) ; Keio University(庆应义塾大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Nara Women’s University(奈良女子大学)
AI总结 提出一种并行文本生成与语音播放的低延迟实时游戏解说系统,将平均句间静默从9.6秒降至0.3秒,显著提升解说节奏。
Comments Accepted at IJCAI-ECAI 2026 (Demonstrations Track)