SONAR: Task-Aware Code Summary Evaluation for LLM Consumers Without References
SONAR:面向LLM使用者的任务感知型代码摘要评估框架(无需参考摘要)
专题命中 Agent评测 :agent(abstract);分类 cs.SE
AI总结 该研究提出无需参考摘要的SONAR框架,从四个维度评估代码摘要,发现正确性、抽象性对LLM性能影响显著,简洁性、流畅性影响微弱,还明确了不同LLM在各维度的优劣。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
SONAR:面向LLM使用者的任务感知型代码摘要评估框架(无需参考摘要)
专题命中 Agent评测 :agent(abstract);分类 cs.SE
AI总结 该研究提出无需参考摘要的SONAR框架,从四个维度评估代码摘要,发现正确性、抽象性对LLM性能影响显著,简洁性、流畅性影响微弱,还明确了不同LLM在各维度的优劣。
AgentAntibody:一种用于防御大语言模型(LLM)智能体提示注入的自适应免疫系统
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 针对LLM智能体的提示注入威胁,受自适应免疫启发提出AgentAntibody,通过持久抗体库识别威胁并进化增强防御,实验显示其在防有害行为同时保留合法任务完成上优于现有防御。
Comments 7 pages
当智能体学会成为你:对角色技能中的隐私泄露、冒充风险及防御措施进行基准测试
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 该研究推出AntiSkillBench基准,评估角色技能流程的隐私泄露、冒充风险及防御,发现风险持续存在,现有防御效果有限,为相关技能开发提供基准。
Comments Project page: https://yonglixiang.github.io/AntiSkillBench
DataSpace:针对异构工作空间可验证分析的数据智能体基准测试
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 该研究推出DataSpace基准,用于评估异构工作空间下数据智能体的可验证分析能力,包含多类型任务与数据,实验揭示了智能体框架、多模态集成等对准确率的影响,为提升数据智能体可靠性指明了方向。
Comments 8 pages of main text, 7 figures, with a supplementary appendix
TimeRLM:递归语言模型可实现长时序数据中的精准异常定位
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 提出TimeRLM(基于递归语言模型的时序异常定位框架),结合强化学习后训练后,在合成基准AnomalyXL及真实世界数据上,均优于现有时序语言模型,可实现长时序数据的精准异常定位。
Comments Open source code and datasets: https://github.com/OpenTSLM/TimeRLM
基于水平集成本感知贝叶斯优化的灾后自动化快速损伤评估自适应采样
机构 * School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院) ; University of Florida(佛罗里达大学) ; Stevens Institute of Technology(史蒂文斯理工学院)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 针对灾后损伤评估的传统方法成本高且难以适应动态条件,本研究提出结合水平集估计的成本感知贝叶斯优化框架,引导自主数据采集器流向高信息区域,经模拟和R2D数据验证可高效评估损伤以支持应急响应。
Comments 11 pages, 7 figures, 1 table. Accepted at the SIAM International Conference on Data Mining (SDM) 2026
无实体的溯因推理?科学假说生成的表征奠基与溯因循环
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出无需实体的科学溯因推理,构建含弃权机制的溯因循环架构,以惯例空间解决跨领域检索难题,通过案例抽象架构并提出DAB-30基准作为评估方案。
Comments 20 pages, 4 figures. DAB-30 execution reported in companion paper
为什么大型语言模型在表格预测任务中表现不佳
机构 * Fundamental Technologies(基础技术) ; Voylab
专题命中 Agent评测 :agentic(abstract);分类 cs.LG
AI总结 该研究探究通用大型语言模型(LLM)在表格预测任务中表现不佳的原因,通过控制实验排除了数据噪声、CSV格式等因素,发现维度是关键,LLM准确率随维度增长下降,而经典基线方法不受影响。
PredAct-Bench:可控工具噪声下的工具增强对话基准
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 该研究推出PredAct-Bench基准,以教育为测试平台评估带噪声工具的对话智能体,扩展信任校准指标并评估13种LLMs,发现当前模型无法在工具噪声下为教师提供足够可见性,助力构建更优AI决策支持系统。
SKT:通过经过验证的合成数据生成实现规模化的技能使用训练
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 该研究提出SKT这一经过验证的规模化技能使用训练合成数据生成流程,构建SkillEval基准,实验证实其生成轨迹的监督微调可提升多模型技能使用性能,验证了方法的有效性与可扩展性。
Comments 24 pages,8 figures, Version 1
Doc2CI:基于大语言模型的CI配置生成多服务研究
专题命中 Agent评测 :workflow(abstract);分类 cs.SE
AI总结 本文通过构建DOC2CI基准评估LLM生成CI配置的能力,发现其结构有效性不足,提出无需训练的模式引导修复方法提升有效性,为相关工具开发提供依据。
大型语言模型可提高医师准确率,但会导致错误依赖
专题命中 Agent评测 :agentic(abstract);分类 cs.AI
AI总结 本研究开发智能体式检索增强型LLM CORA,发现其可将46名医师的诊断准确率从70.8%提升至82.6%,但存在错误答案获引用支持时医师抵抗大幅下降的安全风险。
Slides2MindMap:从课程幻灯片重建认知高效的知识层次结构
专题命中 Agent评测 :agentic(abstract);分类 cs.AI
AI总结 本研究提出Slides2MindMap任务,引入含12774张幻灯片的S2M-Bench基准,提出AutoMindMap智能体框架,实验证明其在基准上优于基线且鲁棒性强,具备教学应用价值。
CITBench:面向大语言模型的交互式表格数据处理综合基准
专题命中 Agent评测 :planning(abstract);分类 cs.AI
AI总结 本文提出 CITBench 交互式表格数据处理基准,评估发现现有 LLM 在简单表格任务表现良好,但在复杂多轮交互场景下的理解、规划与表格结构感知仍存在显著挑战。
AgentHPOBench:用于评估LLM智能体作为序列超参数优化器的基准
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 AgentHPOBench是含30个任务的序列基准,用于评估LLM智能体的超参数优化能力,实验显示其在多领域有优化能力,但在迭代优化等方面存在局限。
LEMUR:基于偏好反馈的多目标强化学习对齐学习
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本研究提出LEMUR框架,通过联合学习策略与多目标奖励模型,从人类偏好反馈中学习平衡多目标的最优策略,其在基准多目标任务上性能优于基线方法。
MirrorCraft:Minecraft中隐藏规则变化下的配对评估
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 MirrorCraft是用于Minecraft隐藏规则变化下评估智能体的配对基准,实验发现规则集对隐藏规则变化的影响差异显著,未提供规则描述时ReAct表现最优,提供规则可适度提升任务表现。
手术风险分层与结局预测中缺失的内容:端到端机器学习方法的范围综述
专题命中 Agent评测 :workflow(abstract);分类 cs.LG
AI总结 本范围综述回顾190项研究,分析手术风险分层与结局预测的ML流程,发现数据、方法、评估等方面存在差距,为开发更严谨的围手术期ML工具提供参考。
Comments This work has been submitted to the IEEE JBHI for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible
用于磁共振成像多任务3D脑肿瘤分割的深度学习模型统一基准
机构 * Centro de Tecnologías de la Imagen (CTIM)(图像技术中心(CTIM)) ; Instituto Universitario de Cibernética, Empresas y Sociedad (IUCES)(网络、企业与社会大学研究所(IUCES)) ; University of Las Palmas de Gran Canaria(拉斯帕尔马斯大加那利大学)
专题命中 Agent评测 :planning(abstract);分类 cs.AI
AI总结 本研究构建统一基准,在相同条件下对比3D U-Net等5种深度学习模型在BraTS 2023、2024数据集上的脑肿瘤分割性能,明确了不同架构的准确率与效率权衡及适用场景。
Comments 27 pages, 16 figures, 8 tables
自监督技能优化
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 该研究提出自监督技能优化(SSO)框架,仅用未标注任务实例学习可复用技能,在封闭、开放任务上优于无真实标注的提示优化器,部分场景表现接近最强的基于真实标注的技能优化器。
基于扩展ICAP框架的协作对话认知投入度测量:人类标注、上下文学习与反思型大语言模型智能体的比较
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 本研究用扩展7点ICAP框架测量协作对话认知投入度,对比人类标注、ICL及反思型LLM智能体,发现人类标注信度更高,智能体方法具潜力,需强化人类标注与LLM方法的交互。
Comments Accepted as a full paper in the CogSci 2026 proceedings
模型链:面向偏见鲁棒性大语言模型评判器的跨模型审计
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 本研究针对LLM评判器的认知偏见问题,提出跨模型审计流程CoM,发现审计器身份的关键作用,制定偏见特异性审计器选择规则,在多模型多偏见实验中取得优于基线的准确率。
Comments WIP
Frontis-MA1:训练AI4AI模型以实现机器学习工程中的递归自我改进
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 该研究推出面向MLE中RSI研究的开源全栈系统OpenMLE,后训练Frontis-MA1(35B)作为元进化智能体,在多个基准测试中提升性能,相关模型与系统已开源。
选择性可信度受限的信念更新
机构 * University of the Peloponnese(伯罗奔尼撒大学) ; American University of the Middle East(中东美国大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文针对现有可信度受限信念更新无法处理复合认知输入部分可实现的问题,提出选择性可信度受限的信念更新,刻画其语义与公理,定义两类子类,证明框架通用性,提供统一且表达力更强的信念更新方案。
因果关系在算法追索中的作用
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Vector Institute(向量研究院) ; Drexel University(德雷塞尔大学) ; Leiden University(莱顿大学)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本研究针对算法追索仅关注翻转模型预测的缺陷,提出因果表演框架建模追索行动的因果传播,实验显示其优于标准方法并减少模型重训需求。
Tycho:面向ARC-AGI-3的基于可编程世界模型的主动抽象
机构 * Dresden University of Technology(德累斯顿工业大学) ; Amazon(亚马逊) ; TIB – Leibniz Information Centre for Science and Technology(莱布尼茨科学与技术信息中心) ; Leibniz University of Hannover(汉诺威莱布尼茨大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 针对ARC-AGI-3的交互式抽象问题,提出编码智能体系统Tycho,通过结构化观测构建游戏模型,选定策略下GPT-5.6 Sol与Opus 5可达成100%相对人类行动效率并完成全部关卡。
Comments 52 pages, 18 figures, 17 tables. Open-source implementation: https://github.com/NIMI-research/Tycho
基于世界模型的具身智能安全性:威胁、防御与评估的生命周期
专题命中 Agent评测 :planning(abstract);分类 cs.AI
AI总结 本综述针对基于世界模型的具身智能,梳理其生命周期内的各类安全威胁,提出分类法与评估协议,并从多维度构建防御体系,同时指出世界模型兼具安全护盾与安全错觉的双重属性。
DataClawEval:面向真实工业场景的数据工程智能体基准测试
机构 * Tencent(腾讯) ; Xidian University(西安电子科技大学) ; South China Normal University(华南师范大学)
专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI
AI总结 DataClawEval是首个针对真实工业数据工程场景的智能体基准,含100项跨5种引擎的任务,用确定性脚本评分,评估16个前沿智能体发现最强模型仅得74.9分,自主数据工程仍是挑战。
Rehearse:从自改进自动研究中的置信度悬崖后退
机构 * Tencent(腾讯)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 该研究发现自动研究中存在置信度悬崖问题,提出Rehearse方法通过聚焦过往尝试结果记忆提升判断准确率,在三个任务的4000次训练运行预算下改善了终点性能。
大语言模型能否解决真实的Java合并冲突?一项使用校准后的LLM作为评判者的评估
专题命中 Agent评测 :agent(abstract);分类 cs.SE
AI总结 该研究针对真实Java合并冲突,构建仅用推理信号的LLM求解器,经校准的LLM评判者评估发现,其解决冲突的覆盖和匹配开发者方案的表现优于传统工具AutoMerge,但结构正确性仍需确定性检查保障。