CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs
CITBench:面向大语言模型的交互式表格数据处理综合基准
专题命中 Agent评测 :planning(abstract);分类 cs.AI
AI总结 本文提出 CITBench 交互式表格数据处理基准,评估发现现有 LLM 在简单表格任务表现良好,但在复杂多轮交互场景下的理解、规划与表格结构感知仍存在显著挑战。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
CITBench:面向大语言模型的交互式表格数据处理综合基准
专题命中 Agent评测 :planning(abstract);分类 cs.AI
AI总结 本文提出 CITBench 交互式表格数据处理基准,评估发现现有 LLM 在简单表格任务表现良好,但在复杂多轮交互场景下的理解、规划与表格结构感知仍存在显著挑战。
AgentHPOBench:用于评估LLM智能体作为序列超参数优化器的基准
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 AgentHPOBench是含30个任务的序列基准,用于评估LLM智能体的超参数优化能力,实验显示其在多领域有优化能力,但在迭代优化等方面存在局限。
LEMUR:基于偏好反馈的多目标强化学习对齐学习
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本研究提出LEMUR框架,通过联合学习策略与多目标奖励模型,从人类偏好反馈中学习平衡多目标的最优策略,其在基准多目标任务上性能优于基线方法。
MirrorCraft:Minecraft中隐藏规则变化下的配对评估
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 MirrorCraft是用于Minecraft隐藏规则变化下评估智能体的配对基准,实验发现规则集对隐藏规则变化的影响差异显著,未提供规则描述时ReAct表现最优,提供规则可适度提升任务表现。
手术风险分层与结局预测中缺失的内容:端到端机器学习方法的范围综述
专题命中 Agent评测 :workflow(abstract);分类 cs.LG
AI总结 本范围综述回顾190项研究,分析手术风险分层与结局预测的ML流程,发现数据、方法、评估等方面存在差距,为开发更严谨的围手术期ML工具提供参考。
Comments This work has been submitted to the IEEE JBHI for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible
用于磁共振成像多任务3D脑肿瘤分割的深度学习模型统一基准
机构 * Centro de Tecnologías de la Imagen (CTIM)(图像技术中心(CTIM)) ; Instituto Universitario de Cibernética, Empresas y Sociedad (IUCES)(网络、企业与社会大学研究所(IUCES)) ; University of Las Palmas de Gran Canaria(拉斯帕尔马斯大加那利大学)
专题命中 Agent评测 :planning(abstract);分类 cs.AI
AI总结 本研究构建统一基准,在相同条件下对比3D U-Net等5种深度学习模型在BraTS 2023、2024数据集上的脑肿瘤分割性能,明确了不同架构的准确率与效率权衡及适用场景。
Comments 27 pages, 16 figures, 8 tables
自监督技能优化
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 该研究提出自监督技能优化(SSO)框架,仅用未标注任务实例学习可复用技能,在封闭、开放任务上优于无真实标注的提示优化器,部分场景表现接近最强的基于真实标注的技能优化器。
基于扩展ICAP框架的协作对话认知投入度测量:人类标注、上下文学习与反思型大语言模型智能体的比较
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 本研究用扩展7点ICAP框架测量协作对话认知投入度,对比人类标注、ICL及反思型LLM智能体,发现人类标注信度更高,智能体方法具潜力,需强化人类标注与LLM方法的交互。
Comments Accepted as a full paper in the CogSci 2026 proceedings
模型链:面向偏见鲁棒性大语言模型评判器的跨模型审计
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 本研究针对LLM评判器的认知偏见问题,提出跨模型审计流程CoM,发现审计器身份的关键作用,制定偏见特异性审计器选择规则,在多模型多偏见实验中取得优于基线的准确率。
Comments WIP
Frontis-MA1:训练AI4AI模型以实现机器学习工程中的递归自我改进
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 该研究推出面向MLE中RSI研究的开源全栈系统OpenMLE,后训练Frontis-MA1(35B)作为元进化智能体,在多个基准测试中提升性能,相关模型与系统已开源。
选择性可信度受限的信念更新
机构 * University of the Peloponnese(伯罗奔尼撒大学) ; American University of the Middle East(中东美国大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文针对现有可信度受限信念更新无法处理复合认知输入部分可实现的问题,提出选择性可信度受限的信念更新,刻画其语义与公理,定义两类子类,证明框架通用性,提供统一且表达力更强的信念更新方案。
因果关系在算法追索中的作用
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Vector Institute(向量研究院) ; Drexel University(德雷塞尔大学) ; Leiden University(莱顿大学)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本研究针对算法追索仅关注翻转模型预测的缺陷,提出因果表演框架建模追索行动的因果传播,实验显示其优于标准方法并减少模型重训需求。
Tycho:面向ARC-AGI-3的基于可编程世界模型的主动抽象
机构 * Dresden University of Technology(德累斯顿工业大学) ; Amazon(亚马逊) ; TIB – Leibniz Information Centre for Science and Technology(莱布尼茨科学与技术信息中心) ; Leibniz University of Hannover(汉诺威莱布尼茨大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 针对ARC-AGI-3的交互式抽象问题,提出编码智能体系统Tycho,通过结构化观测构建游戏模型,选定策略下GPT-5.6 Sol与Opus 5可达成100%相对人类行动效率并完成全部关卡。
Comments 52 pages, 18 figures, 17 tables. Open-source implementation: https://github.com/NIMI-research/Tycho
基于世界模型的具身智能安全性:威胁、防御与评估的生命周期
专题命中 Agent评测 :planning(abstract);分类 cs.AI
AI总结 本综述针对基于世界模型的具身智能,梳理其生命周期内的各类安全威胁,提出分类法与评估协议,并从多维度构建防御体系,同时指出世界模型兼具安全护盾与安全错觉的双重属性。
DataClawEval:面向真实工业场景的数据工程智能体基准测试
机构 * Tencent(腾讯) ; Xidian University(西安电子科技大学) ; South China Normal University(华南师范大学)
专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI
AI总结 DataClawEval是首个针对真实工业数据工程场景的智能体基准,含100项跨5种引擎的任务,用确定性脚本评分,评估16个前沿智能体发现最强模型仅得74.9分,自主数据工程仍是挑战。
Rehearse:从自改进自动研究中的置信度悬崖后退
机构 * Tencent(腾讯)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 该研究发现自动研究中存在置信度悬崖问题,提出Rehearse方法通过聚焦过往尝试结果记忆提升判断准确率,在三个任务的4000次训练运行预算下改善了终点性能。
大语言模型能否解决真实的Java合并冲突?一项使用校准后的LLM作为评判者的评估
专题命中 Agent评测 :agent(abstract);分类 cs.SE
AI总结 该研究针对真实Java合并冲突,构建仅用推理信号的LLM求解器,经校准的LLM评判者评估发现,其解决冲突的覆盖和匹配开发者方案的表现优于传统工具AutoMerge,但结构正确性仍需确定性检查保障。
面向视觉语言赋能的无人机分类与灾害响应的系统工程框架
机构 * University of Arkansas(阿肯色大学) ; University of Michigan-Dearborn(密歇根大学迪尔伯恩分校)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 该研究提出将视觉语言模型(VLMs)作为协同智能体嵌入人-无人机回路的系统工程框架,经评估可降低人因负担、提升AI信任度,推进了高风险灾害响应的人-自主系统协同。
Comments 10 pages, 8 figures. Author accepted manuscript of AIAA Paper 2026-4010, published in the AIAA AVIATION 2026 Forum
Journal ref AIAA AVIATION 2026 Forum, AIAA Paper 2026-4010, 2026
PAUSE:统一服务环境中面向用户的个人AI助手基准测试
机构 * University of Alberta(阿尔伯塔大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 研究人员针对现有个人AI助手基准测试的缺陷,提出PAUSE基准测试,采用多机制评估框架,实验发现现有先进模型在相关场景任务完成率不足70%,还提出可扩展生成任务的合成流水线。
AgentS4D:基于大语言模型的工作空间智能体执行生命周期内运行时风险基准
专题命中 Agent评测 :agent(abstract);分类 cs.SE
AI总结 研究推出AgentS4D基准,评估20种智能体配置在328个风险案例中的表现,发现任务完成不代表安全,需跨风险条件完整评估智能体配置。
FAVA:基于证据支持的权限图的经验证智能体的形式化授权
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 FAVA是一种用于智能体执行的带权限授权框架,通过LLM引导的权限IR、证据支持的权限图和SMT授权器保障安全,在多场景评估中达90.5%决策合规率,可拦截动态违规迹。
PowerAtlas:面向电力系统的电-计算协同调度
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; State Grid Liaoning Electric Power Co., Ltd.(国网辽宁省电力有限公司) ; Nanyang Technological University(南洋理工大学)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 PowerAtlas是用于电-计算协同调度的LLM智能体框架,整合多类约束生成可行方案,构建含2000个实例的ECBench基准,在11种LLM上验证了有效性。
Comments 17 pages, 9 figures, 5 tables. Code: https://github.com/JAVA-Jiang/PowerAtlas
多样性约束下的参数化公平资源分配
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出PRA及自适应变体APRA框架,将多样性约束下的资源分配从硬性条件优化转为柔性参数调节,兼顾公平性与效率,在真实应用中性能优于现有基准。
超越认知:认知分裂症与作为技术符号机器的大语言模型
机构 * Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)
专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI
AI总结 研究大语言模型输出致“认知症”现象,挑战其解释框架。借鉴相关哲学,将大语言模型视为技术符号机器,指出“认知症”是“认知分裂症”后果,强调相关单元是整个实践,为新设计方案奠定基础。
CogEEGAgent:通过基于执行和选择感知验证实现自主认知脑电图分析
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 研究针对认知EEG分析需专业知识及选择多的问题,提出基于MNE-Python的CogEEGAgent代理,LLM解释意图,确定性组件验证控制,在基准测试等中表现良好,建立了有限自主性和可审计自动化框架。
Comments 16 pages, 5 figures, and 16 tables. The supplementary material is included in the same PDF
在启发式自我改进智能体中自我编写的验证不可靠
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 研究启发式自我改进智能体中自我编写验证不可靠的问题,引入密封外部接受循环(SEAL)方法,通过实验发现该问题在启发式学习中常现,自我验证失败按能力分层,SEAL性能优于无保护基线。
Comments 9 pages, 6 figures
用于心理健康的金融数字表型分析的计算伦理框架
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 针对人工智能驱动数字表型系统伦理治理难题,提出计算伦理框架,将伦理要求形式化为道义时态逻辑约束,通过金融数据和心理健康案例研究,用Z3求解器建模验证关键伦理属性,实现持续机器可验证伦理检查,支持相关系统发展。
Comments Accepted at the CIBB 2026 conference (https://cibb2026.teralab.ai/)
INS-ActBench:一个用于评估大语言模型专业精算能力的综合基准
机构 * Fudan University(复旦大学)
专题命中 Agent评测 :tool use(abstract);分类 cs.CL
AI总结 介绍INS-ActBench这一综合基准评估大语言模型专业精算能力,含12050个问答对及三个子集,通过实验揭示前沿大语言模型在不同方面的能力表现,为精算大语言模型开发提供可重复基础。
Comments 18 pages, including appendices; 11 figures and 12 tables
SeekJudge:计算机使用智能体强化学习的实用奖励框架
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 针对计算机使用智能体强化学习中轨迹指令判断问题,提出SeekJudge框架,通过四个智能体循环裁决,用种子校准蒸馏管道训练共享主干模型,该框架在在线RL中匹配或超原生规则监督,还有诸多优势并改进奖励服务器,使模型奖励成实用替代品。
少即是多:用于DeepGlobe卫星土地覆盖分割的轻量级卷积神经网络的受控基准测试
专题命中 Agent评测 :planning(abstract);分类 cs.LG
AI总结 研究在DeepGlobe数据集上比较VGG16等五种架构用于卫星土地覆盖分割,经三个迭代分离相关因素,采用相同预处理等协议。结果显示MobileNetV2_v1表现优,轻量级迁移学习模型在资源受限遥感环境中可匹配或超越更深模型,利于土地覆盖映射。
Comments 18 Figures, 8 Tables & 33 Pages