PATS: Policy-Aware Training Scaffolding for Agentic Reinforcement Learning
PATS:用于智能体强化学习的策略感知训练框架
专题命中 评测与基准 :LLM(abstract);分类 cs.AI
AI总结 研究针对长期语言模型智能体强化学习中弱策略问题,提出以策略为中心的训练范式Pats,将技能作为动态训练框架,通过转换展开组为证据卡、特定任务评估调整上下文等改进策略,在多个任务上取得良好效果。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
PATS:用于智能体强化学习的策略感知训练框架
专题命中 评测与基准 :LLM(abstract);分类 cs.AI
AI总结 研究针对长期语言模型智能体强化学习中弱策略问题,提出以策略为中心的训练范式Pats,将技能作为动态训练框架,通过转换展开组为证据卡、特定任务评估调整上下文等改进策略,在多个任务上取得良好效果。
AfriEconQA:基于世界银行报告的非洲经济分析基准数据集
机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)
专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL
AI总结 AfriEconQA是一个基于世界银行报告的非洲经济分析基准数据集,旨在测试信息检索和RAG系统在处理复杂经济查询时的性能。
Comments Dataset Explorer: https://afrieconqa.pages.dev/
面向社交媒体中统一的多模态虚假信息检测:基准数据集与基线模型
机构 * School of Computer Science and Information Engineering, Hefei University of Technology(计算机科学与信息工程学院,合肥工业大学) ; School of Computer Science and Technology, Northwestern Polytechnical University(计算机科学与技术学院,西北工业大学)
专题命中 评测与基准 :language model(abstract);分类 cs.AI
AI总结 该研究构建了含9.8万样本的OmniFake基准数据集,提出UMFDet框架,实现对人工与AI生成两类多模态虚假内容的统一检测,性能优于专用基线。
交互式奖励智能体:通过环境状态验证进行图形用户界面任务评估
专题命中 评测与基准 :post-training(abstract);分类 cs.AI
AI总结 研究图形用户界面任务评估难题,提出交互式奖励智能体IRA,基于提议验证框架,结合可见界面与环境状态证据。IRA在GUI-RewardBench基准测试中准确率达86.9%,应用于强化学习时实现34.0%的OSWorld成功率,能为训练图形用户界面智能体提供有效奖励信号。
FilmBench:用于电影视频生成的电影级基准测试
机构 * Alibaba Group(阿里巴巴集团) ; Moku Lab, Hujing Digital Media & Entertainment Group(魔氪实验室,虎鲸数字媒体与娱乐集团) ; Beijing Film Academy(北京电影学院)
专题命中 评测与基准 :LLM(abstract);分类 cs.AI
AI总结 FilmBench是基于电影学院传统专业电影语言开发的文本到视频和参考到视频基准测试。它从获奖影片反向设计提示,依电影分类法评估,开发自动评估代理并开源核心套件,能再现人类模型排名,指出当前模型在动态美学等方面不足。
VendorBench-100:用于深度伪造图像检测的统一跨范式基准测试
机构 * Universidade da Beira Interior(贝拉内斯大学) ; Shri Guru Buddhi Swami College(什里·古鲁·布迪·斯瓦米学院) ; Swami Ramanand Tirtha Marathwada University(斯瓦米拉曼南德·蒂尔塔马哈拉施特拉大学)
专题命中 评测与基准 :language model(abstract);分类 cs.AI
AI总结 研究针对深度伪造图像检测的三种范式缺乏通用评估的问题,提出VendorBench-100基准测试,用统一框架评估36个模型,强调现实场景,通过MCC排名,发现ROC-AUC与MCC有差异,还发布评估框架和结果助力后续研究。
Comments Fixed scoring-normalization error in Neural Defend/TruthScan results, revising the central finding: MCC and ROC-AUC are strongly correlated (r ~ 0.86) overall, with only a specific subset showing one-directional threshold miscalibration. Abstract, tables, Discussion, Conclusion updated
TabPFN扩展在可解释地质建模中的应用
机构 * Department of Civil and Environmental Engineering, Tohoku University(东北大学土木环境工程系) ; Research Organization of Information and Systems, The Institute of Statistical Mathematics(信息与系统研究所统计数学研究所) ; Department of Statistical Science, The Graduate University for Advanced Studies(高级研究大学统计科学系)
专题命中 评测与基准 :foundation model(abstract);分类 cs.LG
AI总结 本文评估了TabPFN及其扩展库在地质任务中的表现,通过土壤类型分类和参数迭代填补,展示了TabPFN在不确定性量化和可解释性方面的优势。
Journal ref Georisk: Assessment and Management of Risk for Engineered Systems and Geohazards (2026) 1-20
批量自适应因果标注
机构 * UC Berkeley(加州大学伯克利分校) ; Fordham University(福特汉姆大学) ; University of Southern California(南加州大学)
专题命中 评测与基准 :LLM(abstract);分类 cs.LG
AI总结 本文提出一种批量自适应方法,通过优化数据采样策略提高因果效应估计效率,减少标注成本,实验证明在缺失数据下能显著降低均方误差。
Comments Extended journal version. A preliminary version was accepted to AISTATS 2026
海王星:用于复杂多相流基准测试的综合机器学习框架
专题命中 评测与基准 :foundation model(abstract);分类 cs.AI
AI总结 针对冲击驱动的可压缩多相流基准测试难题,介绍含2.4TB数据集的Neptuna框架,评估多种替代模型家族,研究复合损失与自适应损失平衡,结果显示无单一模型最优,复合损失及SoftAdapt策略有显著改进。
从业者如何构建软件工程代理?来自混合方法研究的见解
专题命中 评测与基准 :LLM(abstract);分类 cs.AI
AI总结 本文通过混合方法研究从业者构建软件工程代理的方式,发现随着实现成本降低瓶颈转移,刻画了七阶段工作流程和评估驱动开发转变,还识别出团队面临的六个挑战及应对实践。
一个用于检测 GPT-Image-2 生成的含丰富文本图像的多领域基准
机构 * College of Computer Science(计算机科学学院)
专题命中 评测与基准 :language model(abstract);分类 cs.AI
AI总结 针对现有基准缺乏文本丰富图像检测的问题,构建了包含8602张图像、覆盖6个类别的多领域基准,评估5种检测器,发现性能高度依赖领域且易受JPEG压缩影响。
AgentFAIR:用于地理空间数据集公平性评估的多智能体协作框架
机构 * The University of Melbourne(墨尔本大学)
专题命中 评测与基准 :LLM(abstract);分类 cs.AI
AI总结 研究地理空间数据集公平性评估难题,提出AgentFAIR多智能体框架,结合结构化元数据提取与特定子原则语言模型评估器,给出各项评估结果,支持可审计性与可行性,不过受限于多种因素对准确性和泛化性声明有约束。
NVIDIA OmniDreams:用于闭环自动驾驶仿真的实时生成式世界模型
专题命中 评测与基准 :post-training(abstract);分类 cs.AI
AI总结 提出OmniDreams,一个基于Cosmos扩散模型训练的基础生成式世界模型,通过自回归生成动作条件视频,实现闭环仿真中复杂长尾场景的实时合成,并验证其在策略模型训练中的有效性。
超越文本到SQL:LLMs真的能调试企业级ETL SQL吗?
机构 * ByteDance Inc.(字节跳动公司)
专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI
AI总结 本文提出OurBench基准测试,用于评估LLMs在企业级SQL推理和调试中的性能,发现现有模型在复杂SQL错误检测上表现有限,需进一步改进。
开放技能风险:使用现实世界中的危险第三方技能时对智能体安全性进行基准测试
专题命中 评测与基准 :LLM(abstract);分类 cs.CL
AI总结 研究基于语言模型的智能体使用第三方危险技能时的安全问题,构建OpenSkillRisk基准测试,涵盖多种不安全场景并能细粒度分析。实验发现当前系统处理危险技能能力不足,揭示三种失败模式,强调需改进语言模型风险推理和智能体框架执行控制。
零样本神经先验用于可泛化的跨被试和跨任务脑电解码
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 评测与基准 :foundation model(abstract);分类 cs.LG
AI总结 针对脑电信号跨被试和跨任务泛化难题,提出零样本解码框架,采用渐进解冻策略微调Transformer,在大型数据集上实现优于基线的性能。
Comments EEG Decoding research
对视觉变换器的去学习进行基准测试
机构 * University of Warwick, United Kingdom(沃里克大学)
专题命中 评测与基准 :post-training(abstract);分类 cs.AI
AI总结 本研究首次对视觉变换器的去学习算法进行基准测试,评估不同数据集、算法和协议的影响,揭示了VTs在记忆训练数据方面的特性及性能基线。
Comments Accepted at CoLLAs 2026 (Oral Presentation)
基于全切片图像的基因表达预测的深度回归模型的评估与预后验证
专题命中 评测与基准 :foundation model(abstract);分类 cs.LG
AI总结 研究对基于全切片图像的基因表达预测的深度回归模型进行评估与验证,采用基于注意力的多实例学习与PFM特征提取器的直接回归,在多个数据集及队列中验证,证明该方法可泛化并恢复有意义分子结构,支持其用于转录组表型分析和风险分层。
传统隐私政策分析工具针对大语言模型的系统评估
机构 * University of South Florida(佛罗里达州立大学) ; IBM T.J. Watson Research Center(IBM 汤普森研究中心)
专题命中 评测与基准 :prompting(abstract);分类 cs.CL
AI总结 本文系统评估现成大语言模型能否取代专业隐私分析工具,研究六个具三种主要功能及三个中间任务的工具,对比两个先进大语言模型与工具性能,发现大语言模型在隐私政策和法规分析功能上能匹配或超越现有工具。
FreyaTTS技术报告
专题命中 评测与基准 :post-training(abstract);分类 cs.CL
AI总结 介绍无分词器的土耳其语文本转语音模型Freya-TTS,通过无规则端到端建模、非自回归并行去噪等方法推进框架,在基准测试中表现出色,优于开源系统,适合边缘部署,且已开源模型权重、代码和基准测试。
SHOVIR:评估放射学报告生成中视觉捷径学习的基准
机构 * UniCamillus-Saint Camillus International University of Health Sciences, Rome, Italy(乌尼卡米尔斯-圣卡米卢斯国际健康科学大学,意大利罗马)
专题命中 评测与基准 :language model(abstract);分类 cs.CL
AI总结 提出SHOVIR基准,通过遮挡实验检测放射学报告生成模型是否依赖视觉捷径而非真实病理证据,发现高报告质量模型未必具有良好空间定位能力。
当视觉证据模糊时: pareidolia 作为视觉模型的诊断探针
机构 * Leiden Institute of Advanced Computer Science (LIACS), Leiden University, Leiden, The Netherlands(莱顿高级计算机科学研究所(LIACS)、莱顿大学、莱顿、荷兰)
专题命中 评测与基准 :language model(abstract);分类 cs.AI
AI总结 本文研究了视觉模型在模糊证据下的行为,通过分析pareidolia现象揭示了不同模型在表示层面的差异,发现语义过激活和不确定性策略等机制,为提升视觉语言系统的语义鲁棒性提供诊断和改进方法。
抵抗与更新:用于激励兼容大语言模型的反事实报告坐标
专题命中 评测与基准 :language model(abstract);分类 cs.AI
AI总结 研究大语言模型在非证据激励压力下误报问题,提出学习和验证反事实报告调解器方法,通过互换干预识别低秩报告坐标,引入CRC钳位,在基准测试中取得成果,贡献了接口和认证方法。
DSBench:用于评估外部和车内风险的综合基准测试
机构 * University of Science and Technology of China(中国科学技术大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Xiaomi EV(小米电动车) ; Fudan University(复旦大学) ; Xidian University(西安电子科技大学) ; South China University of Technology(华南理工大学) ; The University of Hong Kong(香港大学)
专题命中 评测与基准 :language model(abstract);分类 cs.AI
AI总结 针对视觉语言模型在安全关键场景适用性未充分探索的问题,引入DSBench综合基准测试,涵盖外部与车内风险,分多类别。评估发现模型在复杂情况下降,构建数据集微调可提升性能,推动自动驾驶技术发展,相关资源将公开。
我们能信任项目反应理论进行人工智能评估吗?
机构 * Johns Hopkins University(约翰·霍普金斯大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 评测与基准 :LLM(abstract);分类 cs.AI
AI总结 研究探讨项目反应理论(IRT)用于人工智能评估的可靠性,利用六个大语言模型基准模拟响应矩阵,比较四种估计工具,评估IRT在多方面的表现,发现经典估计器在大型基准中可能不可行,可扩展估计器在特定模型集下可能产生不可靠推断。
从重建到解释:X射线断层扫描数据的零设置多相分割
专题命中 评测与基准 :prompting(abstract);分类 cs.AI
AI总结 研究针对X射线断层扫描数据快速解释受限问题,提出零设置多相分割框架,结合材料无关掩码准备策略与预训练语义分割网络,能快速生成诊断级分割,支持近实时束线反馈与可扩展成像工作流程。
VCG-Bench:迈向统一的视觉导向基准,用于结构化生成与编辑
机构 * The Hong Kong University of Science and Technology (GuangZhou)(香港科学与技术大学(广州)) ; Huawei Technologies Co., Ltd(华为技术有限公司) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; South China University of Technology(华南理工大学)
专题命中 评测与基准 :language model(abstract);分类 cs.CL
AI总结 本文提出VCG-Bench,一个统一的视觉导向mxGraph任务基准,通过符号逻辑和XML实现精确的图表生成与编辑,解决现有方法在结构化任务中的局限性。
Comments Accepted by ICML2026, 37 pages, 10 figures
本科早期计算机科学中的一个支架式生成式人工智能实验室:混合方法、多课程评估
机构 * Purdue University(普渡大学)
专题命中 评测与基准 :prompting(abstract);分类 cs.AI
AI总结 研究在本科早期计算机科学课程中评估 “AI实验室” 这一支架式GenAI素养干预。通过多课程混合方法收集数据,发现其能改变学生对GenAI的态度及使用策略,且不增加评分作业中GenAI的使用量,推动相关三角测量研究。
Comments 18 pages, 3 figures, 18 tables; v2 substantially refined qualitative analysis and discussion
频谱并不够:上下文何时有助于时间序列预测
专题命中 评测与基准 :foundation model(abstract);分类 cs.LG
AI总结 研究时间序列预测中上下文的作用,指出频谱指标与添加上下文等因素回答的问题不同,通过替代对等给出覆盖不足诊断,在七个基准测试中验证,表明窗口键控检索等情况,为部署决策提供区分、比较及诊断。
金融研究基准II:一个具有共识衍生黄金标准的深度研究基准,用于区分财务报告质量
机构 * StepFun(步趣) ; FinStep(鳍步) ; University of Adelaide(阿德莱德大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 评测与基准 :LLM(abstract);分类 cs.CL
AI总结 该研究针对深度研究代理生成财务报告的大规模评估瓶颈,提出可扩展管道生成高质量标准。通过构建基准、合成候选标准、比较大语言模型与人类评估,经两个过滤器得出黄金标准集,用于评估10个深度研究系统,实现可扩展的基准评估等研究。