DRIFT: Refining Instruction Data via On-Policy Data Attribution
DRIFT: 通过在线策略数据归因优化指令数据
机构 * Tsinghua University(清华大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出DRIFT方法,利用在线策略影响函数解决标准影响函数在指令微调数据归因中的近邻偏差和梯度范数偏差问题,通过模型自身生成作为验证目标,提升7B模型性能上限。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
DRIFT: 通过在线策略数据归因优化指令数据
机构 * Tsinghua University(清华大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出DRIFT方法,利用在线策略影响函数解决标准影响函数在指令微调数据归因中的近邻偏差和梯度范数偏差问题,通过模型自身生成作为验证目标,提升7B模型性能上限。
面向大型音频语言模型的连续音频思考
机构 * KAIST(韩国科学技术院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出连续音频思考(CoAT)框架,通过专家蒸馏在连续潜在空间中组织声学信息,使音频语言模型在生成响应前利用丰富声学特征,无需额外自回归解码成本,在多个音频任务上提升性能。
Comments Preprint
SciHorizon-GENE:从基因知识到功能理解的生命科学推理基准测试
机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) ; University of the Chinese Academy of Sciences(中国科学院大学) ; DUKE-NUS Medical School, National University of Singapore(新加坡国立大学杜克-新加坡医学学校) ; Singapore Immunology Network, Agency for Science, Technology and Research(新加坡免疫网络,科技研究局)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型在基因级推理能力上的不足,构建了包含超过19万个人类基因和54万问题的基准SciHorizon-GENE,从研究关注敏感性、幻觉倾向、答案完整性和文献影响力四个生物学关键维度评估模型,揭示了模型在生成忠实、完整且基于文献的功能解释方面的持续挑战。
Comments Accepted by SIGKDD 2026. 12 pages
ASyMOB:代数符号数学运算基准
机构 * MIT(麻省理工学院) ; Technion - Israel Institute of Technology(技术学院-以色列理工学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出ASyMOB基准,包含35,368个符号数学问题,通过扰动测试揭示大模型在符号数学推理中的鲁棒性不足,并发现LLM与CAS的互补潜力。
Comments Published in ICML2026: https://icml.cc/virtual/2026/poster/63549 Code repository: https://github.com/RamanujanMachine/ASyMOB Complete benchmark dataset: https://huggingface.co/datasets/Shalyt/ASyMOB-Algebraic_Symbolic_Mathematical_Operations_Benchmark
DriveJudge: 用视觉-语言模型重新思考自动驾驶评估
机构 * NVIDIA(英伟达)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出DriveJudge,结合规则评估与VLM推理,通过选择性调用物理规则函数实现可解释且上下文感知的驾驶评估,在驾驶质量分类和轨迹偏好选择任务上超越现有方法。
Comments Under Review
DECKBench:用于学术幻灯片生成和编辑的多智能体框架基准测试
机构 * Huawei Technologies Canada(华为加拿大技术有限公司) ; University of British Columbia(不列颠哥伦比亚大学)
专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出DECKBench,一个用于评估多智能体生成和编辑学术幻灯片的框架,通过定制数据集和模拟编辑指令,系统评估幻灯片和整个演示文稿的忠实度、连贯性、布局质量和多轮指令遵循能力。
MoSE: 混合可瘦身专家实现高效自适应语言模型
机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI), UAE(Mohamed bin Zayed人工智能大学(MBZUAI)) ; Michigan State University (MSU), USA(密歇根州立大学(MSU)) ; Amazon Science, UK(亚马逊科学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 提出MoSE架构,每个专家具有可变宽度的嵌套结构,支持在推理时连续调节精度-计算权衡,通过多宽度训练和轻量级测试时训练实现高效自适应。
Comments Accepted to ICML 2026
面向工具增强型大语言模型的基于状态的多智能体合成数据生成
机构 * PayPal AI
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出StateGen平台,通过四角色LLM循环和状态管理器生成多轮、工具接地的高质量训练对话,消除工具调用幻觉,支持层次化多智能体设置。
Comments 9 pages, 5 figures, 6 tables, 1 algorithm
通过过度训练的视角理解RLVR中的多样性崩溃
机构 * Sydney AI Centre, The University of Sydney(悉尼大学悉尼人工智能中心) ; Southeast University(东南大学) ; Microsoft(微软) ; Data61, CSIRO(澳大利亚联邦科学与工业研究组织Data61) ; Chongqing University(重庆大学) ; Nanyang Technological University(南洋理工大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文通过过度训练的视角形式化RLVR中的多样性崩溃,发现标准训练中大部分更新是过度训练,并提出贝叶斯边界门控(BBG)方法,通过估计每个问题对推理边界的边际贡献来优化,提升多个基准上的Pass@k。
有限语义表格数据上的LLM:来自工业汽车改造预测的证据
机构 * Technical University of Munich(慕尼黑工业大学) ; BMW Group(宝马集团)
专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG
AI总结 研究在工业表格数据中,LLM(嵌入、直接分类、混合堆叠)与经典树集成方法的对比,发现LLM在语义受限时效果有限,但嵌入和混合方法仍有价值。
具有时变干预的流行病时间序列中的反事实预测基准测试
机构 * University of Michigan Computer Science and Engineering(密歇根大学计算机科学与工程系) ; University of Michigan Epidemiology & Complex Systems(密歇根大学流行病学与复杂系统)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 为解决缺乏可观测反事实结果的真实基准问题,基于校准的基于智能体的模型生成大规模流行病时间序列反事实预测基准,支持静态/时变治疗和单/多策略干预,评估多种因果推断方法。
Comments To appear in Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)
在运动想象EEG分类中平衡可解释性和性能:ANFIS-FBCSP-PSO和EEGNet的比较研究
机构 * University of Rajshahi(拉贾沙希大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文比较了ANFIS-FBCSP-PSO与EEGNet在BCI竞赛IV-2a数据集上的性能,发现模糊神经模型在内子试验中表现更优,而深度模型在跨受试者测试中更具泛化能力,为选择MI-BCI系统提供指导。
Comments Accepted at the 2026 IEEE 2nd International Conference on Quantum Photonics, Artificial Intelligence and Networking (QPAIN 2026)
Journal ref 2026 IEEE 2nd International Conference on Quantum Photonics, Artificial Intelligence & Networking (QPAIN)
LoLA: 低秩线性注意力与稀疏缓存
机构 * University of California, San Diego(加州大学圣地亚哥分校)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 提出LoLA,一种无需训练的线性注意力增强方法,通过三种记忆系统(局部滑动窗口、稀疏全局缓存和循环隐状态)提升关联回忆,在pass-key检索任务上将准确率从0.6%提升至97.4%,且缓存大小比Llama-3.1 8B小4.6倍。
动态声源的时空音频语言建模
机构 * POSTECH(浦项科技大学) ; Sony AI(索尼AI) ; Sony Group Corporation(索尼集团) ; Sungkyunkwan University(成均馆大学) ; KAIST(韩国科学技术院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出ST-AudioLM模型,通过时空音频编码器联合学习事件语义与源轨迹,在ST-AudioQA基准上提升动态声源问答的语义-定位权衡。
跨尺度科学挑战的AI智能体基准测试
机构 * Yale University(耶鲁大学) ; Broad Institute of MIT and Harvard(布罗德研究所) ; The Pennsylvania State University(宾夕法尼亚州立大学) ; Northeastern University(东北大学) ; Northwestern University(西北大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出SciAgentArena基准,含约200个交互式任务,评估AI智能体在真实科研场景中的能力,发现其在数据分析中有效,但在创新探索和开放问题上表现不均。
Comments 6 figures
地理空间多模态基础模型的新兴灵活设计
机构 * Oak Ridge National Laboratory(橡树岭国家实验室)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文系统比较了不同架构的地理空间基础模型,在统一设置下评估其灵活性与性能,为多模态推理提供设计指导。
两个错误,没有正确:审计计算社会科学中LLM标注者的社会期望偏差
机构 * Varun Kotte
专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.LG
AI总结 研究审计了三个开源指令微调模型在TweetEval任务中的社会期望偏差,发现模型存在宽大、过度纠正和中性偏差,且提示干预无法纠正,聚合指标可能掩盖实质结论错误。
LingxiDiagBench: 用于基准测试大语言模型在中文精神科咨询与诊断中的多智能体框架
机构 * Tianqiao and Chrissy Chen Institute(天桥和克里斯西·陈研究所) ; EverMind AI Inc.(EverMind AI公司) ; Shanghai Mental Health Center, Shanghai Jiao Tong University School of Medicine(上海精神卫生中心,上海交通大学医学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出LingxiDiagBench多智能体框架,包含16K电子病历对齐的合成咨询对话数据集,评估LLM在静态诊断和动态咨询中的表现,发现其对抑郁-焦虑共病识别和12类鉴别诊断准确率低,动态咨询常不如静态评估。
语言模型电路在神经元基上是稀疏的
机构 * Stanford University(斯坦福大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文实证发现MLP神经元与稀疏自编码器一样是稀疏特征基,并基于此开发了端到端梯度归因流水线,在多项任务中揭示了因果有效的神经元电路。
Comments ICML Spotlight, camera-ready
DSAEval:在广泛真实世界数据科学问题上评估数据科学智能体
机构 * Department of Data Science and Artificial Intelligence, Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学) ; Department of Applied Mathematics, Hong Kong Polytechnic University(应用数学系,香港理工大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出包含641个真实数据科学问题的基准DSAEval,涵盖多模态环境感知、多查询交互和多维评估,系统评估13个先进LLM智能体,发现Claude-Sonnet-4.5综合最优,多模态感知提升视觉任务性能2.04%-11.30%。
语言模型在开放式任务中的自动化创造力评估
机构 * Raffles Institution(莱佛士书院) ; College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) ; Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李光前医学院) ; Centre of AI in Medicine (C-AIM), Nanyang Technological University(南洋理工大学人工智能医学中心)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出一种领域无关的自动化框架,通过语义熵和检索式多智能体评估,量化LLM在开放式任务中的发散与收敛创造力,并在问题解决、研究构思和创意写作三个领域验证其有效性。
Comments Accepted to ACL 2026 (Main Conference). 35 pages, 16 figures. Code: https://github.com/tanminsen/creativity-eval
MedCTA: 临床工具智能体基准
机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) ; Massachusetts Institute of Technology (MIT)(麻省理工学院)
专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI
AI总结 提出MedCTA基准,基于放射影像、病理切片和报告等真实临床多模态输入,评估医疗AI智能体在工具检索、证据获取和集成方面的规划与执行能力。
Comments Project Page: https://ivul-kaust.github.io/MedCTA/ Code: https://github.com/IVUL-KAUST/MedCTA Data: https://huggingface.co/datasets/IVUL-KAUST/MedCTA
LakeQA:百万级数据湖上的探索性问答基准
机构 * Columbia University(哥伦比亚大学) ; New York University(纽约大学) ; Barnard College(巴纳德学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出LakeQA基准,要求LLM在9.5TB异构数据湖中搜索并多跳推理,GPT-5.2仅达18.37%精确匹配,挑战性强。
Bittensor 智能体竞技场作为轨迹基元:从 ShoppingBench 子网轨迹中蒸馏购物智能体
机构 * ORO AI ; Dynamical Systems(动力系统)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 针对小模型后训练缺乏多轮轨迹数据的问题,利用 Bittensor 子网 SN15 的竞技机制生成激励对齐的轨迹,通过结构质量过滤提取智能体轨迹,后训练 Qwen3-4B 模型在 ShoppingBench 上达到 42.7% ASR,接近合成数据基线。
Comments 10 pages, 4 figures, Data and Models available at: https://huggingface.co/collections/oro-ai/shoppingbench-sn15-trajectory-primitive
Co-GLANCE: 异构机器人团队的不确定性感知主动感知
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出Co-GLANCE系统,通过蒸馏视觉语言模型实现实时遮挡分割与机器人分配,结合共形预测与选择性弃权提供统计保证的不确定性量化,驱动主动感知,在真实场景中遮挡分割和分配准确率分别提升25%和36%,推理延迟降低350倍。
Comments Code, videos, and dataset available at https://co-glance.github.io/
基于证据的缪子对撞机分析的智能混合RAG
机构 * Peking University(北京大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出智能混合RAG框架,结合稀疏与稠密检索及智能推理,用于缪子对撞机研究的证据检索与答案生成,构建首个基准并验证其有效性。
Comments 22 pages, 5 figures, and 6 tables
让结果说话:LLM行为基准测试的复制优先范式
机构 * Cylingo team(Cylingo团队)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出复制优先范式,通过可靠性、跨仪器复制、历史足迹校准和预注册预测四个正交属性验证LLM行为评估工具,并在情感陪伴任务中测试,发现聚合分数掩盖的模型退化。
基于转换的阿尔茨海默病数字孪生建模在稀疏纵向数据下的应用
机构 * University of Southampton(南安普顿大学) ; University Hospital Southampton NHS Foundation Trust(南安普顿大学医院NHS基金会信托) ; Faculty of Medicine, University of Southampton(南安普顿大学医学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 针对阿尔茨海默病进展异质性和数据稀疏问题,提出结合局部转换建模与序列建模的数字孪生框架,利用多模态纵向数据预测认知状态并量化不确定性,在ADNI数据上表现优异。
Comments 13 pages, 5 figures, 3 tables. Accepted as a full-length paper at the International Conference on AI in Healthcare (AIiH) 2026
TABVERSE:大语言模型与视觉语言模型中跨格式表格理解的基准测试
机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) ; Singapore University of Technology and Design (SUTD)(新加坡科技设计大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出TABVERSE基准,通过控制表格内容、跨多种结构格式(HTML、Markdown、LaTeX)和渲染图像,系统评估LLM和VLM在问答、结构理解和结构重建任务中的表现,发现表示格式显著影响表格理解能力。
Comments 24 pages, 18 tables, 16 figures, Submitted to ARR May 2026
超越回忆的记忆:用于自进化LLM代理的双过程认知记忆系统
机构 * Tencent(腾讯)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出DCPM系统,基于双过程理论将代理记忆组织为认知能力层次,通过同步日间写入器和异步夜间引擎分别处理信念修正和模式归纳,在隐式跨会话推理任务上提升显著。