Beyond Logical Forms: LLM-Extracted Patterns for Fallacy Classification
超越逻辑形式:LLM提取的谬误分类模式
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出利用大语言模型从谬误示例中归纳提取抽象逻辑结构与上下文线索的模式,用于谬误分类,在多个实验设置中显著优于零样本基线并跨数据集验证泛化性。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
超越逻辑形式:LLM提取的谬误分类模式
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出利用大语言模型从谬误示例中归纳提取抽象逻辑结构与上下文线索的模式,用于谬误分类,在多个实验设置中显著优于零样本基线并跨数据集验证泛化性。
OpenFinGym: 一个可验证的多任务Gym环境,用于评估量化智能体
机构 * University of Edinburgh(爱丁堡大学) ; University College London(伦敦大学学院) ; Alan Turing Institute(艾伦·图灵研究所) ; University of Oxford(牛津大学)
专题命中 推理评测 :verifier(abstract);分类 cs.AI、cs.LG
AI总结 提出OpenFinGym统一环境,覆盖预测、市场生成、实时交易和欺诈检测等量化金融任务,支持自动化任务构建、容器化验证和延迟解析,以全面评估LLM智能体。
红皇后哥德尔机:共同进化的智能体及其评估者
专题命中 推理评测 :verifier(abstract);分类 cs.AI、cs.LG
AI总结 提出红皇后哥德尔机(RQGM),一种在非平稳效用下实现递归自我改进的进化框架,通过受控效用演化在编码、论文写作和证明任务上超越现有自我改进智能体。
Comments 13 pages main text + 21 pages appendix (38 pages total, incl. references); 11 figures (7 main text + 4 appendix); 10 tables (2 main text + 8 appendix). Preliminary preprint; work in progress. Keywords: self-improving agents, learned evaluation, multi-agent systems, auto-mated scientific discovery, controlled utility evolution, co-evolutionary search, autoresearch
后训练配方,而非模型家族,塑造多智能体LLM对话行为
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of California, Santa Cruz(加州大学圣克鲁兹分校)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究通过大规模语料库和因子实验发现,后训练配方(如推理蒸馏)对多LLM对话行为(如回避性回答)的影响超过模型家族,表明模型家族不能完全代表对话多样性。
SpeechEQ: 社交感知语音对话模型的情商基准测试
机构 * New York University(纽约大学) ; NVIDIA(英伟达) ; Carnegie Mellon University(卡内基梅隆大学) ; NYU Shanghai(上海纽约大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出SpeechEQ框架,基于EQ-i 2.0理论构建2265个对话数据集,通过口语情商(SEQ)评分评估语音语言模型在主动多轮对话中的副语言社交线索推理能力,揭示端到端模型存在模态捷径、安全陷阱和上下文遗忘等瓶颈。
HIPE-2026 概述:从多语言历史文本中提取人物-地点关系
机构 * University of Zurich(苏黎世大学) ; École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) ; Swiss Federal Institute of Technology Zurich (ETHZ)(苏黎世联邦理工学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出HIPE-2026评测任务,针对多语言历史文档中的人物-地点关系(at和isAt)进行提取,采用三方面评估框架,比较了多种方法在准确性、效率和跨域泛化上的表现。
Comments Condensed Overview of CLEF-HIPE-2026 Shared Task Results
AdversaBench: 基于多裁判确认与跨模型迁移性的自动化大语言模型红队测试
机构 * Indian Institute of Technology Jodhpur(印度理工学院焦特布尔分校)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出AdversaBench端到端红队测试流水线,使用五种结构化算子变异种子提示,通过三裁判加元裁判机制确认失败,实验发现算子效果因类别而异、二元失败率掩盖难度、裁判一致性受标签偏斜影响、对抗提示可跨模型迁移。
Comments 10 pages, 4 figures, 5 tables. Code and data at https://github.com/khanak0509/AdversaBench
RoPE感知的KV缓存量化比特分配
机构 * Hong Kong University of Science and Technology(香港科技大学) ; The Chinese University of Hong Kong(香港中文大学) ; MiMo, Xiaomi Corporation(小米集团 MiMo)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 针对RoPE下键缓存量化中不同频率块对误差敏感度不同的问题,提出Block-GTQ比特分配器,通过能量评分和贪心分配提升量化精度,在长上下文任务中显著恢复性能。
Comments Preprint. Code available at https://github.com/JIA-Lab-research/blockgtq
StatABench:评估大语言模型统计分析能力的数据集与框架
机构 * Southern University of Science and Technology(南方科技大学) ; Alibaba Group(阿里巴巴集团) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; The University of Hong Kong(香港大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出StatABench基准,包含404道封闭题和30道开放建模任务,评估LLM在统计分析上的能力,实验显示最佳模型仅达68.6%准确率,揭示工具推理和建模决策等挑战。
L20-Edu-135M: 一个可审计的单GPU数据高效小语言模型研究
机构 * University of Birmingham(伯明翰大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本研究在单块NVIDIA L20 GPU上训练134.5M参数的语言模型,使用约13B tokens,通过数据筛选、去重、SFT和RLVR等方法,在零样本任务上达到SmolLM-135M 87.1%的性能,但仅使用其2.17%的tokens。
Comments 13 pages, 8 tables. Model available at https://huggingface.co/AliceYin/l20-edu-135m
潜在置信对齐用于大语言模型自我评估
机构 * Department of Information Management(信息管理系) ; National Sun Yat-Sen University(国立中山大学) ; Kaohsiung Medical University Hospital(高雄医学大学附设医院) ; Kaohsiung Medical University(高雄医学大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出基于Rasch模型的潜在置信对齐误差(LCAE)来评估LLM自我评估与潜在错误概率的一致性,并引入项目难度作为外部信号,实验表明该方法在不影响模型能力的情况下提升自我评估质量。
Comments 2026 IEEE 27th International Conference on Information Reuse and Integration for Data Science
Counsel: 面向智能体任务的元评估数据集
机构 * Atla AI ; Cohere AI ; Mistral AI ; Google DeepMind(谷歌DeepMind)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出Counsel数据集,通过人工标注对LLM评判的智能体轨迹错误进行元评估,用于校准和改进LLM评判器。
通过稀疏自编码器提取和分析视觉语言模型中的多模态概念
机构 * Knowledge Technology, Department of Informatics, University of Hamburg(汉堡大学信息学系知识技术实验室)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出基于稀疏自编码器的框架,从视觉语言模型中提取视觉、文本和多模态概念,通过余弦相似度评估概念与样本的对齐,在VQA数据集上提升视觉概念质量达45%。
Comments International Conference on Artificial Neural Networks (ICANN), 2026, Padua
MEDLAYXPLAIN: 医学视觉语言模型中的专家-外行差距基准测试
机构 * Seoul National University(首尔大学) ; Seoul National University Hospital(首尔大学医院) ; Seoul National University College of Medicine(首尔大学医学院) ; Sungkyunkwan University School of Medicine(成均馆大学医学院)
专题命中 推理评测 :verifier(abstract);分类 cs.CL、cs.AI
AI总结 提出首个大规模医学外行语言生成基准MedLayXPlain,包含12万+区域级样本和三层UMLS本体,通过HOVER管道构建外行描述,并引入轻量级评估器MedLayEval,揭示当前医学VLM在外行可读性与临床精度间的系统性差距。
Comments 40 pages (10 pages main text, 30 pages appendix), 4 main figures, 33 vision-language models benchmarked
可扩展的层次注意力Transformer用于长对话中的多轮越狱检测
机构 * Zscaler, Inc.(Zscaler公司)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出一种层次化检测器,通过紧凑的轮次表示和轻量级对话模块捕捉跨轮推理,在14,038条对话上F1达0.9394,超越Claude Opus 4.7,误报率减半。
专业化角色,混合部署:推动LLM代理团队的成本-精度前沿
机构 * University of Edinburgh(爱丁堡大学) ; Microsoft Research(微软研究院)
专题命中 推理评测 :verifier(abstract);分类 cs.AI、cs.LG
AI总结 提出AgentCARD基准,通过角色感知评估和帕累托前沿分析,发现异构团队在成本-精度前沿上优于同构团队,混合部署可降低12倍成本。
TelcoAgent: 一种可扩展的5G多KPM预测与3GPP基础可解释性
机构 * NextG Wireless Lab, North Carolina State University(北卡罗来纳州立大学下一代无线实验室) ; Kyung Hee University(庆熙大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出TelcoAgent框架,利用基础模型实现多KPM的零样本预测,通过3GPP知识图谱和可解释性管道提供可操作诊断。
Comments 6 pages, 6 figures. Submitted to IEEE GLOBECOM 2026
CombEval:评估大语言模型中组合计数的框架
机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) ; Czech Technical University in Prague(捷克布拉格理工大学) ; CRRC Zhuzhou Institute(中车株洲研究所) ; Tengen Intelligence Institute(天元智能研究院) ; International Center of Future Science, Jilin University(吉林大学未来科学国际合作中心) ; Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE(教育部知识驱动人机智能工程研究中心)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出CombEval动态基准,通过类型化Cofola规范生成组合计数问题,评估11个大语言模型在直接和代码增强设置下的表现,发现模型在有序对象、不可区分元素、相对位置约束和嵌套对象依赖上存在脆弱性。
Comments under review. Code: https://github.com/YuxuZhou-CN/combination-problem-generation
查询应置于何处?通过解码动力学揭示并缓解扩散大语言模型中上下文学习的位置偏差
机构 * Southeast University(东南大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文系统分析了扩散大语言模型中查询位置对生成质量的影响,发现其与示例语义质量同等重要,并提出基于平均置信度的无训练自适应路由策略Auto-ICL以优化查询放置。
Comments 9 figures, 4 tables
TxBench-PP:分析AI代理在小分子临床前药理学中的表现
机构 * LatchBio
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出TxBench-PP基准,用于评估AI代理从真实实验数据中恢复临床前药理学结论的能力,测试显示最强配置Claude Opus 4.8 / Pi仅通过59.3%的端点尝试。
DRIFT: 通过在线策略数据归因优化指令数据
机构 * Tsinghua University(清华大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出DRIFT方法,利用在线策略影响函数解决标准影响函数在指令微调数据归因中的近邻偏差和梯度范数偏差问题,通过模型自身生成作为验证目标,提升7B模型性能上限。
面向大型音频语言模型的连续音频思考
机构 * KAIST(韩国科学技术院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出连续音频思考(CoAT)框架,通过专家蒸馏在连续潜在空间中组织声学信息,使音频语言模型在生成响应前利用丰富声学特征,无需额外自回归解码成本,在多个音频任务上提升性能。
Comments Preprint
DriveJudge: 用视觉-语言模型重新思考自动驾驶评估
机构 * NVIDIA(英伟达)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出DriveJudge,结合规则评估与VLM推理,通过选择性调用物理规则函数实现可解释且上下文感知的驾驶评估,在驾驶质量分类和轨迹偏好选择任务上超越现有方法。
Comments Under Review
面向工具增强型大语言模型的基于状态的多智能体合成数据生成
机构 * PayPal AI
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出StateGen平台,通过四角色LLM循环和状态管理器生成多轮、工具接地的高质量训练对话,消除工具调用幻觉,支持层次化多智能体设置。
Comments 9 pages, 5 figures, 6 tables, 1 algorithm
通过过度训练的视角理解RLVR中的多样性崩溃
机构 * Sydney AI Centre, The University of Sydney(悉尼大学悉尼人工智能中心) ; Southeast University(东南大学) ; Microsoft(微软) ; Data61, CSIRO(澳大利亚联邦科学与工业研究组织Data61) ; Chongqing University(重庆大学) ; Nanyang Technological University(南洋理工大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文通过过度训练的视角形式化RLVR中的多样性崩溃,发现标准训练中大部分更新是过度训练,并提出贝叶斯边界门控(BBG)方法,通过估计每个问题对推理边界的边际贡献来优化,提升多个基准上的Pass@k。
有限语义表格数据上的LLM:来自工业汽车改造预测的证据
机构 * Technical University of Munich(慕尼黑工业大学) ; BMW Group(宝马集团)
专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG
AI总结 研究在工业表格数据中,LLM(嵌入、直接分类、混合堆叠)与经典树集成方法的对比,发现LLM在语义受限时效果有限,但嵌入和混合方法仍有价值。
动态声源的时空音频语言建模
机构 * POSTECH(浦项科技大学) ; Sony AI(索尼AI) ; Sony Group Corporation(索尼集团) ; Sungkyunkwan University(成均馆大学) ; KAIST(韩国科学技术院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出ST-AudioLM模型,通过时空音频编码器联合学习事件语义与源轨迹,在ST-AudioQA基准上提升动态声源问答的语义-定位权衡。
跨尺度科学挑战的AI智能体基准测试
机构 * Yale University(耶鲁大学) ; Broad Institute of MIT and Harvard(布罗德研究所) ; The Pennsylvania State University(宾夕法尼亚州立大学) ; Northeastern University(东北大学) ; Northwestern University(西北大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出SciAgentArena基准,含约200个交互式任务,评估AI智能体在真实科研场景中的能力,发现其在数据分析中有效,但在创新探索和开放问题上表现不均。
Comments 6 figures
地理空间多模态基础模型的新兴灵活设计
机构 * Oak Ridge National Laboratory(橡树岭国家实验室)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本文系统比较了不同架构的地理空间基础模型,在统一设置下评估其灵活性与性能,为多模态推理提供设计指导。
两个错误,没有正确:审计计算社会科学中LLM标注者的社会期望偏差
机构 * Varun Kotte
专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.LG
AI总结 研究审计了三个开源指令微调模型在TweetEval任务中的社会期望偏差,发现模型存在宽大、过度纠正和中性偏差,且提示干预无法纠正,聚合指标可能掩盖实质结论错误。