KFCNet: Knowledge Filtering and Contrastive Learning Network for Generative Commonsense Reasoning
专题命中 推理评测 :reasoning(title);分类 cs.CL
Comments Accepted to EMNLP 2021 Findings
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 推理评测 :reasoning(title);分类 cs.CL
Comments Accepted to EMNLP 2021 Findings
专题命中 推理评测 :reasoning(title);分类 cs.AI
Comments 46 pages, 1 Postscript figure
Journal ref TPLP Vol 3(4&5) (2003) 425-461
我们能否解读音频大语言模型的思维?一个可解读的多语言中间层工作空间
机构 * Amazon AGI Foundations(亚马逊AGI基金会) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 本研究通过logit lens分析Qwen3-Omni模型,发现其中间层可在输出前清晰呈现音频问题答案,揭示了音频模型推理的特性与信号分布,为解读音频大语言模型内部思维提供了定性依据。
你能做到多小?面向金融交易中商户信息抽取的 270M-8B 模型 LoRA 微调
机构 * Singapore Management University(新加坡管理大学) ; Mastercard(万事达卡) ; A*STAR Centre for Frontier AI Research(新加坡科技研究局前沿人工智能研究中心)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 针对金融交易中从嘈杂银行字符串提取结构化商户信息的生产需求,系统评估 24 种模型变体,发现 Qwen 3.5 4B 在参数量减半下 F1 仅低 0.35 点,0.8B 模型匹配 2.5-4 倍大模型性能,且思维链微调提升有限。
Comments 10 pages, 5 figures, 6 tables. Accepted for publication at the IEEE International Conference on Data Mining (ICDM) 2026
与什么相比?反事实提示的基线和度量标准
机构 * Northeastern University(东北大学) ; Bar-Ilan University(巴伊兰大学) ; Allen Institute for AI(人工智能研究所)
专题命中 推理评测 :CoT(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 本文探讨了反事实提示中基线和度量标准的重要性,指出单纯改变文本因素无法准确评估模型敏感性,提出通过统计检验比较干预差异与改写影响的框架,发现模型对患者性别等的敏感性在考虑一般模型敏感性后显著降低。
Comments Published as a conference paper at COLM 2026. 33 pages, 10 figures, 18 tables. Code: https://github.com/redagavin/counterfactual-prompting-baselines ; Python package (cfprompt): https://github.com/redagavin/cfprompt
UVLM:一种通用视觉-语言模型加载器,用于可重复的多模态基准测试
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 UVLM提供统一接口加载和基准测试多种视觉-语言模型架构,支持LLaVA-NeXT和Qwen2.5-VL,通过抽象差异实现一致评估,具备多任务提示构建、共识验证和灵活token预算等功能。
Comments 22 pages, 3 figures
Journal ref Software 2026, 5(3), 30
基于美国核管理委员会反应堆操作员执照考试的多模态语言模型微调与检索策略基准测试
机构 * organization= Department of Nuclear Engineering, Hanyang University , addressline= 222 Wangsimni-ro , postcode= 04763 , state= Seongdong-gu , city= Seoul , country= South Korea ; organization= The Grainger College of Engineering, Nuclear, Plasma \& Radiological Engineering, University of Illinois Urbana-Champaign , city= Urbana , state= IL , country= USA
专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract_cn);分类 cs.CL、cs.AI
AI总结 该研究针对美国核管理委员会反应堆操作员执照考试,评估310亿参数多模态模型应用核知识的能力,通过对比基础模型与多种微调及检索配置,发现固定大小分块RAG的SFT配置表现最佳,并揭示了分块策略规律及RAFT与SFT的性能差异。
ReLoop:结构建模与行为验证用于可靠的基于LLM的优化
机构 * McCormick School of Engineering, Northwestern University(西北大学工程学院) ; Wenzhou Buyi Pharmacy Chain Co., Ltd.(温州-buyi药链有限公司) ; College of Computer Science and Artificial Intelligence, Wenzhou University(温州大学计算机科学与人工智能学院) ; Department of Decision Analytics and Operations, City University of Hong Kong(香港城市大学决策分析与运营部门) ; Institute of Operations Research and Analytics, National University of Singapore(新加坡国立大学运筹学与分析研究所)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 ReLoop通过结构生成和行为验证机制,解决LLM生成优化代码的可行性与正确性差距问题,提升代码执行准确性和鲁棒性。
Comments Code and benchmark: https://github.com/junbolian/ReLoop
LLMs能否像自动定理证明器一样进行Rust验证?VCoT-Bench:通过验证思维链进行评估
机构 * University of Virginia(弗吉尼亚大学)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 本文提出VCoT-Bench,通过验证思维链评估LLMs在Rust验证中的能力,揭示其在不同证明类型和缺失证明情况下的脆弱性。
Comments Accepted at ICML 2026
Avalon-ToM-Bench:通过非对称游戏机制评估细粒度心理理论
机构 * National Taiwan University(台湾大学) ; CyCraft AI Lab(CyCraft人工智能实验室)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 本文提出Avalon-ToM-Bench基准,基于阿瓦隆游戏机制评估大语言模型的细粒度心理理论,发现模型ToM能力不足源于推理策略而非知识或表征,推理训练比测试时思维链增益更显著。
ComboShoppingBench:评估大型语言模型智能体在带优惠券的预算约束组合购物篮任务中的表现
专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 本研究推出ComboShoppingBench组合购物基准,通过探索智能体、LLM评判者及确定性验证,发现各类LLM智能体在该基准上表现不佳,凸显其在约束感知组合购物上仍有巨大改进空间。
WuYuEval:面向固体废物管理的大语言模型多级基准测试
专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 WuYuEval是面向固体废物管理的多级基准测试,含基础与专家模块,评估33个LLM的SWM能力,发现其在专业任务表现差,为开发专用基础模型提供依据。
大型语言模型有多独立?一种用于审计行为纠缠和重加权验证者集合的统计框架
机构 * Texas A&M University(德克萨斯农工大学)
专题命中 推理评测 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI
AI总结 本文提出一种统计框架,用于审计大型语言模型之间的行为纠缠,通过多分辨率层次结构和信息理论度量,分析行为纠缠对验证性能的影响,并通过重加权验证者集合减少相关偏差。
BenHalluEval:孟加拉语大语言模型的多任务幻觉评估框架
机构 * Department of Computer Science and Engineering, Islamic University of Technology(伊斯兰科技大学计算机科学与工程系) ; Department of Computer Science and Engineering, University of California(加州大学计算机科学与工程系)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 针对孟加拉语大语言模型幻觉评估的空白,提出BenHalluEval框架,涵盖四项任务,构建12000个幻觉候选,并提出双轨校准指标BenHalluScore,揭示模型间幻觉校准的显著差异。
Comments Preprint. Under review
易完成,难选择:探究大型语言模型在ProverbIT基准上的性能
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 该研究构建了意大利谚语基准ProverbIT,评估13个前沿LLMs的谚语处理能力,发现LLMs虽能完成谚语任务,但在无正确答案的选择题中性能骤降,暴露其依赖记忆而非深层语义理解的局限。
Journal ref Proceedings of the Eleventh Italian Conference on Computational Linguistics (CLiC-it 2025), pages 722-734
前沿视觉语言模型的心智理论跨任务解离
机构 * University of Maryland(马里兰大学)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 该研究评估9个前沿VLM在两项心理学衍生ToM任务中的表现,发现其ToM特征存在跨任务解离,无模型在两项任务中均接近典型发展成人,推理可改善部分模型在导演任务中的表现。
相同事实,不同诊断:临床语言模型中叙事锚定的测量与缓解
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Queen’s University Belfast(贝尔法斯特女王大学) ; Middlesex University London(伦敦密德萨斯大学)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 本研究针对临床语言模型的叙事锚定偏差,构建含1000个USMLE案例的基准,提出NarrativeShield三智能体流水线,可大幅降低叙事锚定差距并减少不稳定决策,同时发布数据集供相关研究使用。
专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
Journal ref American Journal of Roentgenology, 2026
ARC-Encoder:为大语言模型学习压缩文本表示
机构 * Kyutai
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 ARC-Encoder是可将文本压缩为原词元数1/4或1/8的编码器,适配多类LLM解码器,在提升推理效率的同时保持最优性能,为大语言模型提供灵活高效的上下文压缩方案。
Comments Featured Certification
Journal ref Transactions on Machine Learning Research 2026 (https://openreview.net/forum?id=lU1P9dsqfn)
StanceFlip:用于多模态对话立场翻转预测的综合多维基准测试
机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件学院) ; Harbin Institute of Technology Shenzhen(哈尔滨工业大学(深圳)) ; City University of Macau(澳门城市大学)
专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究针对现有对话立场检测基准测试的局限,提出StanceFlip基准测试及ConStaFF框架,含多模态立场六元组提取和动态立场翻转归因两个新子任务,基于大语言模型实现端到端立场推理,实验显示该方法性能领先。
Comments 17pages, 8 figures
用于空中多模态大语言模型智能体的零样本任务级评估
专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 研究空中MLLMs在零样本下解决长期具身任务的能力,引入MissionBench基准,含120个任务。对比22个模型与人类表现,发现模型成功率低,虽规模扩大有收益,但任务级能力需协调多种能力,凸显具身AI改进的前景与风险。
Comments Preprint
ImplicitBBQ: 通过基于特征的提示对大语言模型中的隐性偏见进行基准测试
机构 * International Institute of Information Technology, Hyderabad(国际信息技术学院海得拉巴) ; Indian Institute of Technology, Kharagpur(印度理工学院克勒格布尔分校)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 本文提出ImplicitBBQ基准测试,通过基于特征的提示评估大语言模型中的隐性偏见,发现隐性偏见在模糊情境中比显性偏见高六倍,现有方法难以有效缓解。
Brain-CLIPLM: 用于EEG到文本解码的语义压缩
机构 * Beijing Institute of Technology, Beijing, China(北京理工大学,北京,中国)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出Brain-CLIPLM框架,通过语义锚点恢复和锚点引导的句子重建,解决EEG信号低信噪比和信息带宽限制的问题,实现了更高的文本检索准确率。
量子电路视觉:用于量子代码生成的视觉人工智能代理的成本感知评估
机构 * Amazon Web Services(亚马逊网络服务) ; Duke Kunshan University(杜克昆山大学)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 研究人工智能代理对量子电路图的理解及代码生成成本,提出量子电路视觉评估框架,构建基准并评估模型,发现中级模型在成本-准确性上平衡最佳,电路深度是失败主因,提出级联路由策略并开源数据集及代码。
BaFCo:用于复杂孟加拉语表格理解的文档理解基准
机构 * Wichita State University(威奇托州立大学) ; Center for Computational & Data Sciences(计算与数据科学中心) ; University of Dhaka(达卡大学) ; Amazon GenAI(亚马逊生成式人工智能)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 针对孟加拉语表格理解因高质量标注数据稀缺受限的问题,引入BaFCo基准数据集,涵盖多领域复杂表格。定义细粒度标注模式,评估多种MLLMs,发现其理解孟加拉语表格有局限,尤其在定位细粒度实体方面。
Comments Accepted at the 19th European Conference on Computer Vision (ECCV), 2026
你的AI旅行代理会为你预订斗牛:前沿AI模型中隐含动物福利的代理基准
机构 * Compassion Aligned Machine Learning(同情对齐机器学习) ; Sentient Futures(感知未来) ; Harvard Kennedy School(哈佛肯尼迪学院) ; Appalachian State University Department of Management(阿巴拉契亚州立大学管理系)
专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 提出首个代理基准TAC,测试AI代理在为用户执行旅行预订等操作时是否避免涉及动物剥削的选项。评估七个前沿模型,所有模型得分低于随机水平64%,最佳模型仅53%。
自适应轮流发言:面向实时多方语音代理
机构 * Amazon AGI(亚马逊人工智能研究院) ; IIT Kharagpur, India(印度克里ш格布尔理工学院)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 提出ModeratorLM,一种基于角色条件的语音大模型,通过分块流式处理和链式推理,在多方对话中实现自适应轮流发言,显著提升轮流精度和召回率。
Comments Accepted for publication at Interspeech 2026
评估深度研究代理在专家咨询工作中的表现:一个包含验证器、评分标准和认知陷阱的基准
机构 * Deccan AI Research(德克南人工智能研究所)
专题命中 推理评测 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一个基准,通过42个专家编写的任务,使用确定性验证器和五维度评分标准评估三个前沿深度研究代理(Claude、OpenAI o3、Gemini)在管理咨询类结构化分析交付物上的表现,并嵌入认知陷阱,发现所有代理的联合接受率均较低(最高21.4%),且各有独特失败模式。
Comments Updating the paper with more data. Will resubmit
隔离还是评分?面向成本高效的多智能体RAG的模型自适应评估
机构 * Korea University(高丽大学) ; Soongsil University(崇实大学)
专题命中 推理评测 :reasoning(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 针对多智能体文档评估中计算成本高的问题,研究训练无关干预方法,发现弱基线模型受益于文档隔离而非评分,强基线模型则依赖评分质量,提出MADARA模型自适应路由架构,实现零样本泛化并降低计算开销。
Comments 23 pages, 2 figures, 19 tables. Code: https://github.com/js-lee-AI/MADARA
量化RAG系统中的先验主导性
机构 * ArtificialGate Ltd.(ArtificialGate有限公司)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 提出归一化上下文利用(NCU)指标,通过连续token对数概率严格量化RAG系统的上下文信息增益,发现小语言模型在严格事实提取中匹配或超越大模型,且先验主导性与模型规模及专有对齐相关。
Comments 15 pages, Preprint