Game-Theoretic Multi-Agent Control for Robust Contextual Reasoning in LLMs
面向鲁棒上下文推理的博弈论多智能体控制方法在LLMs中的应用
专题命中 推理评测 :reasoning(title,abstract)
AI总结 针对LLMs在多轮交互中易受提示注入和上下文投毒攻击的问题,提出GT-MCP方法,通过博弈论多智能体控制和自愈机制,将上下文漂移限制在99.6%的轮次内,且控制器级注入攻击零成功。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
面向鲁棒上下文推理的博弈论多智能体控制方法在LLMs中的应用
专题命中 推理评测 :reasoning(title,abstract)
AI总结 针对LLMs在多轮交互中易受提示注入和上下文投毒攻击的问题,提出GT-MCP方法,通过博弈论多智能体控制和自愈机制,将上下文漂移限制在99.6%的轮次内,且控制器级注入攻击零成功。
用于诊断推理模型中未知未知的结构化无知证书的校准
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI、cs.LG
AI总结 提出结构化无知证书(SICs)输出格式,通过GRPO微调14B模型,使模型在无法回答时明确承认知识缺失并生成检索查询,在未知未知问题上实现99.46%的JSON有效性和0.967的证书特异性分数。
Comments Accepted in ICML 2026 Workshop: Epistemic Intelligence in Machine Learning
超越预测:EHR集成临床AI中的纵向推理
专题命中 推理评测 :reasoning(title,abstract)
AI总结 本文分析当代临床AI系统如何集成电子健康记录数据及其支持纵向临床推理的程度,提出编码框架,发现系统主要基于单次就诊或聚合表示,缺乏跨时间推理,并建议未来系统应更符合临床实践的时间与解释结构。
WorldBench: 一个具有挑战性且视觉多样的多模态推理基准
机构 * Princeton University(普林斯顿大学) ; NYU(纽约大学) ; University of Waterloo(滑铁卢大学) ; Meta, FAIR(Meta和FAIR)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 提出WorldBench,通过构建多领域视觉概念分类法并收集多样化图像,设计前沿MLLM难以回答的问题,以评估多模态大语言模型的视觉理解能力,揭示其弱点。
Comments Project page: https://worldbench-vl.github.io/
人工智能代理知道任务何时简单吗?迈向复杂性感知推理与执行
专题命中 推理评测 :reasoning(title,comments);分类 cs.CL、cs.AI
AI总结 研究探讨LLM代理缺乏任务感知执行范围估计能力,提出E3方法,在MSE-Bench基准测试及真实模型工具中验证,该方法能在保证成功率时大幅降低成本,推动迈向工程基础人工智能,还发布了框架和基准。
Comments 27 pages, 8 figures, 8 tables. Code and benchmark: https://github.com/eejyin/Do-AI-Agents-Know-When-a-Task-Is-Simple-Toward-Complexity-Aware-Reasoning-and-Execution
Gaokerena:一个小型波斯语医疗语言模型家族
机构 * University of Isfahan(伊斯法罕大学) ; University of Tehran(德黑兰大学) ; University of Windsor(温莎大学) ; Alzahra University(阿勒扎哈拉大学) ; University of Texas at Dallas(德克萨斯大学达拉斯分校)
专题命中 推理评测 :chain-of-thought(abstract,abstract_cn);reasoning(abstract);分类 cs.CL
AI总结 针对波斯语医疗语言模型研究不足的问题,该研究推出Gaokerena家族,包含Gaokerena-V和Gaokerena-R两款模型,在医疗问答基准上取得性能提升,还配备不确定性头,为本地化数字医疗提供基础但仍需完善。
Comments 29 pages, 9 figures
比较还是不比较:论评估社会偏见的方法论实践
机构 * Tsinghua University(清华大学) ; The Hebrew University of Jerusalem(耶路撒冷希伯来大学) ; Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt and National Research Center for Applied Cybersecurity ATHENE(普适知识处理实验室(UKP Lab),计算机科学系,达姆施塔特工业大学及国家应用网络安全研究中心ATHENE)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
AI总结 提出统一框架标准化异构基准,揭示孤立评估与强制比较设置间的系统性范式差距,发现比较设置会催化潜在歧视,且链式思维推理加剧偏见,规模越大偏见越强。
ThinkDeception: 一种用于可解释多模态欺骗检测的渐进式强化学习框架
机构 * Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学)
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.AI
AI总结 提出ThinkDeception框架,将多模态大语言模型引入欺骗检测,通过逐步推理和视觉-音频一致性组相对策略优化(VAC-GRPO)实现可解释的认知推理,在主流基准上达到新SOTA。
Comments 10pages,4figures
用大型语言模型模拟学生的Java编程错误
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 推理评测 :CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL
AI总结 探索用LLM模拟学生编程错误,评估五种模型在多样性和对齐性上的表现,发现Claude Sonnet 4平衡最佳,且合成错误与真实错误难以区分。
小语言模型中的可解释跨语言对齐:探究日英双语大语言模型的文化与语用推理
机构 * Sakaguchi–Inui Laboratory (Tohoku University)(东北大学坂口–乾实验室) ; Natural Language Understanding Team at RIKEN AIP(理化学研究所先进智能项目中心自然语言理解团队) ; Swallow Project at the Institute of Science Tokyo(东京科学大学Swallow项目) ; Sakana AI ; Tohoku University(东北大学) ; RIKEN AIP(理化学研究所先进智能项目中心) ; Institute of Science Tokyo(东京科学大学)
专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.LG
AI总结 本研究构建J-PragEval-v0基准,结合线性探针与教师强制评估探究TinySwallow-1.5B的日英语用表征,提出语用表征引导方法,下一步将扩展至Llama-3.1-Swallow-8B。
Comments 15 pages, no figures. Introduces the J-PragEval-v0 minimal-pair benchmark
OncoTriad-QA:用于泛癌推理的患者级放射学-病理学-基因组学基准
专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI
AI总结 本文提出OncoTriad-QA多模态癌症问答基准及OncoVLM模型,实验显示OncoVLM经微调后在泛癌问答任务上优于现有模型,该基准可用于相关模型的训练与评估。
HALO:语言模型的混合自适应潜在推理
机构 * Lockheed Martin(洛克希德·马丁公司)
专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.LG
AI总结 研究如何用少量自适应计算改进预训练语言模型,提出HALO混合自适应潜在细化方法,结合粗略与选择性第二阶段细化。在基准比较中,HALO成绩最佳,使用细化步骤少,兼具更好的细化分配,计算量也少。
Comments 15 pages, 4 figures, preprint
基于评分量表的专家级临床推理任务中前沿语言模型的受控比较
机构 * Prime Analytics Consulting Limited(普林特分析咨询有限公司) ; Talbert House(塔尔伯特大楼;托马斯·莫尔大学) ; Thomas More University(MAKZ) ; MAKZ
专题命中 推理评测 :reasoning(title);分类 cs.AI、cs.LG
AI总结 通过5个专家编写的临床场景和加权评分量表,评估GPT、Claude和Gemini三个前沿模型,发现关键标准通过率低(32-42%),而低权重标准通过率高(80-90%),52%的关键标准无模型通过。
Comments 13 pages, 4 tables
MacroLens:宏观经济情景下的多任务上下文金融推理基准
机构 * KAIST(韩国科学技术院)
专题命中 推理评测 :reasoning(title);分类 cs.AI、cs.LG
AI总结 针对金融决策中价格、基本面、宏观和文本四信号联合评估的缺失,构建了涵盖4426只美股、七个任务、1130个宏观事件的基准,评估19种方法,揭示上下文特征的重要性。
Comments 25 pages, 3 figures
SmellCC:一种用于自动修复代码异味的工具
专题命中 推理评测 :CoT(abstract,abstract_cn);chain-of-thought(abstract)
AI总结 SmellCC是一款Visual Studio Code扩展,结合SonarQube与LLM流水线,采用思维链和少样本学习,可一键修复Python前10种常见代码异味,清洁率96.8%、准确率91.3%,能提升软件可维护性。
JoyAI-Talker:面向共情语音智能体的全双工语音交互大模型
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract)
AI总结 JoyAI-Talker采用Thinker-Talker架构等技术,实现兼具强推理能力与共情交互的全双工语音对话系统,在基准测试及用户打断、背景语音场景下表现优异。
LeAct:从专家行动中学习推理
机构 * Princeton University(普林斯顿大学)
专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究如何从专家行动中恢复思维链,提出LeAct方法,通过优化潜在变量,让学生为专家行动采样候选思维链并保留有效链。该方法在多个博弈和机器人基准测试中表现出色,使专家系统成为基础模型推理教师的新来源。
Comments 27 pages, 3 figures, 11 tables
使用确定性真实数据评估长文本生成中语言模型的不确定性
机构 * Technion(技术学院) ; Nvidia(英伟达)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对长文本生成中语言模型不确定性评估难题,引入含单一确定性长文本真值的SALT基准,通过对50多个模型分析揭示关键见解,如置信函数作用、错误驱动因素及推理影响等,为风险关键应用提供参考。
Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026). Code available at https://github.com/IdoAmit198/SALT
超越“一种语言,一种文字”:用PuMVR量化多语言视觉语言模型中的正字法偏差
机构 * RediMinds Inc.(RediMinds公司) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出PuMVR基准,通过旁遮普语三种文字的图像推理任务,量化多语言视觉语言模型中的文字依赖偏差,发现文字一致性率低至24.8%,视觉输入无法消除偏差。
Comments 22 pages, 4 figures. Accepted to the 4th Workshop on Cross-Cultural Considerations in NLP (C3NLP) @ ACL 2026
大型语言模型在医学推理中表现出元认知敏感性
专题命中 推理评测 :reasoning(title);分类 cs.AI
AI总结 本研究开发临床基准测试医学LLM,发现其在AT-NCD与DRCI鉴别中具部分元认知敏感性,错误集中于冲突病例,建立了医学LLM相关评估框架。
超越局部准确率:面向受控大语言模型推理评估的协议级可识别性审计
机构 * School of Statistics and Data Science, Southwestern University of Finance and Economics(西南财经大学统计与数据科学学院)
专题命中 推理评测 :reasoning(title);分类 cs.CL
AI总结 该研究提出协议级可识别性审计方法,无需调用模型即可验证LLM评估协议的有效性,发现基础准确率与选择性响应保真度存在显著差异,还确定了冻结策略类的最小识别支持。
Comments 15 pages, 9 figures. Ning Huang, Ziqi Sha, and Wenxuan Tang contributed equally as second authors. Wei Deng is the corresponding author
超越正确性:通过可扩展的智能体判断标注增强代码大模型的架构推理能力
机构 * Centre for Software Excellence, Huawei Canada(华为加拿大软件卓越中心) ; Department of Computer Science, University of Manitoba, Canada(曼尼托巴大学计算机科学系) ; School of Computing, Queen’s University, Canada(皇后大学计算科学学院)
专题命中 推理评测 :reasoning(title);分类 cs.AI
AI总结 针对代码大模型缺乏架构理解的问题,提出智能体判断流水线,利用强LLM作为专家架构评估的代理,通过两个判断器(ACJ和AQJ)实现可扩展标注,微调模型在SWE-bench上提升高达540%,并展现跨语言泛化能力。
立场:视觉-语言-动作模型无法被验证执行物理推理
专题命中 推理评测 :reasoning(title);分类 cs.AI
AI总结 本文指出基于预训练视觉-语言模型的VLA系统在机器人操作基准上的性能提升无法区分语义匹配与物理泛化,现有评估指标不能验证物理推理能力。
LLaMA 3.1-8B-Instruct中的框架条件化道德计算:伦理推理的机械可解释性审计
机构 * KD Consulting, CA, USA(KD咨询公司,美国加利福尼亚州) ; New York University, NY, USA(纽约大学,美国纽约州)
专题命中 推理评测 :reasoning(title);分类 cs.AI
AI总结 通过机械可解释性平台分析LLaMA 3.1-8B-Instruct在54个道德提示上的内部计算,发现情境锚定效应:领域特定表示主导激活列表顶部,模型道德能力恒定但显著性高度依赖于提示选择的解释框架。
Comments 47 pages, 10 figures
迈向可验证的自主数据科学:通过基于工具的推理解决不规则时间序列问答
机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 推理评测 :reasoning(title);分类 cs.AI
AI总结 针对现实世界时间序列数据的不规则性,提出IRTS-ToolBench基准(1700个问题,10种任务类型,13个领域),通过标准化输入和可复现评估协议,研究LLM和AI代理在不规则条件下的表现。
Comments 15 pages
Avalon-ToM-Bench:通过非对称游戏机制评估细粒度心理理论
机构 * National Taiwan University(台湾大学) ; CyCraft AI Lab(CyCraft人工智能实验室)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 本文提出Avalon-ToM-Bench基准,基于阿瓦隆游戏机制评估大语言模型的细粒度心理理论,发现模型ToM能力不足源于推理策略而非知识或表征,推理训练比测试时思维链增益更显著。
ComboShoppingBench:评估大型语言模型智能体在带优惠券的预算约束组合购物篮任务中的表现
专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 本研究推出ComboShoppingBench组合购物基准,通过探索智能体、LLM评判者及确定性验证,发现各类LLM智能体在该基准上表现不佳,凸显其在约束感知组合购物上仍有巨大改进空间。
WuYuEval:面向固体废物管理的大语言模型多级基准测试
专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 WuYuEval是面向固体废物管理的多级基准测试,含基础与专家模块,评估33个LLM的SWM能力,发现其在专业任务表现差,为开发专用基础模型提供依据。
易完成,难选择:探究大型语言模型在ProverbIT基准上的性能
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 该研究构建了意大利谚语基准ProverbIT,评估13个前沿LLMs的谚语处理能力,发现LLMs虽能完成谚语任务,但在无正确答案的选择题中性能骤降,暴露其依赖记忆而非深层语义理解的局限。
Journal ref Proceedings of the Eleventh Italian Conference on Computational Linguistics (CLiC-it 2025), pages 722-734
前沿视觉语言模型的心智理论跨任务解离
机构 * University of Maryland(马里兰大学)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 该研究评估9个前沿VLM在两项心理学衍生ToM任务中的表现,发现其ToM特征存在跨任务解离,无模型在两项任务中均接近典型发展成人,推理可改善部分模型在导演任务中的表现。