ChartWalker: Benchmarking the Cross-Chart RAG Task with Hierarchical Knowledge Graphs
ChartWalker: 跨图表RAG任务的基准测试
专题命中 测试时计算 :reasoning(abstract)
AI总结 提出ChartWalker框架,通过层次化知识图谱和结构感知采样生成跨图表RAG基准,揭示现有方法性能差距。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
ChartWalker: 跨图表RAG任务的基准测试
专题命中 测试时计算 :reasoning(abstract)
AI总结 提出ChartWalker框架,通过层次化知识图谱和结构感知采样生成跨图表RAG基准,揭示现有方法性能差距。
理论家工具箱:基于智能体的LLM辅助经济理论研究工具
专题命中 测试时计算 :verifier(abstract)
AI总结 提出一种验证优先的经济理论LLM辅助协议,通过三种可重用方法(单次检查、对抗性证明-验证对、多智能体项目)在等级膨胀的Gans-Kominers特征模型上设计Groves/Pigouvian激励机制的实例验证。
通过群体相对策略优化在结构因果模型中 grounding 多跳推理
机构 * School of Computer Science and Technology, Xinjiang University, Urumqi, China(新疆大学计算机科学与技术学院,乌鲁木齐,中国) ; Beijing Institute of Technology, Beijing, China(北京理工大学,北京,中国) ; Military Science Information Research Center, Academy of Military Science, Beijing, China(军事科学院军事科学信息研究中心,北京,中国)
专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract_cn);分类 cs.AI
AI总结 本文提出基于结构因果模型的多跳事实验证框架,通过群体相对策略优化解决推理链长度与准确率的平衡问题,实验表明其在HoVer和EX-FEVER数据集上优于现有方法。
视觉-语言模型缺少什么?探究它们在因果顺序推理中的困难
机构 * University of Southern California(南加州大学) ; University of California, Santa Barbara(加州大学圣芭芭拉分校) ; Texas A&M University(德克萨斯A&M大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL
AI总结 针对VLM在因果推理中的不足,提出VQA-Causal和VCR-Causal基准,发现模型在因果任务上仅略优于随机猜测,归因于训练数据缺乏因果表达,并通过难负例微调改善。
Comments 13 pages
从“顿悟时刻”到可控思考:通过解耦推理与控制实现大型推理模型中的元认知推理
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Chongqing University of Posts and Telecommunications(重庆邮电大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI
AI总结 针对大型推理模型过度思考问题,提出元认知推理框架MERA,通过解耦推理与控制、构建推理-控制交替序列训练,结合控制段策略优化,提升推理效率与准确性。
SAFARI: 通过主动调查扩展长时域智能体故障归因
机构 * Department of Engineering Sciences(工程科学系) ; Applied Mathematics, Northwestern University(应用数学,西北大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 提出SAFARI框架,用工具增强的诊断循环替代线性上下文加载,结合短期记忆解耦诊断准确性与上下文限制,在Who&When和TRAIL GAIA数据集上分别提升20%和19%,并在超出上下文窗口5倍时保持0.58精度。
Comments Published at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026
VeriPilot:一个基于LLM的Verilog调试框架
机构 * State Key Lab of Processors, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所国家专用集成电路设计实验室) ; University of Chinese Academy of Sciences(中国科学院大学) ; North China Electric Power University(华北电力大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 提出VeriPilot框架,利用黄金参考模型和LLM实现细粒度Verilog调试,通过内部变量语义对齐和CDFG信号追踪定位并修复错误,在CVDP基准上将GPT-4o修复成功率从54.3%提升至85.71%。
Comments 13 pages, 6 figures
ErrorLLM: 为文本到SQL精炼建模SQL错误
机构 * The Hong Kong Polytechnic University(香港理工大学) ; City University of Macau(澳门城市大学) ; Jilin University(吉林大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Beihang University(北航大学)
专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL
AI总结 提出ErrorLLM框架,通过专用错误令牌和结构特征显式建模SQL错误,结合静态检测与错误引导精炼,显著提升文本到SQL生成质量。
Comments Accepted to SIGKDD2026
代理时代的多媒体与可视化分析
机构 * University of Amsterdam(阿姆斯特丹大学) ; Czech Technical University in Prague(布拉格捷克技术大学) ; Eindhoven University of Technology(埃因霍温理工大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI
AI总结 本文提出一个框架,将多媒体与可视化分析结合,以支持专业用户从大规模多媒体集合中获取可操作见解,实现人类与AI的真正协作。
通用指南驱动图像聚类:基于混合LLM代理
机构 * The University of Texas at Arlington(德克萨斯大学阿灵顿分校) ; Amazon(亚马逊)
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 提出首个通用图像聚类框架,通过文本指南弥合任务差异,利用生成式概念代理建模和基于最小生成树的LLM遍历,在多种聚类场景中超越专用方法。
Comments CVPR 2026
基于s(CASP)的复杂自主无人机任务执行与决策
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 提出使用s(CASP)回答集编程系统构建符号状态中心的无人机代理,在虚幻引擎5环境中实现基于约束的常识推理,支持多步骤自主行为并动态调整计划,确保决策正确可解释。
MSPL: 用于开放词汇目标检测的多步伪标签方法
机构 * KAIST AI(韩国韩世大学AI研究所) ; Boston University(波士顿大学)
专题命中 复杂问题求解 :reasoning(abstract)
AI总结 提出MSPL框架,通过多步视觉推理(目标定位、类别识别、背景确认)生成伪标签,解决开放词汇检测中单步图像-文本匹配忽略中间推理步骤的问题,在OV-COCO和OV-LVIS上取得最优性能。
Comments This paper has been accepted by ECCV 2026
UniDrive: 面向自动驾驶可解释风险理解的统一视觉-语言与定位框架
机构 * organization= Department of Earth Science \& Engineering, Imperial College London , city= London , postcode= SW7 2AZ , country= United Kingdom ; organization= SpaceTimeLab, Department of Civil, Environmental ; Geomatic Engineering, University College London , city= London , postcode= WC1E 6BT , country= United Kingdom ; organization= Department of Computing, The Hong Kong Polytechnic University , city= Hong Kong , country= China ; organization= Trinity College, University of Oxford , city= Oxford , postcode= OX1 3BH , country= United Kingdom ; organization= Department of Geography, University College London , city= London , postcode= WC1E 6BT , country= United Kingdom ; organization= Centre for Global Infrastructure Resilience, The Bartlett School of Sustainable Construction, University College London , city= London , postcode= WC1E 7HB , country= United Kingdom
专题命中 推理评测 :reasoning(summary_cn,abstract);分类 cs.AI
AI总结 提出UniDrive框架,通过融合时序推理与高分辨率感知分支,联合生成风险描述和边界框定位,在DRAMA-Reasoning基准上超越现有方法,提升小目标定位和可解释性。
LLM时代:战争迷雾下大型语言模型的推理、外交与可靠性的战略1v1基准测试
机构 * Independent researcher, Switzerland(瑞士独立研究员)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出Age of LLM基准,在13x7网格上让两个LLM进行1v1对战,包含战争迷雾、完全外交和严格JSON格式可靠性维度,通过54场比赛评估15个推理模型,发现核冲刺主导、外交频繁但极少达成、非法动作反映信念追踪,并初步关联可靠性与获胜。
Comments 25 pages including appendices, 8 figures, 4 tables; appendices include verbatim system prompt and engine resolution pseudocode. All correlations reported with p-values, 95% bootstrap confidence intervals and Spearman's rho; includes a Steiger test and Bradley-Terry fit
CineCap: 基于时空锚点的结构化推理用于电影化视频描述
机构 * The Chinese University of Hong Kong(香港中文大学) ; Xiamen University(厦门大学) ; Kling Team, Kuaishou Technology(快手科技Kling团队) ; National University of Singapore(新加坡国立大学) ; Southern University of Science and Technology(南方科技大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 提出CineCap框架,通过时空锚点结构化推理和强化学习(覆盖完整性、准确性和门控覆盖奖励)生成电影化视频描述,在CineCap Bench基准上达到新最优。
Comments 10 pages, 4 figures
AGORA:基于档案的智能体工作场所文档推理基准
机构 * Fudan University(复旦大学) ; Zhejiang University(浙江大学) ; Shanghai Qiji Zhifeng Co., Ltd.(上海奇绩智峰有限公司)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 提出AGORA基准,包含362个问题、8个领域共9664份真实文档(3.72亿词元),要求智能体在超大档案中主动搜索稀疏证据并推理答案,最强模型准确率仅59.4%。
法律推理不是律师工作:重新思考面向自助诉讼的司法基准
机构 * Yale Law School, USA(耶鲁法学院,美国)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 本文指出当前法律AI基准仅评估专家预处理后的输入,忽略了自助诉讼者提供的杂乱、有误的提示,导致模型性能高估;通过实验展示上下界差距,呼吁建立直接衡量鲁棒性的基准。
Comments Both authors contributed equally. Accepted to the AI4Law Workshop at ICML 2026
比较还是不比较:论评估社会偏见的方法论实践
机构 * Tsinghua University(清华大学) ; The Hebrew University of Jerusalem(耶路撒冷希伯来大学) ; Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt and National Research Center for Applied Cybersecurity ATHENE(普适知识处理实验室(UKP Lab),计算机科学系,达姆施塔特工业大学及国家应用网络安全研究中心ATHENE)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
AI总结 提出统一框架标准化异构基准,揭示孤立评估与强制比较设置间的系统性范式差距,发现比较设置会催化潜在歧视,且链式思维推理加剧偏见,规模越大偏见越强。
量化RAG系统中的先验主导性
机构 * ArtificialGate Ltd.(ArtificialGate有限公司)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 提出归一化上下文利用(NCU)指标,通过连续token对数概率严格量化RAG系统的上下文信息增益,发现小语言模型在严格事实提取中匹配或超越大模型,且先验主导性与模型规模及专有对齐相关。
Comments 15 pages, Preprint
Rule2Text:知识图谱规则的自然语言解释生成与评估框架
机构 * University of Texas at Arlington(德克萨斯理工大学)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 提出Rule2Text框架,利用大语言模型将知识图谱挖掘的逻辑规则转化为自然语言解释,通过人类评估和LLM-as-a-judge验证,微调开源模型显著提升解释质量。
Comments arXiv admin note: text overlap with arXiv:2507.23740
当有用性凌驾于因果谨慎之上:LLM中的上下文依赖抑制与恢复
机构 * Mitsubishi Research Institute, Inc.(三菱电机研究所) ; Kobe University(北九州市立大学)
专题命中 推理评测 :reasoning(abstract);self-correction(abstract);分类 cs.AI
AI总结 研究LLM从学术到实践咨询语境中因果谨慎的系统性抑制,发现有用性导向响应模式导致因果谨慎表达大幅下降,而自纠正提示可有效恢复。
Comments 43 pages, 3 figures, 5 tables. SSRN Abstract ID: 6965680
CAVEWOMAN: 大型语言模型在语言输入和输出压缩下的行为
机构 * Independent(独立研究者) ; Adobe Research(Adobe研究院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出双通道评估协议CAVEWOMAN,发现输出压缩降低API模型成本(1.4-2.4倍),输入压缩反而增加成本(~1.15倍)并导致准确率下降和文本偏离。
物理科学中的深度研究:多智能体框架与综合基准
专题命中 推理评测 :reasoning(abstract);planning(abstract)
AI总结 提出PhySciBench基准评估LLM在物理科学中的深度研究能力,并开发DelveAgent多智能体框架,通过自适应规划、双粒度记忆和分层反思机制提升准确率并降低推理成本。
Comments v3: fix error and add data, codes publicly link on Abstract
脚手架下的安全性:评估条件如何影响测量的安全性
机构 * Harvard University(哈佛大学) ; MIT(麻省理工学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究通过62,808次盲法预注册评估,测试了六种前沿模型在四种部署配置下的安全性,发现脚手架架构对安全性影响较小,而格式转换(如选择题与开放式问题)可导致5-20个百分点的测量差异,且模型-脚手架间存在显著异质性,质疑了单一综合安全性分数的实用性。
Comments 74 pages including appendices. 6 frontier models, 62,808 primary observations (~89k total). Pre-registered: OSF DOI 10.17605/OSF.IO/CJW92. Code and data: https://github.com/davidgringras/safety-under-scaffolding
无窥调优:可证明的泛化边界与鲁棒的大语言模型后训练
机构 * Meta FAIR ; LISN, Inria, CNRS(LISN,Inria,CNRS) ; NYU Courant Institute(NYU Courant学院)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出BBoxER黑盒进化方法用于LLM后训练,通过隐式压缩数据诱导信息瓶颈,提供非平凡泛化边界和对数据投毒、提取攻击的鲁棒性理论保证,实验证明其有效性和隐私保护。
Riemann-Bench: 面向登月级数学的基准测试
机构 * Surge AI
专题命中 推理评测 :reasoning(abstract,comments);分类 cs.AI;logical reasoning(comments)
AI总结 提出Riemann-Bench基准,由专家设计研究级数学问题,评估AI系统超越奥数水平的推理能力,结果显示前沿模型得分低于10%。
Comments Accepted to Logical Reasoning of Large Language Models, ICLR 2026
AdversaBench: 基于多裁判确认与跨模型迁移性的自动化大语言模型红队测试
机构 * Indian Institute of Technology Jodhpur(印度理工学院焦特布尔分校)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出AdversaBench端到端红队测试流水线,使用五种结构化算子变异种子提示,通过三裁判加元裁判机制确认失败,实验发现算子效果因类别而异、二元失败率掩盖难度、裁判一致性受标签偏斜影响、对抗提示可跨模型迁移。
Comments 10 pages, 4 figures, 5 tables. Code and data at https://github.com/khanak0509/AdversaBench
RoPE感知的KV缓存量化比特分配
机构 * Hong Kong University of Science and Technology(香港科技大学) ; The Chinese University of Hong Kong(香港中文大学) ; MiMo, Xiaomi Corporation(小米集团 MiMo)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 针对RoPE下键缓存量化中不同频率块对误差敏感度不同的问题,提出Block-GTQ比特分配器,通过能量评分和贪心分配提升量化精度,在长上下文任务中显著恢复性能。
Comments Preprint. Code available at https://github.com/JIA-Lab-research/blockgtq
多轮LLM对话中NFR评估的准确性与满意度
机构 * University of Maine(缅因大学) ; University of Notre Dame(圣母大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究开发者在与LLM对话助手评估非功能需求(NFR)时的准确性和满意度,发现开发者倾向于同意LLM评估但准确性低,且长回复和过多信息提供轮次降低满意度,而主动交互提升满意度。
Comments 9 pages, 5 figures. Accepted to SIGDIAL 2026 (27th Annual Meeting of the Special Interest Group on Discourse and Dialogue)
SHERLOC: 代码修复智能体的结构化诊断定位
机构 * NVIDIA(英伟达) ; Santa Clara, CA 95051, USA(美国加利福尼亚州圣克拉拉) ; TU Darmstadt(达姆施塔特工业大学) ; National Research Center for Applied Cybersecurity ATHENE(国家应用网络安全研究中心 ATHENE)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 提出SHERLOC框架,通过推理LLM与紧凑仓库工具及自恢复机制,实现无需微调的结构化诊断定位,在SWE-Bench上达到最优定位精度,并提升修复率、降低令牌消耗。