WildSci: Advancing Scientific Reasoning from In-the-Wild Literature
WildSci: 从真实文献中推进科学推理
机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 WildSci通过自动合成领域特定科学问题数据集,提升科学推理的可扩展性和可持续性。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
WildSci: 从真实文献中推进科学推理
机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 WildSci通过自动合成领域特定科学问题数据集,提升科学推理的可扩展性和可持续性。
循环推理:理解大推理模型中的自增强循环
机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全国家重点实验室) ; University of Chinese Academy of Sciences(中国科学院大学) ; People’s Public Security University of China(中国人民公安大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出LoopBench数据集和CUSUM算法,用于识别和预测大型推理模型中的自增强循环问题,揭示循环推理的机理并提升模型稳定性。
AlgBench: 大型推理模型对算法的理解程度有多高?
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The Hong Kong University of Science and Technology(香港科技大学) ; Beijing Institute of Technology(北京理工大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 AlgBench通过算法为中心的基准测试揭示大型推理模型在算法理解上的性能差异和局限性。
Comments Under review
你的推理基准可能并未测试推理:揭示抽象推理基准中的感知瓶颈
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 研究发现抽象推理基准中的性能差距主要源于视觉感知限制,而非推理能力不足,需设计分离感知与推理的评估方法。
SPAN:大型语言模型跨日历时间推理的基准测试与改进
机构 * Li Auto(利亚特)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 SPAN通过开发时间代理提升大型语言模型跨日历时间推理能力,实验显示其准确率高达95.31%
Comments Accepted at the AAAI 2026 conference. This version includes the supplementary appendix
基于地图的思考:用于地理定位的强化并行地图增强智能体
机构 * Xiamen University(厦门大学) ; AMAP, Alibaba Group(阿里集团AMAP) ; Southern University of Science and Technology(南方科技大学)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 本文提出基于地图的强化并行智能体,通过两阶段优化提升地理定位精度,实验显示在Acc@500m指标上显著优于现有模型。
K-EXAONE 技术报告
机构 * LG AI Research(LG人工智能研究所)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 K-EXAONE是一款由LG AI Research开发的大型多语言语言模型,基于专家混合架构,支持256K-token上下文窗口,具备多语言能力,其性能与同类开源模型相当,适用于多种工业和研究应用。
Comments 29 pages
LLMs作为Solidity的验证或者
机构 * University of Cagliari, Italy(卡利亚里大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文探讨了使用LLMs评估Solidity合同属性有效性的潜力,通过实证研究展示其在智能合约验证中的应用效果。
并非所有发光的都是金子:一个无参考信息的反事实金融虚假信息检测基准
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 RFC Bench通过对比上下文提升金融虚假信息检测性能,揭示无参考设置下的模型局限性。
Comments 48 pages; 24 figures
适应于超高分辨率语义分割的视觉变换器:通过中继标记
专题命中 推理评测 :reasoning(abstract)
AI总结 通过引入中继标记,该方法在视觉变换器中实现多尺度推理,提升超高清语义分割的性能,实现局部细节与全局意识的平衡。
Comments 13 pages +3 pages of suppmat
联合训练遥感多任务学习的视觉语言模型
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Shanghai Jiao Tong University(上海交通大学) ; Xidian University(西安电子科技大学) ; East China Normal University(东华大学) ; Wuhan University(武汉大学) ; Southeast University(东南大学) ; National University of Defense Technology(国防科技大学) ; Chinese University of Hong Kong(香港中文大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 RSCoVLM通过联合训练视觉语言模型,提升遥感多任务学习的性能和灵活性。
Comments 14 pages, 6 figures
基于大语言模型的电力系统动态模型发现:LLM-DMD
专题命中 推理评测 :reasoning(abstract)
AI总结 LLM-DMD通过结合大语言模型的推理和代码生成能力,利用两个循环发现电力系统动态方程并强制代数约束,从而实现高保真动态模型的构建。