Evaluating Large Language Models on Spatial Tasks: A Multi-Task Benchmarking Study
专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);planning(abstract);分类 cs.CL
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);planning(abstract);分类 cs.CL
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
Comments EMNLP 2024 Workshop Genbench(https://genbench.org/workshop_programme/)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments 8 pages (excluding limitations, references and appendix) and 5 figures
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
Comments Under review at Elsevier's Engineering Applications of Artificial Intelligence
专题命中 推理评测 :reasoning(abstract);planning(abstract);self-correction(abstract);分类 cs.AI
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Journal ref Int J Artif Intell Educ (2024)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments Accepted by ACL 2024 (Main)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments NAACL 2024
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments Fine-tuned Flan-T5-xl outperforms the top #1 results of transformer-based classifier in RuSentNE-2023 competition, to appear in Lobachevskii Journal of Mathematics No.8/2024 proceedings
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments Accepted to NAACL 2024 Main Conference
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
Comments COLING 2024. The first three authors contributed equally. Project website: https://github.com/AlphaFin-proj/AlphaFin
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
文化时刻基准:评估东南亚视频文化推理与定位
机构 * Singapore Management University(新加坡管理大学) ; VNU-HCM(胡志明市国家大学)
专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI
AI总结 该研究推出东南亚文化时刻基准CMB,通过三阶段评估视觉-语言模型的文化理解能力,发现模型跨阶段能力未完全级联,音频在非拉丁文字国家多为干扰,专家对邻国概念的识别也不及随机水平。
Comments Accepted to EMNLP 2026 Main Conference, https://culturalmoment-benchmark.github.io/
基于精确贝叶斯最优标准测量语言模型的上下文内算法推理能力
机构 * Oxford Immune Algorithmics(牛津免疫算法学公司) ; Oxford University Innovation(牛津大学创新公司) ; London Institute for Healthcare Engineering(伦敦医疗工程研究所) ; King’s College London(伦敦国王学院)
专题命中 推理评测 :reasoning(title);分类 cs.AI、cs.LG
AI总结 本研究提出F-ICL基准,以精确贝叶斯最优标准测量语言模型的上下文内算法推理能力,发现多数模型分布与最优标准存在差距,该差距与准确率无关且不受模型规模缩小,基准已开放。
面向LEGO空间物理推理的样本高效后训练
机构 * HKUST(GZ)(香港科技大学(广州)) ; CUHK(香港中文大学) ; ZODA
专题命中 推理评测 :reasoning(title);分类 cs.AI、cs.LG
AI总结 针对LLM生成LEGO组装时出现的物理有效但几何语义错位问题,提出基于模型的数据选择方法和样本高效强化学习PVPO,结合体素空间几何奖励,提升结构、语义对齐和物理有效性。
Comments Technical Report V2, 20 pages, 7 figures, 9 tables
当词汇理解失效于临床推理:评估面向阿尔法世代(Gen Alpha,2010-2024年出生)的治疗机器人的安全风险
机构 * Lynbrook High School(林布鲁克高中) ; University of Trento(特伦托大学)
专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI
AI总结 本研究构建两个基准评估Claude、GPT-4o等LLM的治疗机器人安全风险,发现其存在10-14个百分点的词汇理解与临床风险校准差距,识别六种失败模式,提出四项监管与技术改进建议。
Comments 42 pages, 6 figures. Accepted at ACM FAccT '26
小语言模型中的可解释跨语言对齐:探究日英双语大语言模型的文化与语用推理
机构 * Sakaguchi–Inui Laboratory (Tohoku University)(东北大学坂口–乾实验室) ; Natural Language Understanding Team at RIKEN AIP(理化学研究所先进智能项目中心自然语言理解团队) ; Swallow Project at the Institute of Science Tokyo(东京科学大学Swallow项目) ; Sakana AI ; Tohoku University(东北大学) ; RIKEN AIP(理化学研究所先进智能项目中心) ; Institute of Science Tokyo(东京科学大学)
专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.LG
AI总结 本研究构建J-PragEval-v0基准,结合线性探针与教师强制评估探究TinySwallow-1.5B的日英语用表征,提出语用表征引导方法,下一步将扩展至Llama-3.1-Swallow-8B。
Comments 15 pages, no figures. Introduces the J-PragEval-v0 minimal-pair benchmark
意图推理以应对歧义请求
机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院)
专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI
AI总结 本文提出生成结构化响应以枚举歧义请求的不同解释,通过强化学习训练模型提升覆盖有效解释的召回率和抑制虚假解释的精确率,实验表明方法在覆盖有效答案方面优于基线方法。
Comments COLM 2026
Multi-Legal-Bench: 跨司法管辖区、语言和法律传统的法律推理评估LLM
机构 * SecondLayer
专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI
AI总结 提出Multi-Legal-Bench,首个跨司法管辖区法律基准,在6个国家、4个语系和1.34亿份法院判决上评估LLM,发现少样本效果跨辖区复制、无单一模型主导所有语言、跨语言迁移不遵循语言邻近性、分词器效率不显著预测跨语言准确率。
Comments 17 pages, 5 figures, 9 tables. v2 corrects scorer and taxonomy defects, adds no-model baselines showing label leakage, re-runs the Lithuanian cells on de-leaked text, and withdraws the claim that few-shot helps on judgment-form classification everywhere; all tables and figures regenerated. Dataset: https://huggingface.co/datasets/overthelex/multi-legal-bench
OncoTriad-QA:用于泛癌推理的患者级放射学-病理学-基因组学基准
专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI
AI总结 本文提出OncoTriad-QA多模态癌症问答基准及OncoVLM模型,实验显示OncoVLM经微调后在泛癌问答任务上优于现有模型,该基准可用于相关模型的训练与评估。
DRIP-R:零售领域决策与推理在现实政策模糊性下的基准测试
机构 * Interdisciplinary Transformation University Austria(跨学科转型大学奥地利) ; Amazon Berlin(亚马逊柏林)
专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI
AI总结 DRIP-R基准测试通过现实零售政策模糊性构建无唯一正确解决方案的场景,评估LLM在模糊政策下的决策与推理能力,揭示其固有的系统性挑战。
Comments 10 pages
超越自我认知:在语言模型中跨推理与检索传播不确定性
专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI
AI总结 研究在知识密集型问答中,利用黑盒语言模型的置信度指导检索路由。核心方法是BeyondUncertainty,先得临时答案和置信度,依阈值决定检索策略。该方法提升了平均词元级F1,减少检索段落,在多数设置中优于随机分配,揭示了证据获取与词元效率的权衡。
Comments 9 pages, 6 figures, 6 tables
HALO:语言模型的混合自适应潜在推理
机构 * Lockheed Martin(洛克希德·马丁公司)
专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.LG
AI总结 研究如何用少量自适应计算改进预训练语言模型,提出HALO混合自适应潜在细化方法,结合粗略与选择性第二阶段细化。在基准比较中,HALO成绩最佳,使用细化步骤少,兼具更好的细化分配,计算量也少。
Comments 15 pages, 4 figures, preprint
基于评分量表的专家级临床推理任务中前沿语言模型的受控比较
机构 * Prime Analytics Consulting Limited(普林特分析咨询有限公司) ; Talbert House(塔尔伯特大楼;托马斯·莫尔大学) ; Thomas More University(MAKZ) ; MAKZ
专题命中 推理评测 :reasoning(title);分类 cs.AI、cs.LG
AI总结 通过5个专家编写的临床场景和加权评分量表,评估GPT、Claude和Gemini三个前沿模型,发现关键标准通过率低(32-42%),而低权重标准通过率高(80-90%),52%的关键标准无模型通过。
Comments 13 pages, 4 tables
MacroLens:宏观经济情景下的多任务上下文金融推理基准
机构 * KAIST(韩国科学技术院)
专题命中 推理评测 :reasoning(title);分类 cs.AI、cs.LG
AI总结 针对金融决策中价格、基本面、宏观和文本四信号联合评估的缺失,构建了涵盖4426只美股、七个任务、1130个宏观事件的基准,评估19种方法,揭示上下文特征的重要性。
Comments 25 pages, 3 figures
上下文胜过计算 人类在环优于迭代思维链提示在面试回答质量上的表现
专题命中 推理评测 :chain-of-thought(title);分类 cs.CL、cs.AI
AI总结 本文通过对比人类在环和自动思维链提示方法,发现人类在环在面试回答质量评估中表现更优,且迭代次数更少,同时具有更高的训练效果。
AtomWorld: 评估大型语言模型在晶体材料空间推理能力的基准
机构 * University of New South Wales, NSW, Sydney, Australia(新南威尔士大学,新州,悉尼,澳大利亚) ; Suzhou Institute for Advanced Research, University of Science(苏州先进研究院,科学大学) ; Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) ; Cornell University(康奈尔大学)
专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI
AI总结 提出AtomWorld基准,通过十种基本原子结构操作评估LLM在材料科学中的空间推理能力,发现Claude Opus 4.6表现最佳但复杂空间关系操作成功率低,表明LLM更适合作为辅助工具而非完全自主的科研代理。