FEABench: Evaluating Language Models on Multiphysics Reasoning Ability
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
Comments 39 pages. Accepted at the NeurIPS 2024 Workshops on Mathematical Reasoning and AI and Open-World Agents
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
Comments 39 pages. Accepted at the NeurIPS 2024 Workshops on Mathematical Reasoning and AI and Open-World Agents
重新审视Agentic-SQL:面向LLM文本转SQL的基于自主性的分类与实证基准分析
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 本研究针对LLM文本转SQL领域,构建基于自主性的分类框架,通过Spider案例研究分析8B开源模型与DeepSeek-V3等基线的表现,发布工具链用于构建可追溯的基准排行榜。
LLM编排何时划算?关于准确率、成本与任务难度的对照评估
机构 * Zuse Institute Berlin(柏林Zuse研究所) ; TU Berlin(柏林工业大学) ; Weizenbaum Institute Berlin(柏林魏茨曼研究所)
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 该研究对照评估了Self-Refine等三种LLM编排方法与基线方法在5种骨干模型、3个领域的表现,发现编排收益依赖模型,需权衡准确率提升与额外推理成本。
视觉语言模型的持续学习:超越遗忘的综述与分类
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.LG
AI总结 本文综述了视觉语言模型的持续学习挑战,提出四种核心范式以解决跨模态特征漂移和灾难性遗忘问题,强调零样本学习和智能体生态系统的发展。
CausalFlip: 超越语义匹配的LLM因果判断基准
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 提出CausalFlip基准,通过构建语义相似但因果答案相反的问题对和噪声前缀评估,揭示LLM依赖语义匹配而非因果推理,并验证内化因果推理方法可提升因果基础。
Comments 8 pages plus references, 3 figures, 3 tables. Under review
UniDrive: 面向自动驾驶可解释风险理解的统一视觉-语言与定位框架
机构 * organization= Department of Earth Science \& Engineering, Imperial College London , city= London , postcode= SW7 2AZ , country= United Kingdom ; organization= SpaceTimeLab, Department of Civil, Environmental ; Geomatic Engineering, University College London , city= London , postcode= WC1E 6BT , country= United Kingdom ; organization= Department of Computing, The Hong Kong Polytechnic University , city= Hong Kong , country= China ; organization= Trinity College, University of Oxford , city= Oxford , postcode= OX1 3BH , country= United Kingdom ; organization= Department of Geography, University College London , city= London , postcode= WC1E 6BT , country= United Kingdom ; organization= Centre for Global Infrastructure Resilience, The Bartlett School of Sustainable Construction, University College London , city= London , postcode= WC1E 7HB , country= United Kingdom
专题命中 推理评测 :reasoning(summary_cn,abstract);分类 cs.AI
AI总结 提出UniDrive框架,通过融合时序推理与高分辨率感知分支,联合生成风险描述和边界框定位,在DRAMA-Reasoning基准上超越现有方法,提升小目标定位和可解释性。
大型音频语言模型中的忠实性研究
机构 * Concordia University(康科迪亚大学) ; Mila - Quebec AI Institute(魁北克人工智能研究院) ; Université Laval(拉瓦尔大学) ; Birla Institute of Technology and Science, Pilani(比拉理工学院和科学学院,皮兰尼)
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.LG
AI总结 提出系统框架评估大型音频语言模型在推理链忠实性上的表现,定义三个音频忠实性标准,并通过基准测试发现模型推理与音频输入存在脱节。
Comments Accepted to Interspeech 2026
你在说我的语言吗?多模态大语言模型中的口语遵循问题
机构 * Google DeepMind(谷歌DeepMind)
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 针对多模态大语言模型在自动语音识别中输出语言识别错误的问题,提出软提示方法、监督微调和思维链推理三种缓解策略,并引入新指标量化语言违背,比较各方法在减少违规和保持ASR性能上的效果。
Comments 7 pages, 3 tables in the main body
GenTI: 针对未知攻击的自主IDPS规则生成的LLM基准测试
机构 * Cyber Security and Resilience Technology (CyberSaR), King Abdullah University of Science and Technology (KAUST)(网络安全与韧性技术(CyberSaR),国王阿卜杜勒·阿齐兹大学科学与技术学院(KAUST))
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 提出GenTI框架,通过构建包含15万条检测与防御规则的数据集GTI,并设计基于LLM的流水线(含结构化提示工程、思维链推理和验证循环),实现针对未知攻击的IDPS规则自动生成,将未知攻击检测率从45%提升至87.4%,误报率从8.5%降至2.3%。
AnyAudio-Judge:基于动态评分标准的音频指令跟随基准与评估器
机构 * Zhejiang University(浙江大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Jiao Tong University(上海交通大学) ; Tencent Hunyuan(腾讯文脉)
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 针对指令引导音频生成中复杂指令解耦困难、评估缺乏可解释性和细粒度属性匹配的问题,提出基于动态评分标准的评估范式,通过自适应分解音频描述为可验证的二元评分项,并构建包含7920个样本的双语基准和105K训练语料,结合SFT与GRPO训练专用评估器,在零样本对齐检测和下游强化学习指令对齐中取得显著提升。
OphIn-500K:策划网络规模的视觉指令以扩展眼科多模态大语言模型
机构 * Arizona State University(亚利桑那州立大学) ; Clemson University(克莱姆森大学) ; Washington University in St. Louis(圣路易斯华盛顿大学) ; University of Notre Dame(诺特丹大学) ; Florida State University(佛罗里达州立大学) ; Rice University(里德大学) ; NVIDIA(英伟达) ; Mayo Clinic(梅奥诊所)
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 提出OphIn-Engine流水线从网络视频中构建高质量眼科指令数据,生成包含50万+指令实例的OphIn-500K数据集,并基于此开发眼科专用多模态大语言模型OphIn-VL,在多项任务上超越现有通用医学和专用模型。
TFD:面向低资源语言处理和大规模建模的综合结构化藏语基础数据集
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Xizang University(西藏大学) ; ZenWeave AI ; The State Key Laboratory of Tibetan Intelligence(藏语智能国家重点实验室) ; Nanyang Technological University(南洋理工大学)
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 为解决藏语大语言模型开发中缺乏覆盖预训练、指令微调、安全对齐、偏好优化和推理监督等完整流程的数据集问题,提出首个结构化、大规模、专家精选的藏语基础数据集TFD,包含超过110亿词元的统一语料库及链式推理数据集,通过训练Sun-Shine系列藏语模型在理解、安全、推理和生成基准上取得显著提升。
PersianMedQA: 在波斯语-英语双语医学问答基准上评估大型语言模型
机构 * School of Electrical and Computer Engineering, University of Tehran(德黑兰大学电气与计算机工程学院) ; Shahid Beheshti University of Medical Sciences(沙希德·贝赫什提医学科学大学) ; Institute for Research in Fundamental Sciences (IPM)(基础科学研究所(IPM))
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 本文提出PersianMedQA数据集,包含20,785道波斯语医学多选题,用于评估41个LLM在零样本和思维链设置下的双语医学推理能力,发现闭源通用模型表现最佳,而波斯语模型性能较差,且翻译会丢失文化临床线索。
Comments Accepted at LREC 2026 (The Fifteenth Language Resources and Evaluation Conference), Palma, Mallorca, Spain, May 2026
感知还是偏见:大语言模型能否超越个性的第一印象?
机构 * The University of Tokyo(东京大学) ; Shanda AI Research Tokyo(Shanda AI 研究所东京) ; Dalian University of Technology(大连理工大学)
专题命中 推理评测 :reasoning(summary_cn,abstract);分类 cs.AI
AI总结 本文探讨了多模态大语言模型(MLLMs)在感知个性方面的能力,提出了一种新的任务Grounded Personality Reasoning(GPR),并构建了一个新的数据集MM-OCEAN,通过三重评估体系揭示了MLLMs在人格推理中的偏见问题。
评估基于提示和执行的方法在LLM中确定性计算中的表现
机构 * Virginia Tech(弗吉尼亚理工学院)
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 本文评估了多种提示策略在需要精确输出的任务中的表现,发现PoT通过生成可执行代码实现完美准确率,而其他方法存在误差积累或计算开销大等问题。
Comments 8 pages, 1 figure. Code and dataset available at https://github.com/bigbird231/llm-exact-computation-dataset
Tatemae:通过工具选择检测LLMs中的对齐欺骗
机构 * Department of Computer Science(计算机科学系) ; University of Camerino(坎皮诺大学) ; Department of Computing(计算系) ; Imperial College London(伦敦帝国学院)
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 本文通过可观测的工具选择检测LLMs中的对齐欺骗,分析了在监控和无监控状态下工具选择的变化,并展示了不同领域和压力类型下的漏洞特征。
仅在必要时推理:通过模型内部不确定性实现高效的生成奖励建模
机构 * University of New South Wales(新南威尔士大学) ; Tencent Hunyuan(腾讯文言) ; Tencent Yuanbao(腾讯元宝) ; UESTC(电子科技大学) ; Peking University(北京大学)
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 本文提出E-GRM框架,利用模型内部不确定性选择性触发推理,减少计算成本并提升答案准确性。
Comments accepted by ACL 2026 Findings
理解大语言模型中新知识诱导的事实幻觉:分析与解释
机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) ; Huawei Translation Services Center(华为翻译服务中心)
专题命中 推理评测 :reasoning(summary_cn,abstract);分类 cs.CL
AI总结 研究探讨了新知识微调导致的大语言模型事实幻觉现象,通过设计Biography-Reasoning数据集,分析不同知识类型和任务类型中的幻觉表现,发现知识类型中不熟悉程度是幻觉的主要驱动因素。
Comments ACL 2026 Findings
量化多查询LLM推理中的跨查询矛盾
机构 * Virginia Tech(弗吉尼亚理工大学) ; Columbia University(哥伦比亚大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI;logical reasoning(comments)
AI总结 本文研究多查询推理中的逻辑一致性,提出包含390个实例的基准测试,引入集级指标,通过提取承诺、验证全局可满足性及反例引导修复,减少跨查询矛盾并保持单查询准确性。
Comments Accepted at the ICLR 2026 Workshop on Logical Reasoning of Large Language Models. 9 pages, 6 tables, code and data at https://huggingface.co/datasets/rohitspider/cross_query_benchmark
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL;planning(comments)
Comments 9 pages, 2 figures, 4 tables. In: ICLR 2025 Workshop on Reasoning and Planning for Large Language Models
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);logical reasoning(abstract)
Comments 22 pages
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);logical reasoning(abstract)
Comments 18 pages
GeoExplain:基于街景图像视觉信息层次的多模态推理
机构 * The University of Queensland(昆士兰大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 针对现有多模态推理任务缺乏对不同粒度视觉线索推理的研究缺口,提出GeoExplain数据集与SightSense方法,实现街景图像的地理定位预测与可解释性说明,且方法在该数据集上表现优异。
Comments Updated version
PEER:统一的过程-结果强化学习用于结构化共情推理
机构 * Shandong University(山东大学) ; Shandong Jianzhu University(山东建筑大学) ; Singapore Management University(新加坡管理大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出PEER,通过结构化共情推理框架提升情感支持对话的 empathy、策略一致性及人性表现,采用GRPO与UnifiReward模型,结合数据增强减少重复。
基于推理的稀疏数据用户个性化生成
机构 * Vanderbilt University(范德比尔特大学) ; Adobe Research(Adobe研究) ; Yale University(耶鲁大学) ; University of Oregon(俄勒冈大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 GraSPer通过预测用户未来交互并生成文本来增强稀疏上下文中的个性化生成,提升用户个性化输出质量。
DiagnosisArena:面向大型语言模型的诊断推理基准测试
机构 * Shanghai Jiao Tong University(上海交通大学) ; SII ; SPIRAL Lab(SPIRAL实验室) ; Generative AI Research Lab (GAIR)(生成式AI研究实验室) ; Shanghai Chest Hospital(上海胸科医院) ; Beijing Anzhen Hospital, Capital Medical University(北京安贞医院,首都医科大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究提出DiagnosisArena基准,评估大型语言模型的临床诊断推理能力,发现顶尖模型准确率仅最高51.12%,凸显其泛化瓶颈,旨在推动AI诊断推理进步。
Comments Accepted to ACL 2026 Findings
MARC v1:一个用于临床AI推理与协作的开源多智能体框架
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究提出开源多智能体框架MARC v1,以确定性多智能体编排替代整体式LLM提示用于临床推理,含角色专业化智能体与分解器模块,支持多部署方式,具备模型无关、可解释等特性。
Comments 13 pages, 4 figures
CityRiSE:基于强化学习的大视觉语言模型城市社会经济地位推理框架
机构 * Information Hub, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) ; Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究提出CityRiSE框架,结合强化学习与大视觉语言模型,提升城市社会经济感知的预测准确性与泛化能力,尤其在未见城市和指标上表现优异。
Comments Accepted by ACM MM 2026, https://github.com/tsinghua-fib-lab/CityRiSE
TEMPER:量化推理中的情感扰动测试
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文通过构建TEMPER基准,研究情感框架对量化推理准确性的影响,发现情感扰动降低准确率2-10个百分点,但通过中性化可恢复性能,揭示情感风格影响而非内容腐败。
Comments Published as a conference paper at COLM 2026. 30 pages, 4 figures, 29 tables. Dataset: https://huggingface.co/datasets/atahandokme/temper-5400 Code: https://github.com/atahandokme/temper-colm2026
跨商业学科的前沿人工智能性能:基于案例的知识工作和分析推理基准
机构 * The Wharton School, University of Pennsylvania(宾夕法尼亚大学沃顿商学院) ; Carnegie Mellon University(卡内基梅隆大学) ; Harvard Business School, Harvard University(哈佛大学哈佛商学院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 研究针对人工智能在白领分析性知识工作衡量上的差距,利用顶尖商学院案例教学法构建BusinessCaseBench基准,发现前沿AI模型在此基准上得分高且能力提升快,为商学院及相关职业角色带来启示。