arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-28 至 2026-08-28 共收录 47 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 47 篇

2608.21883 2026-08-28 cs.CV 版本更新 89%

VIG: Visual Information Gain as a Reward Signal for Multimodal Chain-of-Thought Compression

VIG:作为多模态思维链压缩奖励信号的视觉信息增益

Wen Luo, Xiaohan Yi, Xiaotao Huang, Liqun Huang

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) Tsinghua University(清华大学)

专题命中 推理评测 :CoT(summary_cn,abstract);chain-of-thought(title,abstract);reasoning(abstract)

AI总结 该研究提出VIG奖励机制,通过提升视觉信息密度优化多模态CoT的准确率与效率权衡,无需额外资源,在多类基准及不同规模模型上均有效。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26856 2026-08-28 cs.CV cs.AI 新提交 83%

From Reasoning to Pixels: Grounded Medical Multimodal LLMs for VQA and Segmentation

从推理到像素:用于VQA和分割的接地医学多模态大语言模型

Haowen Gu, Gensheng Pei, Junzhu Mao, Qiong Wang, Mingwu Ren, Yazhou Yao

机构 * Nanjing University of Science and Technology(南京理工大学) Sungkyunkwan University(成均馆大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 针对现有医学多模态大语言模型缺乏像素级接地的问题,提出MedREAL框架,引入SARP与R2V机制,构建MedRAVS-13K数据集,在Med-VQA和分割任务上性能优于现有方法,为医学图像分析提供可解释框架。

Comments accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27176 2026-08-28 cs.CL cs.AI cs.LG eess.AS 新提交 82%

When Text Misleads: Inconsistent-Aware Reasoning for Audio-Grounded Dialogue

当文本误导时:面向音频接地对话的不一致感知推理

Yen-Ju Lu, Yuzhe Wang, Yaohan Guan, Xiluo He, Jiarui Hai, Mingrui Liang, Kaavya Chaparala, Thomas Thebaud, Laureano Moro-Velazquez, Najim Dehak, Jesus Villalba

机构 * Center for Language and Speech Processing, Johns Hopkins University(约翰霍普金斯大学语言与语音处理中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究针对口语对话理解中基于转录本的捷径问题,构建了含501个问题的受控基准ContraTalk,提出Audio Twin智能体式推理框架,可提升冲突问答案例的准确率并减少文本偏向陷阱选择。

Comments 24 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27747 2026-08-28 cs.CL cs.AI 版本更新 81%

Can LVLMs Uncover the Truth Behind Visual Illusions? An Analysis of Perceptual and Reasoning Capabilities

大型视觉语言模型(LVLMs)能否揭示视觉错觉背后的真相?感知与推理能力分析

Liangjie Zhao, Jiaqing Lyu, Kexin Tang, Zecheng Fang, Rong Yin, Yulan Hu, Da Li, Jianing Li

机构 * Adelaide University(阿德莱德大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Amap, Alibaba Group(阿里巴巴集团高德地图) Beihang University(北京航空航天大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文利用IllusionReasoning基准,以视觉错觉为诊断工具评估LVLMs,发现多款LVLMs的推理能力不及宣称水平,为其优化提供了新方向。

Comments EMNLP2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14892 2026-08-28 cs.LG cs.AI 版本更新 81%

Can LLMs Accurately Score Medical Diagnoses and Clinical Reasoning?

LLM能否准确评分医学诊断和临床推理?

Amy Rouillard, Sitwala Mundia, Linda Camara, Ziyaad Dangor, Michael Cameron Gramanie, Ismail Kalla, Shabir A. Madhi, Kajal Morar, Marlvin T. Ncube, Haroon Saloojee, Bruce A. Bassett

机构 * Wits MIND Institute, University of the Witwatersrand, Johannesburg, South Africa(维特士心理研究所,沃斯兰德大学,约翰内斯堡,南非) Grai Labs, Cape Town, South Africa(格雷实验室,开普敦,南非) South African Medical Research Council Vaccines and Infectious Diseases Analytics Research Unit, Faculty of Health Sciences, University of the Witwatersrand, Johannesburg, South Africa(南非医学研究理事会疫苗和传染病分析研究组,健康科学学院,沃斯兰德大学,约翰内斯堡,南非) Department of Internal Medicine, Charlotte Maxeke Johannesburg Academic Hospital, and Faculty of Health Sciences, University of the Witwatersrand, Johannesburg, South Africa(内科学系,查理·马克斯凯约翰内斯堡学术医院,以及健康科学学院,沃斯兰德大学,约翰内斯堡,南非) Department of Paediatrics and Child Health, Faculty of Health Sciences, University of the Witwatersrand, Johannesburg, South Africa(儿科学与儿童健康系,健康科学学院,沃斯兰德大学,约翰内斯堡,南非) Wits MIND Institute, University of the Witwatersrand, Johannesbu(维特士心理研究所,沃斯兰德大学,约翰内斯堡)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究使用LLM陪审团对300例低收入和中等收入国家医院病例的3334个诊断进行评分,发现校准后的LLM评分与专家评分高度一致,且严重错误风险更低,可作为可靠的评估代理。

Comments Extended version of a paper that appeared in Artificial Intelligence in Medicine 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03345 2026-08-28 cs.AI cs.CL 版本更新 81%

Do Language Models Follow Occam's Razor? An Evaluation of Parsimony in Inductive and Abductive Reasoning

语言模型遵循奥卡姆剃刀吗?对归纳和反向推理中简约性的评估

Yunxin Sun, Abulhair Saparov

机构 * Purdue University(普渡大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文评估大型语言模型在归纳和反向推理中是否遵循奥卡姆剃刀原则,通过生成综合推理问题测试其在简单和复杂场景中的表现,发现模型在复杂世界模型中难以生成高质量假设。

Comments Accepted at EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10954 2026-08-28 cs.CV cs.AI 版本更新 80%

Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes

复杂城市场景中基于证据的可信多模态推理与评估基准

Zhaoyang Wei, Bowen Jiang, Xumeng Han, Jiashu Li, Xuehui Yu, Yuling Liu, Guorong Li, Zhenjun Han, Jianbin Jiao

机构 * University of Chinese Academy of Sciences (UCAS)(中国科学院大学) Tencent CDG(腾讯云与智慧产业事业群) Institute of Information Engineering, CAS(中国科学院信息工程研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI;CoT(comments)

AI总结 针对复杂城市场景中多模态大语言模型的推理可靠性问题,提出AD2-Bench基准与EGVOR模型,提升了不利条件下的多模态推理稳定性。

Comments This submission is an iterative version of our previous work, **"AD^2-Bench: A Hierarchical CoT Benchmark for MLLM in Autonomous Driving under Adverse Conditions"** ( arXiv:2506.09557 (https://arxiv.org/abs/2506.09557) ). We plan to consolidate the current submission with the earlier version into a unified manuscript. Therefore, we would like to withdraw this submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27142 2026-08-28 cs.AI 新提交 79%

GRAIN: Bridging Name and Narrative Shifts in Real-World Graph Reasoning through Invariance-Rewarded Agentic RL

GRAIN:通过不变性奖励的智能体强化学习弥合真实世界图推理中的名称与叙事变化

Zike Yuan, Han Zhang, Jianzhi Yan, Le Liu, Cai Ke, Huozhi Zhou, Jian Xie, Jiran Yin, Yukun Cao, Yue Yu, Hui Wang, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) Xidian University(西安电子科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 研究针对LLMs在真实世界图推理中对节点标识符与任务表述变化脆弱的问题,提出基于强化学习的单智能体框架GRAIN,结合结构不变性奖励提升鲁棒性,在准确率、延迟及分布外泛化性上优于多智能体基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26832 2026-08-28 cs.CL 新提交 79%

RuleWeaver: Benchmarking Rule-Centered Scenario Reasoning for Large Language Models

RuleWeaver:面向大型语言模型的以规则为中心的场景推理基准测试

Bohan Yu, Shi-Yang Li, Pengfei Cao, Jun Zhao, Kang Liu

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 针对现有基准测试无法全面评估大型语言模型以规则为中心的场景推理能力的问题,本文提出RuleWeaver基准测试框架,通过构建规则化问答实例并开展过程级评估,发现当前主流LLMs在该任务上表现不佳。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26235 2026-08-28 cs.AI cs.PF 新提交 79%

The Reasoning Tax: Token Economics of LLM Reasoning Across Task Types and Deployment Contexts

推理成本:不同任务类型与部署场景下大语言模型推理的令牌经济学

Sachin Gopal Wani, Ajay Dholakia, David Ellison

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究提出令牌经济得分(TES)指标,通过151组实证分析发现任务结构比难度更影响推理效率,推理投入存在收益递减,应按需选择性启用大语言模型推理。

Comments 15 pages, 8 figures and tables, accepted at the 2026 TPCTC Conference and will be published at Performance Evaluation and Benchmarking (Springer)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19326 2026-08-28 cs.CL 版本更新 79%

Selective State-Space Adaptation and Retrieval for Language Model Reasoning

用于语言模型推理的选择性状态空间适应与检索

Atahan Dokme, Larry Heck

机构 * AI Virtual Assistant (AVA) Lab(人工智能虚拟助手(AVA)实验室) Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 研究针对语言模型推理,提出一类含MaLoRA和MaRA的适配器,通过在令牌和上下文级别引入选择性状态空间递归实现适应,在多个冻结主干和推理基准上提升了推理准确性。

Comments Accepted to EMNLP 2026 (Main Conference). 22 pages, 5 figures, 20 tables. Code: this https URL (https://github.com/atahandokme/malora-mara)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08586 2026-08-28 cs.AI 版本更新 79%

DIANOIA: Diagnostic Decomposition and Joint Optimization for Multi-Agent Reasoning

DIANOIA: 多智能体推理的诊断性分解与联合优化

Yiming Yang, Zhuoyuan Li, Fanxiang Zeng, Hao Fu, Yue Liu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出DIANOIA框架,通过覆盖度、保真度和综合度三个可测量通道分解多智能体推理增益,并基于此设计诊断协议和对应系统,在多个基准上以更少token实现更优性能。

Comments DIANOIA has been accepted by EMNLP 2026 as a main conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08444 2026-08-28 cs.AI 版本更新 79%

Beyond Linearization: Attributed Table Graphs for Table Reasoning

超越线性化:属性表格图用于表格推理

Yuxiang Wang, Junhao Gan, Shengxiang Gao, Shenghao Ye, Zhengyi Yang, Jianzhong Qi

机构 * The University of Melbourne(墨尔本大学) The University of New South Wales(新南威尔士大学) The University of Science and Technology of China(中国科学技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出TABGR模型,通过属性表格图保留表格结构并提升推理可解释性,实验表明其在表格推理任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26993 2026-08-28 cs.CV 新提交 78%

Aphanta: Diagnosing Task-Aligned Image-Edited Intermediates for Multimodal Reasoning

Aphanta:面向多模态推理的任务对齐图像编辑中间产物诊断框架

Hengyuan Xu, Wei Cheng, Yumeng Ji, Xuanyang Zhang, Xianfang Zeng, Gang Yu, Xingjun Ma

机构 * StepFun(阶跃星辰) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出Aphanta框架,用于诊断MLLM与图像编辑中间产物的任务对齐性,实验显示图像编辑是专用视觉工作空间,该框架可用于评估相关流水线效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26866 2026-08-28 cs.CV 新提交 78%

Order Matters: A Chinese Multi-Panel Meme Benchmark for Vision-Language Reasoning

顺序很重要:面向视觉-语言推理的中文多面板梗图基准

Haihan Li, Haihao Li, Zhenfei Xu, Jize Qian

机构 * Shanghai Maritime University(上海海事大学) Dalian Maritime University(大连海事大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 该研究推出中文多面板梗图基准CMPM,评估大型视觉-语言模型对梗图的顺序感知推理能力,发现模型在打乱顺序时准确率大幅下降,Gemini 3.1 Pro和GPT-5.5表现优于开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26355 2026-08-28 cs.CV cs.LG 新提交 74%

Finding the Right Evidence: Factor-Guided Coarse-to-Fine Reasoning for Long Videos

寻找合适的证据:因子引导的长视频由粗到细推理

Baixuan Xu, Yinyui Xu, Tianshi Zheng, Zhaowei Wang, Weiqi Wang, Haochen Shi, Jiayu Liu, Qing Zong, Xiyu Ren, Xinyu Geng, Zhitao He, Yangqiu Song

机构 * Department of Computer Science and Engineering, HKUST(香港科技大学计算机科学与工程学系)

专题命中 推理评测 :reasoning(title);分类 cs.LG

AI总结 针对长视频问答的证据稀疏、选项区分困难问题,提出因子引导的PACE框架,经实验在多基准数据集上优于现有方法,实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26809 2026-08-28 cs.CV cs.MM 新提交 71%

Thinking on Shots: Consistent Multi-Shot Video Editing with Agentic Reasoning

思考镜头:基于智能体推理的一致多镜头视频编辑

Chenyang Wu, Fuchen Long, Binyuan Huang, Xinlong Sun, Xi Chen, Chun-Le Guo, Chongyi Li

机构 * Nankai University(南开大学) Tencent(腾讯)

专题命中 推理评测 :reasoning(title)

AI总结 本文针对多指令编辑长视频的挑战,提出MMLVE任务与智能体编辑框架,构建MMLVE-Bench数据集及评估指标,所提MMLVE-Agent优于Seedance 2.0等闭源SOTA方法,可实现一致且无幻觉的长视频编辑。

Comments Project Page: this https URL (https://wucy0519.github.io/MMLVE/) and see source codes at this https URL (https://github.com/Wucy0519/MMLVE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27219 2026-08-28 cs.CL 新提交 70%

BALMS: Benchmarking Agentic LLMs for Longitudinal Mental Health Sensing

BALMS:面向纵向心理健康感知的智能体大语言模型基准测试

Yu Yvonne Wu, Arvind Pillai, Yuliang Chen, Yuwei Zhang, Sudarshan Regmi, Tess Z. Griffin, Michael V. Heinz, Lisa A. Marsch, Nicholas C. Jacobson, Andrew Campbell

机构 * Dartmouth College(达特茅斯学院) University of Cambridge(剑桥大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 该研究提出首个面向纵向心理健康感知的智能体大语言模型基准BALMS,经多数据集、任务与主干评估发现零样本智能体表现有限,思维链提示有提升但存不足,凸显了对特定智能体的需求。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26867 2026-08-28 cs.AI 新提交 70%

BekchiAI: Measuring, Observing, and Controlling LLM Agents in One Click

BekchiAI:一键式测量、观测与控制大语言模型智能体

Mesut Toruk

专题命中 推理评测 :planning(abstract);verifier(abstract);分类 cs.AI

AI总结 BekchiAI是一款兼具智能体技能测量基准与实时观测控制平台的工具,含2057个测试任务的基准及配套平台,已公开发布并完成多模型对比。

Comments 8 pages, 1 Figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26623 2026-08-28 cs.AI 新提交 70%

AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling

AgentJudgeBench:用于评估智能体工具调用的多难度基准

Abhigya Verma, Amit Kumar Saha, Seganrasan Subramanian, Sai Harshitha Aluru

机构 * ServiceNow AI(ServiceNow人工智能部门)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 该研究提出AgentJudgeBench基准,评估LLM评判在智能体工具调用工作流上的可靠性,发现其对齐度随难度下降,真实值并非总有益,还给出了实用评估指南。

Comments 31 Pages, 9 Figures, 31 Tables, Accepted as a main conference paper at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27391 2026-08-28 cs.AI cs.CL cs.IR cs.LG 新提交 67%

CorporateBench: Large-Scale Q&A Benchmarking with Temporal Knowledge Bases

CorporateBench:基于时序知识库的大规模问答基准测试

Sil Hamilton, Albert Yu Sun, Oscar J. Romero, Carl-Leander Henneking, David Mimno, Bishan Yang, Igor Labutov

机构 * Epiq AI Labs(Epiq AI实验室) Cornell University(康奈尔大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对企业级LLM评估的数据集难题,构建了含23万+文档的CorporateBench基准,从信息提取与知识库查询维度评估5种LLM,发现输入规模接近实际时性能下降,填补了相关评估指标空白。

Comments Accepted to EMNLP Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13463 2026-08-28 cs.CV cs.AI cs.CL cs.LG 版本更新 67%

MLLM-Routed Heterogeneous Ensembles for Robust Cross-Dataset Image Classification

用于鲁棒跨数据集图像分类的MLLM路由异质集成模型

Daniel Perkins, John Squires, Janou Milligan, Chandra Raskoti, Linda Ungerboeck

机构 * The Bredesen Center for Interdisciplinary Research and Graduate Education(布雷德森跨学科研究与研究生教育中心) University of Tennessee Knoxville(田纳西大学诺克斯维尔分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对跨数据集图像分类泛化难题,提出ARMDIL模型,通过MLLM智能体动态路由图像到适配的视觉骨干,兼具竞争力、高适应性与可解释性,为通用视觉系统奠定基础。

Comments 15 pages (single column), 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04180 2026-08-28 cs.CL cs.AI 版本更新 62%

MedFabric: Gold Evidence Hides the Difficulty of Word-Level Medical Fabrication Detection

MedFabric:黄金证据掩盖了词级医学编造检测的难度

Tung Sum Thomas Kwok, Qian Qian, Xiaofeng Lin, Dongxu Zhang, Jun Han, Zhichao Yang, Davin Hill, Tamer Soliman, Sanjit Singh Batra, Robert Tillman, Guang Cheng

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM医学编造检测的评估假象问题,构建了词级医学编造基准MedFabric,发现检测由证据正确性决定,通过检索置信度门提升了检测性能并开放资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27260 2026-08-28 cs.AI cs.CL 新提交 62%

What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents

什么构成优质的智能体数据?LLM智能体数据生成的ACE视角

Xingshan Zeng, Zishan Xu, Boju Zhang, Yuzhou Wu, Lingzhi Wang, Jianghao Lin, Liangyou Li, Yasheng Wang, Lifeng Shang, Xin Jiang, Weinan Zhang, Yong Yu, Qun Liu, Weiwen Liu

机构 * Huawei Technologies Co., Ltd(华为技术有限公司) Shanghai Jiao Tong University(上海交通大学) Northwestern University(西北大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 推理评测 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对LLM智能体数据生成领域提出两级框架与ACE视角,明确核心挑战是为演化的智能体与环境分配有效、非冗余的经验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26674 2026-08-28 cs.CL cs.AI 新提交 62%

Do LLMs Understand Personality? Rethinking Persona Fidelity Evaluation through Structured Behavioral Inference

大语言模型是否理解人格?通过结构化行为推理重新思考人格保真度评估

Mengfan Li, Zesheng Wei, Xuanhua Shi, Yang Deng

机构 * Singapore Management University(新加坡管理大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对现有LLM人格评估范式的局限,提出基于SFL的PRISM框架,将人格保真度评估转化为结构化逆推理任务,实验显示其评估结果更准确稳定。

Comments Accepted by EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20574 2026-08-28 cs.AI cs.CY cs.LG cs.SE 版本更新 62%

FlavourBench: Executable Culinary Reward Maps for Language Model Evaluation and Post-Training

FlavourBench:基于可执行烹饪基准真值的前沿语言模型排名

Josef Chen (Independent Researcher), Erim Hayretci (Imperial College London)

机构 * Imperial College London(帝国理工学院)

专题命中 推理评测 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 FlavourBench是一款自动化语言模型排名基准,以可执行烹饪系统为基准真值,评估27个前沿语言模型,发现Grok 4.6表现最优,可有效消除排行榜差异缺失,结果可靠。

Comments 18 pages, 11 figures. Evaluation of 27 frontier language-model endpoints on 534 identical tasks per model, comprising 14,418 scored model-task cells. Adds reward-map sensitivity, selection and metric robustness, held-out Recipe1MSubs substitution validation, and a preregistered controlled reward-transfer study. Code, dataset, and interactive leaderboard links remain unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08000 2026-08-28 cs.CL cs.AI 版本更新 62%

Summarization is Not Dead Yet

摘要生成尚未消亡

Dongqi Liu, Chenxi Whitehouse, Zheng Zhao, Zhuchen Cao, Jian Li, Yabiao Wang

机构 * Saarland University(萨尔大学) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所) University of Cambridge(剑桥大学) University of Edinburgh(爱丁堡大学) Zhejiang University(浙江大学) Tencent YouTu Lab(腾讯优图实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过多维度评估,发现人类参考摘要在信息量和忠实度上仍优于大语言模型,后者仅在表面连贯性和流畅性上占优,表明摘要生成研究仍有挑战。

Comments EMNLP 2026 Main & Long Conference Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08801 2026-08-28 cs.LG cs.CL 版本更新 62%

$p1$: Better Prompt Optimization with Fewer Prompts

用更少提示实现更好的提示优化

Zhaolin Gao, Yu (Sid) Wang, Bo Liu, Thorsten Joachims, Kianté Brantley, Wen Sun

机构 * Cornell University(康奈尔大学) Microsoft(微软) Harvard University(哈佛大学) Databricks AI Research(Databricks AI研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究揭示提示优化有效性取决于系统提示与响应方差,提出$p1$过滤方法提升优化效果,实验显示其在推理基准上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11358 2026-08-28 cs.CL cs.AI cs.IR 版本更新 62%

LLM-Specific Utility for Retrieval-Augmented Generation

针对大语言模型的特定效用:检索增强生成的新视角

Hengran Zhang, Keping Bi, Jiafeng Guo, Jiaming Zhang, Shuaiqiang Wang, Dawei Yin, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Baidu Inc(百度公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LLM特定效用的概念,指出不同大语言模型对证据的需求不同,提出构建基准以研究这种效用,并推动生成器定制的证据选择方法改进RAG。

Comments Accepted to CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27135 2026-08-28 cs.CL 新提交 57%

Said Aloud, Read Different: Cross-Modal Instability in Multimodal Models

语音与文本的不同解读:多模态模型中的跨模态不稳定性

Basel Mousi, Fahim Dalvi, Shammur Chowdhury, Firoj Alam, Nadir Durrani

机构 * Qatar Computing Research Institute, HBKU(卡塔尔计算研究所(哈马德·本·哈利法大学))

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 该研究针对多模态模型在语音与文本、英语与阿拉伯语间的判断一致性问题,构建含10150张图像的基准,发现模态与语言转换会引入未被整体准确率捕捉的不一致性,语音还会放大部分失败,且公开了该基准。

Comments Interpeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏