Reinforcing privacy reasoning in LLMs via normative simulacra from fiction
通过小说中的规范仿像强化大语言模型的隐私推理
机构 * Cornell Tech(康奈尔科技)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文通过从小说中提取规范仿像,结合监督学习和GRPO强化学习,提升大语言模型的隐私推理能力,验证了小说来源的规范仿像在现实领域中的有效性。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
通过小说中的规范仿像强化大语言模型的隐私推理
机构 * Cornell Tech(康奈尔科技)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文通过从小说中提取规范仿像,结合监督学习和GRPO强化学习,提升大语言模型的隐私推理能力,验证了小说来源的规范仿像在现实领域中的有效性。
OpenEstimate:评估语言模型在不确定性下的推理能力实现实验
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出OpenEstimate基准测试,用于评估语言模型在不确定环境下进行数值估计的能力,发现模型的先验概率常不准确且过度自信,但通过改进不确定性引导方式可提升性能。
ActuBench: 一个用于生成和评估精算推理任务的多智能体LLM流水线
机构 * TH Köln, Institut für Versicherungswesen (ivwKöln)(TH Köln保险学系(ivwKöln))
专题命中 推理评测 :reasoning(title);verifier(abstract);分类 cs.CL、cs.AI
AI总结 本文提出ActuBench,一个多智能体LLM流水线,用于自动生成和评估符合国际精算协会教育大纲的高级精算评估题目。通过四个LLM角色的分工,结合成本优化的辅助代理,评估了50个模型并在两个基准上报告了三个主要发现。
Comments 19 pages, 4 figures, 4 tables
定位后检查:基于区域的推理提升AI生成图像的检测
机构 * Shanghai Jiao Tong University(上海交通大学) ; Ant Group(蚂蚁集团)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出LTE框架,通过定位可疑区域并重新检查以提升AI生成图像检测的准确性和鲁棒性,提供可理解的区域级解释。
Comments 18 pages, 11 figures (including supplementary material)
OMIBench:用于大型视觉-语言模型在奥林匹克级多图像推理中的基准测试
机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究室) ; Harbin Institute of Technology(哈尔滨工业大学) ; Central South University(中南大学) ; Fudan University(复旦大学) ; The University of Hong Kong(香港大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Text Computing and Cognitive Intelligence Ministry of Education Engineering Research Center(教育部文本计算与认知智能工程研究中心) ; Guizhou University(贵州大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 OMIBench旨在评估多图像推理能力,包含生物、化学、数学和物理奥林匹克问题,提供精确和语义答案匹配的评估协议,实验显示现有模型性能存在显著差距。
Comments ACL 2026 Camera Ready
AI科学家在没有科学推理的情况下产生结果
机构 * Laboratory of Organic and Macromolecular Chemistry (IOMC), Friedrich Schiller University Jena(有机与大分子化学实验室(IOMC),弗里德里希-席勒耶纳大学) ; Department of Civil Engineering, Indian Institute of Technology Delhi(土木工程系,印度理工学院德里) ; School of Interdisciplinary Research, Indian Institute of Technology Delhi(跨学科研究学院,印度理工学院德里) ; Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(Yardi人工智能学院,印度理工学院德里) ; Center for Energy and Environmental Chemistry Jena, Friedrich Schiller University Jena(能源与环境化学中心(耶纳),弗里德里希-席勒耶纳大学) ; Helmholtz Institute for Polymers in Energy Applications Jena (HIPOLE Jena), Lessingstraße 12–14(能源应用高分子研究所(耶纳,HIPOLE耶纳),Lessingstraße 12–14)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 研究评估了基于大语言模型的科学代理在八个领域中的表现,发现基础模型主导了性能和行为,且代理推理缺乏科学推理的 epistemic 特征。
PuzzleWorld: 一个用于谜题 hunt 中多模态、开放式推理的基准
机构 * MIT Media Lab and MIT EECS(MIT媒体实验室和MIT电子工程与计算机科学系)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 PuzzleWorld 是一个包含667个谜题 hunt 风格问题的基准,用于评估逐步、开放式和创造性多模态推理。每个谜题都标注了最终答案、详细推理轨迹和认知技能标签,揭示了当前模型在推理中的局限性。
MMErroR:面向视觉-语言模型错误推理的基准测试
机构 * Guangdong University of Technology(广东工业大学) ; Hong Kong Baptist University(香港 Baptist大学) ; Sun Yat-sen University(中山大学) ; Peking University(北京大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出MMErroR基准,通过1997个包含单一推理错误的样本,评估视觉-语言模型检测错误推理的能力,发现即使最佳模型也仅能正确分类66.65%的错误。
Comments Accepted by ACL 2026 Main
在RLVR中对LLM推理进行语义空间探索与利用
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Shenzhen Technology University(深圳技术大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 本文提出VERL方法,通过有效秩和其时间导数改进RLVR,实现语义空间中探索与利用的平衡,提升LLM推理性能。
Comments Accepted as an ACL 2026 Findings paper
从答案到论证:通过托尔金引导的课程目标条件学习实现可信的临床诊断推理
机构 * School of Electronic and Electrical Engineering, Shanghai University of Engineering Science(上海工程技术大学电子与电气工程学院) ; Tencent Youtu Lab(腾讯优图实验室)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出托尔金引导的课程目标条件学习框架,通过逐步训练LLM生成符合托尔金结构的诊断论证,提升临床诊断的透明性和可靠性。
Comments Accepted at ACL 2026
WeatherArchive-Bench: 基于历史天气档案的检索增强推理基准测试
机构 * McGill University(麦吉尔大学) ; University of Waterloo(滑铁卢大学) ; ETH Zurich(苏黎世联邦理工学院) ; Beijing Jiaotong University(北京交通大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出WeatherArchive-Bench,用于评估检索增强生成系统在处理历史天气档案中的能力,揭示密集检索器在历史术语上的不足及LLM对社会脆弱性与韧性概念的误判问题。
Comments accepted to the Resource Track of SIGIR 2026
认知惩罚:在边缘原生SLM中消融系统1和系统2推理以实现去中心化共识
机构 * Independent Researcher(独立研究者) ; Lahore University of Management Sciences(拉合尔管理科学大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文研究了边缘原生SLM中系统1和系统2推理对去中心化共识的影响,发现系统1在对抗性环境中表现更优,而系统2导致计算准确率倒置和稳定性下降。
Comments Working paper. 14 pages, 3 figures, 6 tables. Code and dataset: https://github.com/smarizvi110/sentinel-bench
从基准测试到推理:一个双视角、大规模评估LLMs在越南法律文本上的表现
机构 * University of Science, VNUHCM(越南国家大学科学大学) ; Vietnam National University(越南国家大学) ; Hanoi Open University(河内开放大学) ; Ho Chi Minh, Vietnam(胡志明市,越南)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出双视角评估框架,评估四种LLM在越南法律文本的准确性、可读性和一致性,发现Grok-1在可读性和一致性上表现优异但法律准确性不足,而Claude 3 Opus高准确性掩盖了推理错误,揭示当前LLM在法律推理上的核心挑战。
Comments 7 pages, 2 figures. Accepted at the FISU Joint Conference on Artificial Intelligence (FJCAI 2026), Vietnam
推理陷阱:增强大语言模型推理能力如何放大工具幻觉
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; Nanjing University of Science and Technology(南京理工大学) ; Independent Researcher(独立研究者)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 研究探讨增强LLM推理能力是否导致工具幻觉增加,通过SimpleToolHalluBench验证因果关系,发现推理增强与幻觉成正比,且不受过拟合影响,揭示需新的训练目标平衡能力和可靠性。
Comments Accepted to ACL 2026 Main
VLegal-Bench: 用于大型语言模型越南法律推理的认知导向基准
机构 * CMC OpenAI ; VinUniversity ; HUST ; SRH University Heidelberg
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 VLegal-Bench是首个系统评估大型语言模型在越南法律任务上的基准,包含10450个样本,通过严格标注流程确保样本基于权威法律文件,涵盖法律问题解答、检索增强生成、多步推理等任务。
重新审视大语言模型推理中的均匀信息密度假说
机构 * Yonsei University(延世大学) ; OneLine AI
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文研究大语言模型推理中均匀信息密度假说的有效性,提出新框架量化局部和全局信息流均匀性,发现高质量推理在局部均匀但全局非均匀,证明均匀性优于其他内部信号预测推理质量。
Comments ACL 2026 Findings
METER:评估大型语言模型中的多级上下文因果推理
机构 * College of Computer Science, Sichuan University(四川大学计算机学院) ; Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) ; Engineering Research Center of Machine Learning and Industry Intelligence, Ministry of Education, China(中国教育部机器学习与产业智能工程研究中心)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出METER基准,系统评估大型语言模型在因果阶梯的三个层级上的表现,发现随着任务层级升高,模型能力显著下降,揭示了模型在因果推理中的两大失效模式。
Comments ACL 2026. Our code and dataset are available at https://github.com/SCUNLP/METER
Time-RA:面向时间序列推理的异常诊断方法:基于LLM反馈
机构 * University of Oxford(牛津大学) ; Nanjing University(南京大学) ; MSRA(微软研究院) ; SJTU(上海交通大学) ; Abel AI ; Outsampler ; University of Strasbourg(斯特拉斯堡大学) ; Squirrel Ai Learning(Squirrel AI学习)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出Time-RA,通过引入RATs40K多模态数据集,改进时间序列异常检测的生成式推理方法,提升诊断准确性和解释性,实现可解释的多模态时间序列分析。
Comments ACL 2026 Findings. 27 pages, 11 figures, 15 tables. Code and dataset are publicly available
MERRIN:一种多模态证据检索与推理的基准,用于噪声网络环境
机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; Virginia Tech(弗吉尼亚理工大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 MERRIN基准评估搜索增强代理在噪声网络环境中的多模态证据检索与推理能力,通过自然语言查询和多模态证据检索测试,发现现有模型在复杂任务中表现有限,需进一步提升多模态处理能力。
Comments First three authors contributed equally. Project Page: https://merrin-benchmark.github.io/
牙科分诊基准:用于分层牙科分诊的多模态推理基准
机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) ; Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院) ; The Prince Philip Dental Hospital(菲利普王子牙科医院) ; Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学利滋医学学院) ; The Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 本文提出Dental-TriageBench,首个专家标注的多模态牙科分诊基准,通过246个脱敏案例评估19种模型在细粒度治疗层面分诊中的表现,揭示了人类与模型间的显著差距。
超越输出正确性:评估大型语言模型在编码任务中的推理能力
机构 * University of California, Irvine(加州大学尔湾分校)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出CodeRQ-Bench,首个评估LLM在生成、摘要和分类等编码任务中推理质量的基准,通过分析现有评估器的1069个不匹配案例,提出VERA评估器,实验表明其在四个数据集上均优于基线,提升AUCROC和AUPRC最高达0.26和0.21。
基于LLM的Schema自适应表格表示学习用于通用多模态临床推理
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Boston University(波士顿大学) ; University of Southern California(南加州大学) ; GDIIST ; Renyixun Health Technology Co., Ltd.(仁心迅健康科技有限公司)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出基于LLM的Schema自适应表格表示学习方法,通过将结构化变量转换为语义自然语言并编码,实现零样本跨schema对齐,结合表格和MRI数据在多模态 dementia 诊断中取得优于临床基准的性能。
Comments 11 pages, 4 figures
Journal ref ACL 2026, Main conference
推理图:通过以证据为中心的反馈实现自我改进的确定性RAG
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出推理图,通过证据中心反馈提升RAG的准确性和确定性,实验显示在50%以上的证据覆盖下,错误率降低47%,在多跳问题中准确率提升11.0个百分点,实现高重用场景下的性能优势。
Comments 15 pages including appendix, 2 figures, 3 algorithms, framework paper with evaluation protocol
General365:在多样化和具有挑战性的任务中评估大语言模型的通用推理能力
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Meituan(美团)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出General365基准,通过限制背景知识至K-12水平,评估大语言模型在通用推理任务中的表现,揭示当前模型在非专业领域推理能力的不足。
Comments 17 pages, 9 figures
探索知识冲突以实现忠实的LLM推理:基准与方法
机构 * School of Computer Science and Technology, Xi'an Jiaotong University(西安交通大学计算机科学与技术学院) ; Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系) ; Hunan University(湖南大学) ; National University of Singapore(新加坡国立大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出ConflictQA基准,揭示LLM在处理跨源知识冲突时的不足,并提出XoT框架以提升异构冲突证据推理的可靠性。
Comments Accepted at SIGIR 2026
大型语言模型归纳推理的综述
机构 * East China Normal University(华东师范大学) ; Shanghai Innovation Institute(上海创新研究院) ; Fudan University(复旦大学) ; Xi’an Jiaotong University(西安交通大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文综述了大型语言模型中归纳推理的方法与评估,分为训练后改进、测试时扩展和数据增强三大类,并提出统一的评估方法,为未来研究奠定基础。
从查询到建议:基于多智能体框架和数据集的结构化推理用于法律咨询
机构 * Australian Artificial Intelligence Institute (AAII), University of Technology Sydney(悉尼科技大学澳大利亚人工智能研究所) ; School of Computer Science, University of Birmingham(伯明翰大学计算机科学学院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出JurisCQAD数据集和JurisMA框架,通过结构化任务分解和多智能体协作,提升法律咨询问答的准确性与解释性。
Comments Accepted by ACL 2026 Main conference
从无人机图像到农学推理:一种多模态大语言模型基准用于植物表型分析
机构 * University of Memphis(孟菲斯大学) ; University of Missouri(密苏里大学) ; University of Arkansas Division of Agriculture(阿肯色大学农业分部) ; Mississippi State University(密西西比州立大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出PlantXpert基准,用于大豆和棉花表型分析,评估多模态模型在农业领域的表现,发现任务特定微调显著提升准确率,但模型扩展和跨物种泛化仍面临挑战。
Comments In review
在机器翻译中我们是否应该对推理错误过于苛刻?
机构 * University of Maryland(马里兰大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 研究通过多种语言对发现翻译中的推理错误,采用自动化标注协议评估错误类型,并通过干预措施发现小修正对翻译质量影响小,但强干预能提高分辨率,但翻译质量提升不一致。
Comments 17 pages, 2 figures, 5 tables
基于大语言模型的医学推理:综述与MR-Bench
机构 * University of Science and Technology of China(中国科学技术大学) ; The First Affiliated Hospital of USTC(中国科学技术大学附属第一医院) ; National University of Singapore(新加坡国立大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文综述了大语言模型在医学推理中的应用,提出MR-Bench基准测试,揭示了考试级性能与真实临床任务准确性之间的差距。