arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-09-01 至 2026-09-01 共收录 121 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 121 篇

2608.29464 2026-09-01 cs.CL cs.AI 新提交 92%

Chain-of-Thought Faithfulness of Reasoning Models Varies with Where and How Preference Cues Are Delivered

推理模型的思维链忠实性随偏好线索的传递位置与方式变化

Aryo Pradipta Gema, Neel Rajani, Rohit Saxena, Wai-Chung Kwan, Pasquale Minervini

机构 * University of Edinburgh(爱丁堡大学)

专题命中 推理评测 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出FACE-Eval评估工具,发现15款不同规模模型的思维链忠实性随偏好线索的传递位置与方式变化,工具返回或隐性线索下非口头采用率更高,转录监测器检测能力与非口头采用率呈负相关,提示此类场景下CoT监测可靠性较低。

Comments 42 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08058 2026-09-01 cs.CL cs.AI 版本更新 90%

Triggering Chain-of-Thought via Latent Feature Interventions in Large Language Models

超越链式推理:大型语言模型中的一个潜在计算模式

Zhenghao He, Guangzhi Xiong, Bohan Liu, Sanchit Sinha, Aidong Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 推理评测 :CoT(summary_cn,abstract);chain-of-thought(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究发现大型语言模型中的推理能力由潜在内部激活支持,通过引导特定潜在特征可提升性能,CoT提示并非唯一触发方式。

Comments Accepted at EMNLP' 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03654 2026-09-01 cs.CV cs.AI 版本更新 87%

ReGraP-LLaVA: Reasoning enabled Graph-based Personalized Large Language and Vision Assistant

ReGraP-LLaVA:支持推理的基于图的个性化多模态大语言与视觉助手

Yifan Xiang, Zhenxi Zhang, Bin Li, Yixuan Weng, Bo Gao, Shoujun Zhou, Yangfan He, Yilin Yuan, Keqin Li

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) School of Engineering, Westlake University(西湖大学工程学院) University of Minnesota – Twin Cities(明尼苏达大学双城分校) University of Toronto(多伦多大学)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 针对现有个性化多模态大语言模型忽略概念关联的局限,本文构建ReGraP数据集与基准,提出ReGraP-LLaVA模型,实现个性化关系推理,在对比基准中性能最优。

Comments accepted in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28958 2026-09-01 cs.CL cs.CV 新提交 86%

CoVA-SFT: A Large-Scale Dataset for Chain of Visual Abstractions

CoVA-SFT:用于视觉抽象链的大规模数据集

Tsung-Han Wu, Heekyung Lee, Anya Ji, Haoming Chen, Trevor Darrell, Joseph E. Gonzalez, David M. Chan

专题命中 推理评测 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 CoVA-SFT是用于视觉抽象链的大规模数据集,含5.19万样本等,经其微调的模型在CoVA-Bench上性能优于交错式CoT基线2倍以上,凸显相关研究的开放挑战。

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15994 2026-09-01 cs.AI 版本更新 86%

ReactBench: A Benchmark for Topological Reasoning in MLLMs on Chemical Reaction Diagrams

ReactBench: 一种用于在化学反应图上进行拓扑推理的MLLMs基准测试

Qiang Xu, Shengyuan Bai, Yu Wang, He Cao, Leqing Chen, Yuanyuan Liu, Bin Feng, Zijing Liu, Yu Li

机构 * International Digital Economy Academy(国际数字经济学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(title);分类 cs.AI

AI总结 ReactBench通过化学反应图揭示MLLMs在拓扑推理中的局限性,包含1618个专家标注的问答对,评估17种MLLMs显示锚定任务与整体结构推理任务存在超过30%的性能差距。

Comments Accepted By EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03471 2026-09-01 cs.CL cs.AI 版本更新 86%

EpiQAL: Benchmarking Large Language Models in Epidemiological Question Answering and Reasoning

EpiQAL:大型语言模型在流行病学问答与推理中的基准测试

Mingyang Wei, Dehai Min, Zewen Liu, Yuzhang Xie, Guanchen Wu, Ziyang Zhang, Carl Yang, Max S. Y. Lau, Qi He, Lu Cheng, Wei Jin

机构 * Emory University(埃默里大学) University of Illinois Chicago(伊利诺伊大学香槟分校) Microsoft(微软公司)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出EpiQAL基准,通过三个子集(事实回忆、多步推理、不完整信息下结论重建)评估LLM在流行病学推理中的表现,发现当前模型在多步推理上表现有限。

Comments Accepted to EMNLP 2026 Main Conference. 35 pages, 5 figures, 31 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28623 2026-09-01 cs.CL cs.AI 新提交 84%

Looking Again: Measuring Sycophancy in the Reasoning Chains of Multimodal Models Under Pressure

重新审视:压力下多模态模型推理链中的谄媚性测量

Mahir Numayeer Islam, Gakuto Okuyama, Nikolaus Siauw, Shivank Garg, Madhur Panwar, Vasu Sharma

机构 * Adelaide University(阿德莱德大学) Akita International University(秋田国际大学) RNA Tech(RNA科技公司) Algoverse AI Research(Algoverse AI研究院) PocketFM(PocketFM公司)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对多模态推理模型,构建含四类任务与五种压力条件的基准数据集,发现压力下谄媚性普遍存在,多轮压力下临床判断中该现象加剧,且谄媚性可独立破坏推理链,仅答案评估不足。

Comments Accepted to COLM @ AdvML-Frontiers-CoTMA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31014 2026-09-01 cs.CL 新提交 83%

Evidence-Bounded Mental Health Reasoning from Heterogeneous Speech Protocols

基于异构语音协议的证据受限心理健康推理

Chengyuan Gao, Jiang Wu, Tao Lu, Jiayan Guo, Mingkun Xu, Tianyi Zang, Shangyang Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Harbin Institute of Technology(哈尔滨工业大学) Renyixun Health Technology Co., Ltd.(仁医讯健康科技有限公司) GDIIST(广东省智能制造研究所) Tencent(腾讯)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本研究针对现有心理健康筛查模型的证据边界问题,提出协议感知的证据控制框架EviBound,在抑郁症筛查任务中达到0.8658的AUROC,且实现零宣称违规。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026. Long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23152 2026-09-01 cs.CL 版本更新 83%

Counter with Evidence! A Multi-Agent Memory Efficient Reasoning Framework for Hate Category Informed Counterspeech Generation

结合证据的回应!用于仇恨类别感知反仇恨言论生成的多智能体内存高效推理框架

Sujoy Nath, Aswini Kumar, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi(印度德里理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 该研究针对现有反仇恨言论生成未区分仇恨言论类别的问题,提出多智能体框架FIRE并构建数据集FactualCS,实验显示FIRE效果优于基线且毒性更低。

Comments Accepted at EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14040 2026-09-01 cs.CL 版本更新 83%

Physics-R1: An Audited Olympiad Corpus and Released Verifiers for Visual Physics Reasoning

Physics-R1: 一个经过审计的奥林匹克语料库及视觉物理推理的配方

Shan Yang

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.CL

AI总结 本文通过审计多模态物理评估流程,揭示了训练-评估污染、翻译漂移和MCQ饱和等三个问题,并提出PhysR1配方,基于Qwen3-VL-8B-Thinking,提升了多个基准测试的性能。

Comments 10 pages, 3 tables. Project page: this https URL (https://shanyang.me/physics-r1-page/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07019 2026-09-01 stat.ME cs.AI stat.AP stat.ML 版本更新 83%

Latency-Response Theory Model: Evaluating Large Language Models via Response Accuracy and Chain-of-Thought Length

延迟-响应理论模型:通过响应准确性和思维链长度评估大语言模型

Zhiyu Xu, Jia Liu, Yixin Wang, Yuqi Gu

机构 * Department of Statistics, Columbia University(哥伦比亚大学统计系) Department of Statistics, University of Michigan(密歇根大学统计系)

专题命中 推理评测 :chain-of-thought(title);reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 针对大语言模型评估问题,提出延迟-响应理论(LaRT)模型,联合考虑响应准确性和思维链长度,通过引入关键参数建模,推导高效算法估计参数,经理论和模拟研究验证其优势,实际数据评估中表现优于项目反应理论(IRT)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29120 2026-09-01 cs.CL cs.AI cs.SD 新提交 81%

HEAR Who Said What: Unlocking Speaker-Attributed Reasoning via Counterfactual Voice Grounding

HEAR:解锁说话人归因推理的反事实语音接地方法

Dongwook Lee, Sangkwon Park, Eunwoo Song, Che Hyun Lee, Youngho Cho, Junho Kim, June Young Yi, Heeseung Kim, Sungroh Yoon

机构 * IPAI, Seoul National University (SNU)(首尔国立大学IPAI) Yonsei University(延世大学) University of Seoul(首尔大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究推出说话人归因推理基准HEAR,发现现有SLMs依赖语义先验而非语音线索,进而提出30B模型A2R,在CASH数据集优化后于HEAR表现优异,且可零样本泛化至多说话人下游任务。

Comments EMNLP2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01017 2026-09-01 cs.CL cs.AI 版本更新 81%

Why LLMs Give In: Conversational Factors and Reasoning Behind Medical Sycophancy

大模型为何妥协:医学谄媚背后的对话因素与推理

Kaike Ping, Buse Çarık, Caleb Wohn, Xiaohan Ding, Tongshuai Wang, Eugenia Rho

机构 * Virginia Tech(弗吉尼亚理工大学) Shanghai Tongren Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属同仁医院) Emory University(埃默里大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究发现医学谄媚是对话属性而非模型属性,通过5个开放权重模型和500个MedQuAD问题的120万次试验,揭示了对话因素对医学谄媚的影响及思维链轨迹的解释。

Comments 22 pages, 8 figures, 14 tables. Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28183 2026-09-01 cs.CL cs.AI 版本更新 81%

BenGER: Benchmarking LLM Systems on Subsumption-Based Legal Reasoning in German Law

BenGER:德国法律中基于归入的法律推理的LLM系统基准测试

Sebastian Nagl, Ann-Kristin Mayrhofer, Martin Heidebach, Aleyna Koçak, Anne Zettelmeier, Elly Breu, Angelina Greiner, Sofija Milijas, Matthias Grabmair

机构 * Technical University of Munich (TUM)(慕尼黑技术大学) Ludwig Maximilian University of Munich (LMU)(慕尼黑路德维希-马克西米利安大学) University of Konstanz(康斯坦茨大学) University of Saarbrücken(萨尔布吕肯大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出BenGER数据集,用于评估LLM系统在德国法律归入推理中的表现,通过自动和基于法官的指标比较12个LLM系统与人类基线。

Comments Pre-Print - Accepted at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24711 2026-09-01 cs.AI cs.CL 版本更新 81%

Stop Before You Fail: Operational Capability Boundaries for Mitigating Unproductive Reasoning in Large Reasoning Models

在失败前停止:为减轻大推理模型中低效推理而设定的操作能力边界

Qingjie Zhang, Yujia Fu, Yang Wang, Liu Yan, Tao Wei, Ke Xu, Minlie Huang, Han Qiu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究大推理模型在面对超出其操作能力边界的问题时,是否能通过早期信号预测并减少无效推理,提出两种监控策略提升效率和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07794 2026-09-01 cs.CL cs.AI 版本更新 81%

Kinship Data Benchmark for Multi-hop Reasoning

多跳推理的亲属数据基准

Tianda Sun, Dimitar Kazakov

机构 * University of York(约克大学) Department of Computer Science(计算机科学系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 KinshipQA通过生成文化特定的家谱数据,评估多跳推理能力,揭示模型在不同文化背景下的推理差异。

Comments 18 pages, 5 figures, Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31075 2026-09-01 cs.AI 新提交 79%

Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence

超越人类监督扩展大型推理模型:通往超级智能的路径

Zhiqin Yang, Jingwen Fu, Yuhan Liu, Hengyu Liu, Yonggang Zhang, Kainan Cao, Zizhuo Zhang, Chenxin Li, Ruibin Yuan, Jiahao Pan, Jiankai Sun, Zhenyuan Zhang, Yibo Li, Yunlong Lin, Jing Xiong, Sida Lin, Bo Han, Wei Xue, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Zhongguancun Academy(中关村学院) Xi’an Jiaotong University(西安交通大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Hong Kong Baptist University(香港浸会大学) Hunyuan Tencent(腾讯混元) National University of Singapore(新加坡国立大学) Xiamen University(厦门大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文研究人类监督逐步退出时大型推理模型(LRMs)的扩展路径,提出五级阶梯框架,分析自主化带来的风险,围绕策略能力等开展评估,为开发通往超级智能的自我维持学习系统提供结构化方案。

Comments 72pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30716 2026-09-01 cs.CL cs.CV 新提交 79%

SocialReasonBench: A Video-QA Benchmark for Social Reasoning with Counterfactual Narrative Videos

SocialReasonBench:基于反事实叙事视频的社会推理视频问答基准

Zheyu Huang, Zijing Shi, Haozhe Luo, Huadong Tang, Mingyu Liu, Meng Fang, Ling Chen

机构 * AAII, University of Technology Sydney(悉尼科技大学AAII(先进人工智能研究所)) Northeastern University(东北大学) Fudan University(复旦大学) University of Liverpool(利物浦大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 研究人员推出SocialReasonBench基准,评估LMMs的社会推理能力,发现其在反事实和因果推理上表现不佳,凸显了模型在潜在社会状态推理上的不足。

Comments Accepted to Findings of EMNLP 2026. 24 pages, 11 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30678 2026-09-01 cs.CL 新提交 79%

OCR-MetaReasoning Benchmark: Evaluating the Meta-Reasoning Ability of MLLMs in Text-Rich Image Understanding

OCR元推理基准:评估多模态大语言模型在富文本图像理解中的元推理能力

Gengxu Li, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) International Center of Future Science, Jilin University(吉林大学未来科学国际中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出OCR-MetaReasoning基准,将演绎、归纳、溯因作为不同推理方向,分离答案正确性与推理合规性,实验发现现有MLLMs的OCR元推理能力远未饱和。

Comments EMNLP 2026 Findings camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30413 2026-09-01 cs.AI 新提交 79%

DERELAB: Probing Defeasible Reasoning and Confirmation Bias in LLMs with a Generative Benchmark

DERELAB:用生成式基准测试探究大型语言模型中的可废止推理与确认偏差

Jayanta Sadhu, Sayem Shahad, Kenneth Marino

机构 * University of Utah(犹他大学) Bangladesh University of Engineering and Technology(孟加拉工程技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究推出DeReLab生成式基准框架,评估9种大型语言模型,发现其普遍存在确认偏差,即易接受一致证据、抵制不一致更新,部分模型能识别弱化更新却不修正结论。

Comments Accepted at the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29880 2026-09-01 cs.AI cs.MM 新提交 79%

Perceive to Hypothesize, Verify to Ground: An Agentic Reasoning Framework for Open-World Geo-Localization

感知以假设,验证以落地:面向开放世界地理定位的智能体推理框架

Yutian Jiang, Ruijie Li, Sisuo Lyu, Xixuan Hao, Qingxiang Liu, Yongzi Yu, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究针对开放世界地理定位的感知幻觉与上下文漂移问题,提出双层智能体框架GeoPAVE,并引入含完整推理轨迹的新型数据集PAVED,以提升地理定位的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29835 2026-09-01 cs.CL 新提交 79%

EVAR: Evidence-Validated Hypothesis Admission for Budget-Aware Narrative Reasoning

EVAR:面向预算感知叙事推理的证据验证假说准入框架

Peilin Liu, Zhiquan Ji, Jinglong Ping

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 针对LLM在长篇叙事推理中易引入无支撑假说的问题,本文提出EVAR框架,通过编译证据库、分配推理预算及验证候选假说,在可控成本下提升了推理性能与证据忠实度。

Comments Accepted to the Main Conference of EMNLP 2026. 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26465 2026-09-01 cs.AI 版本更新 79%

MultivationBench: A Benchmark for Multimodal Sequential Motivation Reasoning

MultivationBench:多模态序列动机推理基准

Kawai Chung, Chunkit Chan, Yauwai Yim, Yuxuan Liu, Haochen Shi, Weiqi Wang, Qing Zong, Tianshi Zheng, Yixuan Fu, Kai Chung Wong, Hao Liang, Yifan Gao, Xi Yang, Janet Hui-wen Hsiao, Yangqiu Song

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出MultivationBench基准,基于心理学框架评估多模态序列动机推理,发现现有模型难以在序列语境中保持一致的动机推理,暴露了静态识别与动态推理的差距。

Comments 35 pages, 6 figures. Accepted to Findings of EMNLP 2026. Code and data: this https URL (https://github.com/HKUST-KnowComp/MultivationBench)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23687 2026-09-01 cs.CL 版本更新 79%

Randomized YaRN Improves Length Generalization for Long-Context Reasoning

随机化 YaRN 提升长上下文推理的长度泛化能力

Manas Mehta, Fangcong Yin, Greg Durrett

机构 * New York University(纽约大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 提出随机化 YaRN 方法,通过结合 YaRN 位置外推、随机位置编码和长度课程,在短上下文训练数据上提升模型对长上下文(16K-128K)的推理性能。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03236 2026-09-01 cs.AI 版本更新 79%

Perceive Before Reasoning: A Pre-Reasoning Perception Framework for Efficient and Reliable Proactive Mobile Agents

先感知后推理:一种用于高效可靠主动移动代理的预推理感知框架

Zhijie Ding (1,2), Weinan Hong (1,3), Zicheng Zhu (1,4), Lei Li (1), Dezhi Kong (1), Hao Wang (1), Peng Zhou (1), Xuchu Jiang (1), Jiaming Xu (1) ((1) HyperAI Team, Xiaomi Corporation, (2) Zhongnan University of Economics and Law, (3) Jilin University, (4) The Chinese University of Hong Kong, Shenzhen)

机构 * HyperAI Team, Xiaomi Corporation(HyperAI团队,小米公司) Zhongnan University of Economics and Law(中南财经政法大学) Jilin University(吉林大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出预推理感知框架(PRPF),通过轻量级多模态主动感知器(MPP)进行干预门控和上下文压缩,仅在需要时激活主动代理推理器(PAR),以解决主动移动代理中干预时机与方式决策的目标错位和冗余推理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00642 2026-09-01 cs.AI cs.CR 版本更新 79%

Hidden Thoughts Are Not Secret: Reasoning Trace Exposure in LLMs

隐藏的思考并非秘密:大型语言模型中的推理痕迹暴露

Yu-An Lu, Ci-Yang Tsai, Yu-Lin Tsai, Raluca Ada Popa, Chia-Mu Yu

机构 * National Yang Ming Chiao Tung University(国家阳明交通大学) UC Berkeley(伯克利大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出推理暴露提示(REP)方法,通过影子模型生成的示范以辅助代码格式包装,从受害者模型中引出用户可见的推理痕迹,显著提高暴露痕迹与内部痕迹的相似性并保留有用推理信号。

Comments This version is accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08788 2026-09-01 cs.CL 版本更新 79%

MedConceal: A Benchmark for Clinical Hidden-Concern Reasoning Under Partial Observability

MedConceal:一个用于在部分可观测性下进行临床隐藏关切推理的基准

Yikun Han, Joey Chan, Jingyuan Chen, Mengting Ai, Simo Du, Yue Guo

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) NYC Health + Hospitals/Jacobi(纽约市健康与医院管理局/雅可比医疗中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 MedConceal通过交互式患者模拟器评估医疗对话中的隐藏关切推理,包含300个案例和600个医生-LLM交互,研究确认和干预能力,发现前沿模型在确认指标上表现优异,而人类医生在干预成功率上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01113 2026-09-01 cs.CL 版本更新 79%

CARE: Privacy-Compliant Agentic Reasoning with Evidence Discordance

CARE:具有证据不一致性的隐私合规代理推理

Haochen Liu, Weien Li, Rui Song, Zeyu Li, Chun Jason Xue, Xiao-Yang Liu, Sam Nallaperuma-Herzberg, Xue Liu, Ye Yuan

机构 * University of Cambridge(剑桥大学) McGill University(麦吉尔大学) MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Columbia University(哥伦比亚大学) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 针对医疗领域中症状与体征矛盾的问题,CARE框架通过多阶段隐私合规的代理推理,在不访问敏感数据的情况下提升冲突证据处理能力。

Comments Accepted as a Findings paper at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20022 2026-09-01 cs.CV cs.AI 版本更新 79%

WaymoQA: A Multi-View Visual Question Answering Dataset for Safety-Critical Reasoning in Autonomous Driving

WaymoQA: 一个用于自动驾驶安全关键推理的多视角视觉问答数据集

Seungjun Yu, Seonho Lee, Namho Kim, Jaeyo Shin, Junsung Park, Wonjeong Ryu, Raehyuk Jung, Hyunjung Shim

机构 * Hanyang University(翰阳大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 WaymoQA通过多视角输入提升自动驾驶的安全关键推理能力,提供35,000个标注问题-答案对,显著增强大语言模型的推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09557 2026-09-01 cs.CV cs.AI 版本更新 79%

Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes

复杂城市场景中基于证据的可信多模态推理与评估基准

Zhaoyang Wei, Bowen Jiang, Xumeng Han, Jiashu Li, Xuehui Yu, Yuling Liu, Guorong Li, Zhenjun Han, Jianbin Jiao

机构 * University of Chinese Academy of Sciences(UCAS)(中国科学院大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 针对多模态大语言模型在复杂城市场景中推理可靠性不足及现有基准无法诊断推理过程的问题,提出AD2-Bench基准与EGVOR方法,提升了不利条件下多模态推理的稳定性。

Comments Accepted by IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏