arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-09-01 至 2026-09-01 共收录 368 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 122 篇

2608.01017 2026-09-01 cs.CL cs.AI 版本更新 81%

Why LLMs Give In: Conversational Factors and Reasoning Behind Medical Sycophancy

大模型为何妥协:医学谄媚背后的对话因素与推理

Kaike Ping, Buse Çarık, Caleb Wohn, Xiaohan Ding, Tongshuai Wang, Eugenia Rho

机构 * Virginia Tech(弗吉尼亚理工大学) Shanghai Tongren Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属同仁医院) Emory University(埃默里大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究发现医学谄媚是对话属性而非模型属性,通过5个开放权重模型和500个MedQuAD问题的120万次试验,揭示了对话因素对医学谄媚的影响及思维链轨迹的解释。

Comments 22 pages, 8 figures, 14 tables. Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28183 2026-09-01 cs.CL cs.AI 版本更新 81%

BenGER: Benchmarking LLM Systems on Subsumption-Based Legal Reasoning in German Law

BenGER:德国法律中基于归入的法律推理的LLM系统基准测试

Sebastian Nagl, Ann-Kristin Mayrhofer, Martin Heidebach, Aleyna Koçak, Anne Zettelmeier, Elly Breu, Angelina Greiner, Sofija Milijas, Matthias Grabmair

机构 * Technical University of Munich (TUM)(慕尼黑技术大学) Ludwig Maximilian University of Munich (LMU)(慕尼黑路德维希-马克西米利安大学) University of Konstanz(康斯坦茨大学) University of Saarbrücken(萨尔布吕肯大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出BenGER数据集,用于评估LLM系统在德国法律归入推理中的表现,通过自动和基于法官的指标比较12个LLM系统与人类基线。

Comments Pre-Print - Accepted at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24711 2026-09-01 cs.AI cs.CL 版本更新 81%

Stop Before You Fail: Operational Capability Boundaries for Mitigating Unproductive Reasoning in Large Reasoning Models

在失败前停止:为减轻大推理模型中低效推理而设定的操作能力边界

Qingjie Zhang, Yujia Fu, Yang Wang, Liu Yan, Tao Wei, Ke Xu, Minlie Huang, Han Qiu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究大推理模型在面对超出其操作能力边界的问题时,是否能通过早期信号预测并减少无效推理,提出两种监控策略提升效率和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07794 2026-09-01 cs.CL cs.AI 版本更新 81%

Kinship Data Benchmark for Multi-hop Reasoning

多跳推理的亲属数据基准

Tianda Sun, Dimitar Kazakov

机构 * University of York(约克大学) Department of Computer Science(计算机科学系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 KinshipQA通过生成文化特定的家谱数据,评估多跳推理能力,揭示模型在不同文化背景下的推理差异。

Comments 18 pages, 5 figures, Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31075 2026-09-01 cs.AI 新提交 79%

Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence

超越人类监督扩展大型推理模型:通往超级智能的路径

Zhiqin Yang, Jingwen Fu, Yuhan Liu, Hengyu Liu, Yonggang Zhang, Kainan Cao, Zizhuo Zhang, Chenxin Li, Ruibin Yuan, Jiahao Pan, Jiankai Sun, Zhenyuan Zhang, Yibo Li, Yunlong Lin, Jing Xiong, Sida Lin, Bo Han, Wei Xue, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Zhongguancun Academy(中关村学院) Xi’an Jiaotong University(西安交通大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Hong Kong Baptist University(香港浸会大学) Hunyuan Tencent(腾讯混元) National University of Singapore(新加坡国立大学) Xiamen University(厦门大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文研究人类监督逐步退出时大型推理模型(LRMs)的扩展路径,提出五级阶梯框架,分析自主化带来的风险,围绕策略能力等开展评估,为开发通往超级智能的自我维持学习系统提供结构化方案。

Comments 72pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30716 2026-09-01 cs.CL cs.CV 新提交 79%

SocialReasonBench: A Video-QA Benchmark for Social Reasoning with Counterfactual Narrative Videos

SocialReasonBench:基于反事实叙事视频的社会推理视频问答基准

Zheyu Huang, Zijing Shi, Haozhe Luo, Huadong Tang, Mingyu Liu, Meng Fang, Ling Chen

机构 * AAII, University of Technology Sydney(悉尼科技大学AAII(先进人工智能研究所)) Northeastern University(东北大学) Fudan University(复旦大学) University of Liverpool(利物浦大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 研究人员推出SocialReasonBench基准,评估LMMs的社会推理能力,发现其在反事实和因果推理上表现不佳,凸显了模型在潜在社会状态推理上的不足。

Comments Accepted to Findings of EMNLP 2026. 24 pages, 11 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30678 2026-09-01 cs.CL 新提交 79%

OCR-MetaReasoning Benchmark: Evaluating the Meta-Reasoning Ability of MLLMs in Text-Rich Image Understanding

OCR元推理基准:评估多模态大语言模型在富文本图像理解中的元推理能力

Gengxu Li, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) International Center of Future Science, Jilin University(吉林大学未来科学国际中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出OCR-MetaReasoning基准,将演绎、归纳、溯因作为不同推理方向,分离答案正确性与推理合规性,实验发现现有MLLMs的OCR元推理能力远未饱和。

Comments EMNLP 2026 Findings camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30413 2026-09-01 cs.AI 新提交 79%

DERELAB: Probing Defeasible Reasoning and Confirmation Bias in LLMs with a Generative Benchmark

DERELAB:用生成式基准测试探究大型语言模型中的可废止推理与确认偏差

Jayanta Sadhu, Sayem Shahad, Kenneth Marino

机构 * University of Utah(犹他大学) Bangladesh University of Engineering and Technology(孟加拉工程技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究推出DeReLab生成式基准框架,评估9种大型语言模型,发现其普遍存在确认偏差,即易接受一致证据、抵制不一致更新,部分模型能识别弱化更新却不修正结论。

Comments Accepted at the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29880 2026-09-01 cs.AI cs.MM 新提交 79%

Perceive to Hypothesize, Verify to Ground: An Agentic Reasoning Framework for Open-World Geo-Localization

感知以假设,验证以落地:面向开放世界地理定位的智能体推理框架

Yutian Jiang, Ruijie Li, Sisuo Lyu, Xixuan Hao, Qingxiang Liu, Yongzi Yu, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究针对开放世界地理定位的感知幻觉与上下文漂移问题,提出双层智能体框架GeoPAVE,并引入含完整推理轨迹的新型数据集PAVED,以提升地理定位的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29835 2026-09-01 cs.CL 新提交 79%

EVAR: Evidence-Validated Hypothesis Admission for Budget-Aware Narrative Reasoning

EVAR:面向预算感知叙事推理的证据验证假说准入框架

Peilin Liu, Zhiquan Ji, Jinglong Ping

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 针对LLM在长篇叙事推理中易引入无支撑假说的问题,本文提出EVAR框架,通过编译证据库、分配推理预算及验证候选假说,在可控成本下提升了推理性能与证据忠实度。

Comments Accepted to the Main Conference of EMNLP 2026. 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26465 2026-09-01 cs.AI 版本更新 79%

MultivationBench: A Benchmark for Multimodal Sequential Motivation Reasoning

MultivationBench:多模态序列动机推理基准

Kawai Chung, Chunkit Chan, Yauwai Yim, Yuxuan Liu, Haochen Shi, Weiqi Wang, Qing Zong, Tianshi Zheng, Yixuan Fu, Kai Chung Wong, Hao Liang, Yifan Gao, Xi Yang, Janet Hui-wen Hsiao, Yangqiu Song

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出MultivationBench基准,基于心理学框架评估多模态序列动机推理,发现现有模型难以在序列语境中保持一致的动机推理,暴露了静态识别与动态推理的差距。

Comments 35 pages, 6 figures. Accepted to Findings of EMNLP 2026. Code and data: https://github.com/HKUST-KnowComp/MultivationBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23687 2026-09-01 cs.CL 版本更新 79%

Randomized YaRN Improves Length Generalization for Long-Context Reasoning

随机化 YaRN 提升长上下文推理的长度泛化能力

Manas Mehta, Fangcong Yin, Greg Durrett

机构 * New York University(纽约大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 提出随机化 YaRN 方法,通过结合 YaRN 位置外推、随机位置编码和长度课程,在短上下文训练数据上提升模型对长上下文(16K-128K)的推理性能。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03236 2026-09-01 cs.AI 版本更新 79%

Perceive Before Reasoning: A Pre-Reasoning Perception Framework for Efficient and Reliable Proactive Mobile Agents

先感知后推理:一种用于高效可靠主动移动代理的预推理感知框架

Zhijie Ding, Weinan Hong, Zicheng Zhu, Lei Li, Dezhi Kong, Hao Wang, Peng Zhou, Xuchu Jiang, Jiaming Xu

机构 * HyperAI Team, Xiaomi Corporation(HyperAI团队,小米公司) Zhongnan University of Economics and Law(中南财经政法大学) Jilin University(吉林大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出预推理感知框架(PRPF),通过轻量级多模态主动感知器(MPP)进行干预门控和上下文压缩,仅在需要时激活主动代理推理器(PAR),以解决主动移动代理中干预时机与方式决策的目标错位和冗余推理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00642 2026-09-01 cs.AI cs.CR 版本更新 79%

Hidden Thoughts Are Not Secret: Reasoning Trace Exposure in LLMs

隐藏的思考并非秘密:大型语言模型中的推理痕迹暴露

Yu-An Lu, Ci-Yang Tsai, Yu-Lin Tsai, Raluca Ada Popa, Chia-Mu Yu

机构 * National Yang Ming Chiao Tung University(国家阳明交通大学) UC Berkeley(伯克利大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出推理暴露提示(REP)方法,通过影子模型生成的示范以辅助代码格式包装,从受害者模型中引出用户可见的推理痕迹,显著提高暴露痕迹与内部痕迹的相似性并保留有用推理信号。

Comments This version is accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08788 2026-09-01 cs.CL 版本更新 79%

MedConceal: A Benchmark for Clinical Hidden-Concern Reasoning Under Partial Observability

MedConceal:一个用于在部分可观测性下进行临床隐藏关切推理的基准

Yikun Han, Joey Chan, Jingyuan Chen, Mengting Ai, Simo Du, Yue Guo

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) NYC Health + Hospitals/Jacobi(纽约市健康与医院管理局/雅可比医疗中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 MedConceal通过交互式患者模拟器评估医疗对话中的隐藏关切推理,包含300个案例和600个医生-LLM交互,研究确认和干预能力,发现前沿模型在确认指标上表现优异,而人类医生在干预成功率上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01113 2026-09-01 cs.CL 版本更新 79%

CARE: Privacy-Compliant Agentic Reasoning with Evidence Discordance

CARE:具有证据不一致性的隐私合规代理推理

Haochen Liu, Weien Li, Rui Song, Zeyu Li, Chun Jason Xue, Xiao-Yang Liu, Sam Nallaperuma-Herzberg, Xue Liu, Ye Yuan

机构 * University of Cambridge(剑桥大学) McGill University(麦吉尔大学) MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Columbia University(哥伦比亚大学) Mila - Quebec AI Institute(米拉-魁北克人工智能研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 针对医疗领域中症状与体征矛盾的问题,CARE框架通过多阶段隐私合规的代理推理,在不访问敏感数据的情况下提升冲突证据处理能力。

Comments Accepted as a Findings paper at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20022 2026-09-01 cs.CV cs.AI 版本更新 79%

WaymoQA: A Multi-View Visual Question Answering Dataset for Safety-Critical Reasoning in Autonomous Driving

WaymoQA: 一个用于自动驾驶安全关键推理的多视角视觉问答数据集

Seungjun Yu, Seonho Lee, Namho Kim, Jaeyo Shin, Junsung Park, Wonjeong Ryu, Raehyuk Jung, Hyunjung Shim

机构 * Hanyang University(翰阳大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 WaymoQA通过多视角输入提升自动驾驶的安全关键推理能力,提供35,000个标注问题-答案对,显著增强大语言模型的推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09557 2026-09-01 cs.CV cs.AI 版本更新 79%

Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes

复杂城市场景中基于证据的可信多模态推理与评估基准

Zhaoyang Wei, Bowen Jiang, Xumeng Han, Jiashu Li, Xuehui Yu, Yuling Liu, Guorong Li, Zhenjun Han, Jianbin Jiao

机构 * University of Chinese Academy of Sciences(UCAS)(中国科学院大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 针对多模态大语言模型在复杂城市场景中推理可靠性不足及现有基准无法诊断推理过程的问题,提出AD2-Bench基准与EGVOR方法,提升了不利条件下多模态推理的稳定性。

Comments Accepted by IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29661 2026-09-01 cs.CE 新提交 78%

OmniClimate-TC: Physics-Aware Visual Abstractions for Multimedia Reasoning over Tropical Cyclones

OmniClimate-TC:面向热带气旋多媒体推理的物理感知视觉抽象

Luwei Xiao, Xin Wang, Keane Ong, Jiawen Wei, Chenyu Dong, Rui Mao, Erik Cambria, Gianmarco Mengaldo

专题命中 推理评测 :reasoning(title,abstract)

AI总结 该研究针对VLMs处理热带气旋灾害场时的感知不匹配问题,提出PAVA接口并构建OmniClimate-TC基准,证实该表示设计可提升VLMs的相关推理能力。

Comments Accepted by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30229 2026-09-01 cs.CL 新提交 77%

Quantifying and Mitigating Korean Jamo-Level Typographical Vulnerabilities in Large Language Models

量化并缓解大语言模型中的朝鲜语谚文初声、中声、终声(Jamo)层面的排版漏洞

Seojin Lee, Hwanhee Lee

机构 * Chung-Ang University(中央大学)

专题命中 推理评测 :chain-of-thought(abstract,abstract_cn);CoT(abstract);分类 cs.CL

AI总结 该研究量化了LLMs对朝鲜语Jamo层面排版扰动的脆弱性,提出TACoT方法,可在低推理成本下恢复思维链的大部分准确率增益。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28725 2026-09-01 cs.AI 新提交 77%

Beyond the Answer Key: Robustness Evaluation of Large Language Models for Step-Level Mathematical Verification

超越答案密钥:用于步骤级数学验证的大语言模型鲁棒性评估

Fateme Mazdarani, Carlos Toxtli

专题命中 推理评测 :reasoning(abstract,abstract_cn);test-time compute(abstract);分类 cs.AI

AI总结 本研究构建线性方程基准评估大语言模型的步骤级数学验证鲁棒性,发现开源模型对受扰动等价解题过程的错误拒绝率高,微调等方法可部分提升鲁棒性但存在权衡。

Comments Accepted to 2026 IEEE International Conference on Machine Learning and Applications (ICMLA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07699 2026-09-01 cs.CL cs.AI 版本更新 76%

DRIP-R: A Benchmark for Decision-Making and Reasoning Under Real-World Policy Ambiguity in the Retail Domain

DRIP-R:零售领域决策与推理在现实政策模糊性下的基准测试

Hsuvas Borkakoty, Sebastian Pohl, Cheng Wang, Bei Chen, Yufang Hou

机构 * Interdisciplinary Transformation University Austria(跨学科转型大学奥地利) Amazon Berlin(亚马逊柏林)

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.AI

AI总结 DRIP-R基准测试通过现实零售政策模糊性构建无唯一正确解决方案的场景,评估LLM在模糊政策下的决策与推理能力,揭示其固有的系统性挑战。

Comments Accepted to EMNLP Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29278 2026-09-01 cs.CL 新提交 74%

Modality Fault Lines: Structural Corruptions Reveal Fragile Omni-Modal Reasoning

模态断层线:结构损坏揭示脆弱的全模态推理

Zhaolu Kang, Meixin Wu, Yu Xue, Yingjie He, Qiming Shi, Lei Wei, Yidi Wang, Richeng Xuan, Zhichao Hu

机构 * Tencent(腾讯) Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(title);分类 cs.CL

AI总结 本研究提出SCEval诊断评估协议,通过结构损坏揭示全模态模型的脆弱推理,发现文本-视觉损坏是最稳定的共享断层线,多模态退化非相加性,干净准确率不代表结构不可靠时仍可靠。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29689 2026-09-01 cs.CL 版本更新 74%

Can MLLMs Critique Like Humans? Evaluating Open-Ended Aesthetic Reasoning in Multimodal Large Language Models

MLLM 能否像人类一样进行批评?评估多模态大语言模型中的开放式审美推理

Sajjad Ghiasvand, Maryam Amirizaniani, Haniyeh Ehsani Oskouie, Mahnoosh Alizadeh, Ramtin Pedarsani

机构 * UCSB(加州大学圣塔芭芭拉分校) University of Washington(华盛顿大学) UCLA(加州大学洛杉矶分校)

专题命中 推理评测 :reasoning(title);分类 cs.CL

AI总结 本文评估多模态大语言模型在开放式审美批评中的表现,发现基于参考的相似度指标存在误导,模型在选择性、特异性和多样性方面与人类批评存在系统性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06449 2026-09-01 cs.CL 版本更新 74%

An evidence-guided reinforcement learning method to improve psychiatric reasoning in small language models

评估一种证据引导的强化学习框架在对齐光参数大语言模型与精神科临床推理决策认知中的作用

Xinxin Lin, Guangxin Dai, Yi Zhong, Xiang Li, Xue Xiao, Jian Liu, Yixin Zhang, Lingming Hu, Zhengdong Wu, Yongbo Zheng, Runchuan Zhu, Ming Zhao, Huizi Yu, Yi Zhang, Fangting Lu, Shuo Wu, Jun Zhao, Ping Yin, Joey W. Y. Chan, Ngan Yin Chan, Yumei Wang, Lejin Yang, Yanqiu Xing, Sijing Chen, Yun Kwok Wing, Lin Lu, Xin Ma, Lizhou Fan

机构 * The Chinese University of Hong Kong, Shatin, N.T., Hong Kong SAR, China(香港中文大学) Shandong University, Jinan, China(山东大学) Peking University Sixth Hospital, Beijing, China(北京大学第六医院) Inspur Cloud Information Technology Co., Ltd., Jinan, China(Inspur 云技术有限公司) Fudan University, Shanghai, China(复旦大学) Shandong Provincial Hospital Affiliated to Shandong First Medical University, Jinan, China(山东第一医科大学附属山东省人民医院) Jilin University, Changchun, China(吉林大学) Hong Kong ICI Cloud Service Limited, Hong Kong SAR, China(香港ICI云服务有限公司) Shandong First Medical University, Jinan, China(山东第一医科大学)

专题命中 推理评测 :reasoning(title);分类 cs.CL

AI总结 本研究提出ClinMPO框架,通过证据引导的强化学习使轻量LLM在复杂精神病学推理任务中达到超越人类的准确率。

Comments 28 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08051 2026-09-01 cs.AI cs.LG 版本更新 73%

How Small Can You Go? LoRA Fine-Tuning 270M-8B Models for Merchant Information Extraction in Financial Transactions

你能做到多小?面向金融交易中商户信息抽取的 270M-8B 模型 LoRA 微调

Donghao Huang, Tomas Drietomsky, Benjamin Barrett, Zhaoxia Wang

机构 * Singapore Management University(新加坡管理大学) Mastercard(万事达卡) A*STAR Centre for Frontier AI Research(新加坡科技研究局前沿人工智能研究中心)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 针对金融交易中从嘈杂银行字符串提取结构化商户信息的生产需求,系统评估 24 种模型变体,发现 Qwen 3.5 4B 在参数量减半下 F1 仅低 0.35 点,0.8B 模型匹配 2.5-4 倍大模型性能,且思维链微调提升有限。

Comments 10 pages, 5 figures, 6 tables. Accepted for publication at the IEEE International Conference on Data Mining (ICDM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28596 2026-09-01 cs.AI 新提交 70%

Paper Pilot: A Human-in-the-Loop Expert System for Evidence-Traceable Scientific Manuscript Generation in Applied Sciences

Paper Pilot:面向应用科学的可追溯证据的科学手稿生成的人在环专家系统

Nidhi Jha, Siddharth Chaudhary, Ajinkya Kulkarni

机构 * University of Alabama in Huntsville(阿拉巴马大学亨茨维尔分校)

专题命中 推理评测 :reasoning(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出Paper Pilot,一种应用科学领域可追溯证据的人在环专家系统,通过8个批准门等机制解决AI辅助手稿生成的治理问题,实证验证其可减少引用伪造,将LLM辅助写作定位为受控人机决策支持流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20382 2026-09-01 cs.CL 版本更新 70%

Graph2Counsel: Clinically Grounded Synthetic Counseling Dialogue Generation from Client Psychological Graphs

Graph2Counsel: 从客户端心理图谱生成临床导向的合成咨询对话

Aishik Mandal, Hiba Arnaout, Clarissa W. Ong, Juliet Bockhorst, Kate Sheehan, Rachael Moldow, Tanmoy Chakraborty, Iryna Gurevych

机构 * UKP Lab, Department of Computer Science and Hessian Center for AI (hessian.AI), Technische Universität Darmstadt(德国达姆施塔特技术大学UKP实验室、计算机科学系和海森人工智能中心(hessian.AI)) Zuse School ELIZA(Zuse学院ELIZA) National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE) Indian Institute of Technology Delhi(印度德里理工学院) Yardi School of Artificial Intelligence(Yardi人工智能学院) University of Louisville(路易斯维尔大学) University of Toledo(托莱多大学)

专题命中 推理评测 :CoT(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出Graph2Counsel框架,通过客户端心理图谱生成合成咨询对话,提升数据真实性与质量,实验表明其在特定性、咨询师能力等方面优于现有数据集。

Comments 60 pages, 56 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12491 2026-09-01 cs.HC 版本更新 67%

VASTU: Language Models Struggle to Recognize Online Community Values

VASTU:面向在线内容编纂的价值对齐社交工具包

Agam Goyal, Xianyang Zhan, Charlotte Lambert, Koustuv Saha, Eshwar Chandrasekharan

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 VASTU通过社区特定模型在内容编纂中实现价值对齐,微调的转换器表现最佳,揭示了学习社区规范的重要性。

Comments EMNLP 2026: 17 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31068 2026-09-01 cs.AI 新提交 65%

Wrong Prediction, Right Answer: Recovering Evidence from Collapsed LLM Sequence Scores

错误预测,正确答案:从崩溃的大语言模型序列得分中恢复证据

Qiyao Yan, Chenpeng Wang, Liangming Pan

机构 * Peking University(北京大学) YiXin-AILab(艺心人工智能实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 推理评测 :reasoning(abstract,comments);分类 cs.AI;logical reasoning(comments)

AI总结 该研究发现大语言模型推理失败多为表达缺陷而非逻辑缺失,提出无目标标签的加性校正方法,可恢复Qwen等模型的推理准确率,为基准评估提供更严谨解读。

Comments 20 pages, 4 figures, and 43 appendix tables. Research paper on language-model interpretability, reasoning evaluation, output-scoring bottlenecks, and label-free calibration. The paper evaluates controlled three-way logical reasoning tasks, ProofWriter, ANLI, and FOLIO using Qwen3.5, OLMo-2-1B, Llama-3.1-8B, and Pythia checkpoints

详情

展开后加载摘要…

URL PDF HTML 收藏