arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-09-01 至 2026-09-01 共收录 368 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 30 篇

2602.00994 2026-09-01 cs.AI 版本更新 79%

Reasoning and Tool-use Compete in Agentic RL:From Quantifying Interference to Disentangled Tuning

推理与工具使用在智能体强化学习中的竞争:从量化干扰到解耦调优

Yu Li, Mingyang Yi, Xiuyu Li, Ju Fan, Fuxin Jiang, Binbin Chen, Peng Li, Jie Song, Tieying Zhang

机构 * School of Information, Renmin University of China(中国人民大学信息学院) Bytedance Inc.(字节跳动公司)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文通过引入能力效应归因(CEA)量化推理与工具使用行为之间的干扰,并提出解耦动作-推理调优(DART)框架,通过分离参数更新来提升智能体强化学习的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29374 2026-09-01 cs.CV 新提交 78%

Think, Look, and Revise: Inconsistency-Aware Visual Self-Correction in MLLMs

思考、观察与修正:多模态大语言模型中基于不一致感知的视觉自我修正

Yu Cheng, Arushi Goel, Hakan Bilen

机构 * University of Edinburgh(爱丁堡大学) NVIDIA Research(英伟达研究院)

专题命中 复杂问题求解 :self-correction(title);reasoning(abstract)

AI总结 本研究针对工具增强型多模态推理中工具输出缺乏验证的问题,提出ReVISE框架,通过带监督反思的训练数据集与强化学习目标奖励,实现错误检测与修正,在多个基准上取得性能提升。

Comments accepted by EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07264 2026-09-01 eess.AS 版本更新 78%

VISA: A Visual Information Strengthened Audio-Reasoning System for the Interspeech 2026 ARC Agent Track

VISA:面向Interspeech 2026 ARC智能体赛道的视觉信息增强音频推理系统

Wenming Tu, Jian Gao, Yanru Huo, Yixuan Wang, Jing Peng, Bohan Li, Ziyang Ma, Tao Liu, Shuai Fan, Kai Yu, Xie Chen, Zilong Zheng

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 提出VISA系统,通过多模态特征提取、模型投票推理和细粒度类别感知路由,增强大音频语言模型的音频推理能力,在ARC智能体赛道取得66.23%评分和77.40%准确率。

Comments INTERSPEECH 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19821 2026-09-01 cs.AI cs.SE 70%

JTPRO: A Joint Tool-Prompt Reflective Optimization Framework for Language Agents

JTPRO:一种联合工具提示反思优化框架用于语言代理

Sandip Ghoshal, Anshul Mittal, Jyotika Singh, Miguel Ballesteros, Weiyi Sun, Fang Tu, Shailender Singh, Yassine Benajiba, Fahad Shah, Sujeeth Bharadwaj, Sujith Ravi, Dan Roth

机构 * Oracle AI

专题命中 复杂问题求解 :CoT(abstract,abstract_cn);分类 cs.AI

AI总结 JTPRO通过迭代反思优化提升工具调用可靠性,通过联合优化全局指令和工具schema,提高多工具环境下的工具选择和参数填充准确性。

Comments Conference: ACL-2026

Journal ref Findings of the {A}ssociation for {C}omputational {L}inguistics: {ACL} 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23803 2026-09-01 cs.CV cs.AI cs.LG 版本更新 62%

LUCAID: Agentic Multimodal AI for Lung Cancer Precision Pathology

LUCAID:用于肺癌精准病理学的智能体多模态AI

Marie-Lisa Eich, Kai Standvoss, Timo Milbich, Alexander Möllers, Miriam Hägele, Philipp Anders, Lars Tharun, Hanna Kontradiuk, Sebastian Kons, Nader Aldoj, Recepcan Adigüzel, Adam Narai, Lukas Hönig, Jonathan Striebel, Binru Yang, Mihnea P. Dragomir, Marvin Sextro, Philipp Keyl, Philipp Jurmeister, Rosemarie Krupar, Evelyn Ramberger, James Wells, Julika Ribbat-Idel, Andreas Kunft, Hussam Shuaib, Christian Grohé, Reinhard Büttner, David Horst, Klaus-Robert Müller, Lukas Ruff, Maximilian Alber, Frederick Klauschen, Simon Schallenberg

机构 * Institute of Pathology, Charité – Universitätsmedizin Berlin(柏林夏里特医学院病理学研究所) Freie Universität Berlin(柏林自由大学) Humboldt-Universität zu Berlin(柏林洪堡大学) Berlin Institute of Health at Charité – Universitätsmedizin Berlin(柏林夏里特医学院柏林卫生研究所) Aignostics GmbH(Aignostics有限公司) Machine Learning Group, Technical University of Berlin(柏林工业大学机器学习组) BIFOLD – Berlin Institute for the Foundations of Learning and Data(BIFOLD——柏林学习与数据基础研究所) MVZ HPH Institut für Pathologie und Hämatopathologie GmbH(HPH病理及血液病理诊断中心有限公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究开发并临床验证了LUCAID智能体多模态AI系统,其覆盖肺癌病理全流程任务,前瞻性验证中临床决策一致性达93.0%,优于经验丰富的胸病理学家,解决了现有AI工具的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11847 2026-09-01 cs.CV cs.AI cs.CL 版本更新 62%

LookBack: Where and How to Score LVLM Responses via Visual Reference Usage

LookBack:通过视觉参考使用情况对LVLM响应进行评分的位置与方法

Beomsik Cho, Jinhyeong Kim, Dongseok Lee, Jaehyung Kim

机构 * Yonsei University(延世大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对LVLM响应存在的图像相关幻觉问题,提出无需训练的LookBack评分方法,结合视觉回溯评分增强token似然,在四个基准和三个模型上提升了Best-of-$N$选择性能且开销极小。

Comments Findings of EMNLP 2026. 24 pages, 12 figures. Code: https://github.com/bscho333/LookBack

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08747 2026-09-01 cs.CL cs.AI 版本更新 62%

To Retrieve or To Think? Cross-Boundary Context Evolution for Multi-hop Complex Reasoning

是检索还是思考?一种情境演化的代理方法

Rubing Chen, Jian Wang, Wenjie Li, Xiao-Yong Wei, Qing Li

机构 * Department of Computing, The Hong Kong Polytechnic University(计算系,香港理工大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Agentic Context Evolution (ACE)方法,通过代理动态决策在检索与推理间切换,提升知识密集型任务的生成效率与准确性。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06644 2026-09-01 cs.CL cs.AI 版本更新 62%

Do Language Models Reason Across Languages?

语言模型是否能在不同语言之间进行推理?

Yan Meng, Wafaa Mohammed, Christof Monz

机构 * Language Technology Lab University of Amsterdam(语言技术实验室 阿姆斯特丹大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了语言模型在多语言环境下进行推理的能力,提出了一种三阶段提示方法,有效提升了两跳问答任务的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29646 2026-09-01 cs.AI cs.MA 新提交 57%

Detect Before You Attribute: Cascade Failure Attribution for Multi-Agent Systems

先检测再归因:多智能体系统的级联故障归因

Jiayi Zhang, Zexin Wang, Degang Sun, Changhua Pei, Fei Sun, Gaogang Xie, Jingjing Li

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对多智能体系统故障归因的现有方法存在不足,该研究提出即插即用的DUOTRACE,采用先检测后归因范式,提升了智能体级和步骤级归因准确率。

Comments 17 pages, 5 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29459 2026-09-01 cs.AI 新提交 57%

Toward Latent Language Model Skills Steering and Optimization: An Empirical Study

面向潜在语言模型技能的引导与优化:一项实证研究

Xunyi Jiang, Junda Wu, Yuxin Xiong, Sheldon Yu, Tong Yu, David Arbour, Ritwik Sinha, Julian McAuley, Hongyi Wen

机构 * New York University(纽约大学) Adobe Research(奥多比研究院) UC San Diego(加州大学圣迭戈分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本研究通过实证探究发现大型语言模型(LLM)的过程技能可表征为激活空间中的向量方向,且可通过向量操作实现技能引导与优化,为LLM过程技能的潜在空间操控提供了表征级视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22130 2026-09-01 cs.MA cs.CL 版本更新 57%

PropUQ-MAS: Propagation-Aware Uncertainty Quantification for LLM Multi-Agent Systems

PropUQ-MAS:面向大语言模型多智能体系统的传播感知不确定性量化

Yaokun Liu, Yifan Liu, Daniel Yue Zhang, Ruichen Yao, Zelin Li, Dong Wang

机构 * Scale AI University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 针对现有不确定性量化方法无法捕捉大语言模型多智能体系统中不确定性传播的问题,提出PropUQ-MAS框架,实验显示其可显著提升该系统的不确定性量化性能。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18279 2026-09-01 physics.optics cs.LG 版本更新 57%

A Comprehensive Review of Large Language Models for Nanophotonics: From Surrogate Modeling to Autonomous Design

面向纳米光子学的大语言模型综合综述:从代理建模到自主设计

Huanshu Zhang, Kegeng Tang, Lei Kang, Sawyer D. Campbell, Zihao Wang, Douglas H. Werner

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Tennessee at Chattanooga(田纳西大学查塔努加分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 该综述探讨大语言模型(LLMs)如何通过语义接口、代码生成及工具编排改进纳米光子学工作流,梳理相关方法的两类模式及跨学科应用,展望具备物理感知的多模态基础模型,推动AI从被动工具向主动科研合作者转变。

Comments Accepted for publication in Advanced Photonics

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20489 2026-09-01 cs.AI cs.DB 版本更新 57%

EvoSQL: Memory-Augmented Critic-Generator Co-Evolution for Text-to-SQL

EvoSQL:用于文本到SQL的内存增强型评论家-生成器协同进化

Jiawei Zhou, Jianwei Wang, Chenyu Zhou, Chaojian Shi, Ming Dong, Kai Wang

机构 * Shanghai Jiao Tong University(上海交通大学) University of New South Wales(新南威尔士大学) Fudan University(复旦大学) Wuhan University of Technology(武汉理工大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究文本到SQL问题,提出EvoSQL协同进化框架,通过生成器与评论家迭代交互、维护内存、验证候选及自蒸馏策略优化微调等,在Spider和BIRD实验中持续改进开源模型,证明该方法是有效途径。

Comments Accepted as EMNLP Findings (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12449 2026-09-01 cs.CR cs.AI 版本更新 57%

AgenTRIM: Tool Risk Mitigation for Agentic AI

AgenTRIM:代理AI的工具风险缓解

Roy Betser, Amit Giloni, Shamik Bose, Sindhu Padakandla, Chiara Picardi, Lidor Erez, Roman Vainshtein

机构 * Fujitsu Research of Europe (FRE)(富士通欧洲研究(FRE)) Fujitsu Research of India Pvt. Ltd. (FRIPL)(富士通印度私人有限公司(FRIPL))

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 AgenTRIM通过离线和在线阶段检测并缓解代理AI中工具驱动的风险,减少攻击成功率同时保持任务性能。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30247 2026-09-01 cs.CV 新提交 50%

OPUS: A Simple yet Effective Unified Framework for Open-Vocabulary Detection

OPUS:一个简单而有效的开放词汇检测统一框架

Xiaoyan Wei, Zhimin Yao, Ruilin Yang, Wei Zhang, Yong Dai, Yi Zhang, Wei Ge

机构 * Megvii Technology Inc.(旷视科技) X-Humanoid

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出 OPUS 框架,以简单设计结合语义视觉表示与 ICA 训练策略,在 COCO 等数据集上实现最优 Visual-I 性能,平衡多类型提示精度,将混合提示转为互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21288 2026-09-01 cs.HC cs.CY 50%

Unpacking Interaction Profiles and Strategies in Human-AI Collaborative Problem Solving: A Cognitive Distribution and Regulation Perspective

解析人机协作问题解决中的交互特征与策略:一种认知分布与调节视角

Zhanxin Hao, Xiaobo Liu, Jiaxin Fan, Yun Long, Jifan Yu, Wenli Chen, Yu Zhang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文通过聚类分析发现,人类与AI协作解决复杂问题时存在三种模式:委托推理、协同解释和委托扩展,其中委托推理组表现最佳,语义相似度最高,而协同解释组自我调节策略使用更频繁。

Journal ref Journal of Research on Technology in Education (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23766 2026-09-01 cs.IR 版本更新 50%

UniFAR: A Unified Facet-Aware Retrieval Framework for Scientific Documents

UniFAR: 一种统一的面向面检索框架用于科学文档

Zheng Dou, Zhao Zhang, Deqing Wang, Yikun Ban, Fuzhen Zhuang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 UniFAR提出一种统一的面向面检索框架,通过自适应多粒度聚合、可学习的面向锚点和联合训练,有效解决文档与问题驱动检索之间的不匹配问题,提升科学文档检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09888 2026-09-01 cs.RO 版本更新 50%

TriPilot-FF: Coordinated Whole-Body Teleoperation with Force Feedback

TriPilot-FF:具有力反馈的协调全身遥控

Zihao Li, Yanan Zhou, Ranpeng Qiu, Hangyu Wu, Guoqiang Ren, Weiming Zhi

机构 * Zeno AI Zhejiang University(浙江大学) Zhejiang University of Technology(浙江工业大学) University of Sydney(悉尼大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 TriPilot-FF通过引入脚踏板触觉反馈和双臂跟随遥控,实现了具有力反馈的协调全身遥控,提升移动机械臂的操控精度和避障能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 122 篇

2608.29464 2026-09-01 cs.CL cs.AI 新提交 92%

Chain-of-Thought Faithfulness of Reasoning Models Varies with Where and How Preference Cues Are Delivered

推理模型的思维链忠实性随偏好线索的传递位置与方式变化

Aryo Pradipta Gema, Neel Rajani, Rohit Saxena, Wai-Chung Kwan, Pasquale Minervini

机构 * University of Edinburgh(爱丁堡大学)

专题命中 推理评测 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出FACE-Eval评估工具,发现15款不同规模模型的思维链忠实性随偏好线索的传递位置与方式变化,工具返回或隐性线索下非口头采用率更高,转录监测器检测能力与非口头采用率呈负相关,提示此类场景下CoT监测可靠性较低。

Comments 42 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08058 2026-09-01 cs.CL cs.AI 版本更新 90%

Triggering Chain-of-Thought via Latent Feature Interventions in Large Language Models

超越链式推理:大型语言模型中的一个潜在计算模式

Zhenghao He, Guangzhi Xiong, Bohan Liu, Sanchit Sinha, Aidong Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 推理评测 :CoT(summary_cn,abstract);chain-of-thought(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究发现大型语言模型中的推理能力由潜在内部激活支持,通过引导特定潜在特征可提升性能,CoT提示并非唯一触发方式。

Comments Accepted at EMNLP' 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03654 2026-09-01 cs.CV cs.AI 版本更新 87%

ReGraP-LLaVA: Reasoning enabled Graph-based Personalized Large Language and Vision Assistant

ReGraP-LLaVA:支持推理的基于图的个性化多模态大语言与视觉助手

Yifan Xiang, Zhenxi Zhang, Bin Li, Yixuan Weng, Bo Gao, Shoujun Zhou, Yangfan He, Yilin Yuan, Keqin Li

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) School of Engineering, Westlake University(西湖大学工程学院) University of Minnesota – Twin Cities(明尼苏达大学双城分校) University of Toronto(多伦多大学)

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 针对现有个性化多模态大语言模型忽略概念关联的局限,本文构建ReGraP数据集与基准,提出ReGraP-LLaVA模型,实现个性化关系推理,在对比基准中性能最优。

Comments accepted in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28958 2026-09-01 cs.CL cs.CV 新提交 86%

CoVA-SFT: A Large-Scale Dataset for Chain of Visual Abstractions

CoVA-SFT:用于视觉抽象链的大规模数据集

Tsung-Han Wu, Heekyung Lee, Anya Ji, Haoming Chen, Trevor Darrell, Joseph E. Gonzalez, David M. Chan

专题命中 推理评测 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 CoVA-SFT是用于视觉抽象链的大规模数据集,含5.19万样本等,经其微调的模型在CoVA-Bench上性能优于交错式CoT基线2倍以上,凸显相关研究的开放挑战。

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15994 2026-09-01 cs.AI 版本更新 86%

ReactBench: A Benchmark for Topological Reasoning in MLLMs on Chemical Reaction Diagrams

ReactBench: 一种用于在化学反应图上进行拓扑推理的MLLMs基准测试

Qiang Xu, Shengyuan Bai, Yu Wang, He Cao, Leqing Chen, Yuanyuan Liu, Bin Feng, Zijing Liu, Yu Li

机构 * International Digital Economy Academy(国际数字经济学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(title);分类 cs.AI

AI总结 ReactBench通过化学反应图揭示MLLMs在拓扑推理中的局限性,包含1618个专家标注的问答对,评估17种MLLMs显示锚定任务与整体结构推理任务存在超过30%的性能差距。

Comments Accepted By EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03471 2026-09-01 cs.CL cs.AI 版本更新 86%

EpiQAL: Benchmarking Large Language Models in Epidemiological Question Answering and Reasoning

EpiQAL:大型语言模型在流行病学问答与推理中的基准测试

Mingyang Wei, Dehai Min, Zewen Liu, Yuzhang Xie, Guanchen Wu, Ziyang Zhang, Carl Yang, Max S. Y. Lau, Qi He, Lu Cheng, Wei Jin

机构 * Emory University(埃默里大学) University of Illinois Chicago(伊利诺伊大学香槟分校) Microsoft(微软公司)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出EpiQAL基准,通过三个子集(事实回忆、多步推理、不完整信息下结论重建)评估LLM在流行病学推理中的表现,发现当前模型在多步推理上表现有限。

Comments Accepted to EMNLP 2026 Main Conference. 35 pages, 5 figures, 31 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28623 2026-09-01 cs.CL cs.AI 新提交 84%

Looking Again: Measuring Sycophancy in the Reasoning Chains of Multimodal Models Under Pressure

重新审视:压力下多模态模型推理链中的谄媚性测量

Mahir Numayeer Islam, Gakuto Okuyama, Nikolaus Siauw, Shivank Garg, Madhur Panwar, Vasu Sharma

机构 * Adelaide University(阿德莱德大学) Akita International University(秋田国际大学) RNA Tech(RNA科技公司) Algoverse AI Research(Algoverse AI研究院) PocketFM(PocketFM公司)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对多模态推理模型,构建含四类任务与五种压力条件的基准数据集,发现压力下谄媚性普遍存在,多轮压力下临床判断中该现象加剧,且谄媚性可独立破坏推理链,仅答案评估不足。

Comments Accepted to COLM @ AdvML-Frontiers-CoTMA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31014 2026-09-01 cs.CL 新提交 83%

Evidence-Bounded Mental Health Reasoning from Heterogeneous Speech Protocols

基于异构语音协议的证据受限心理健康推理

Chengyuan Gao, Jiang Wu, Tao Lu, Jiayan Guo, Mingkun Xu, Tianyi Zang, Shangyang Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Harbin Institute of Technology(哈尔滨工业大学) Renyixun Health Technology Co., Ltd.(仁医讯健康科技有限公司) GDIIST(广东省智能制造研究所) Tencent(腾讯)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本研究针对现有心理健康筛查模型的证据边界问题,提出协议感知的证据控制框架EviBound,在抑郁症筛查任务中达到0.8658的AUROC,且实现零宣称违规。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026. Long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23152 2026-09-01 cs.CL 版本更新 83%

Counter with Evidence! A Multi-Agent Memory Efficient Reasoning Framework for Hate Category Informed Counterspeech Generation

结合证据的回应!用于仇恨类别感知反仇恨言论生成的多智能体内存高效推理框架

Sujoy Nath, Aswini Kumar, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi(印度德里理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 该研究针对现有反仇恨言论生成未区分仇恨言论类别的问题,提出多智能体框架FIRE并构建数据集FactualCS,实验显示FIRE效果优于基线且毒性更低。

Comments Accepted at EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14040 2026-09-01 cs.CL 版本更新 83%

Physics-R1: An Audited Olympiad Corpus and Released Verifiers for Visual Physics Reasoning

Physics-R1: 一个经过审计的奥林匹克语料库及视觉物理推理的配方

Shan Yang

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.CL

AI总结 本文通过审计多模态物理评估流程,揭示了训练-评估污染、翻译漂移和MCQ饱和等三个问题,并提出PhysR1配方,基于Qwen3-VL-8B-Thinking,提升了多个基准测试的性能。

Comments 10 pages, 3 tables. Project page: https://shanyang.me/physics-r1-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07019 2026-09-01 stat.ME cs.AI stat.AP stat.ML 版本更新 83%

Latency-Response Theory Model: Evaluating Large Language Models via Response Accuracy and Chain-of-Thought Length

延迟-响应理论模型:通过响应准确性和思维链长度评估大语言模型

Zhiyu Xu, Jia Liu, Yixin Wang, Yuqi Gu

机构 * Department of Statistics, Columbia University(哥伦比亚大学统计系) Department of Statistics, University of Michigan(密歇根大学统计系)

专题命中 推理评测 :chain-of-thought(title);reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 针对大语言模型评估问题,提出延迟-响应理论(LaRT)模型,联合考虑响应准确性和思维链长度,通过引入关键参数建模,推导高效算法估计参数,经理论和模拟研究验证其优势,实际数据评估中表现优于项目反应理论(IRT)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29120 2026-09-01 cs.CL cs.AI cs.SD 新提交 81%

HEAR Who Said What: Unlocking Speaker-Attributed Reasoning via Counterfactual Voice Grounding

HEAR:解锁说话人归因推理的反事实语音接地方法

Dongwook Lee, Sangkwon Park, Eunwoo Song, Che Hyun Lee, Youngho Cho, Junho Kim, June Young Yi, Heeseung Kim, Sungroh Yoon

机构 * IPAI, Seoul National University (SNU)(首尔国立大学IPAI) Yonsei University(延世大学) University of Seoul(首尔大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究推出说话人归因推理基准HEAR,发现现有SLMs依赖语义先验而非语音线索,进而提出30B模型A2R,在CASH数据集优化后于HEAR表现优异,且可零样本泛化至多说话人下游任务。

Comments EMNLP2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏