EchoCoT: Extracting Hidden Chain-of-Thought from Large Reasoning Models
EchoCoT:从大型推理模型中提取隐藏的思维链
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 本研究提出EchoCoT多步骤攻击方法,通过API交互可从开源及前沿专有大型推理模型中近乎逐字提取隐藏思维链,该方法还具备泛化性,凸显隐藏CoT提取的安全风险。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
EchoCoT:从大型推理模型中提取隐藏的思维链
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 本研究提出EchoCoT多步骤攻击方法,通过API交互可从开源及前沿专有大型推理模型中近乎逐字提取隐藏思维链,该方法还具备泛化性,凸显隐藏CoT提取的安全风险。
Repo0:面向从零到全代码生成的设计驱动框架
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 Repo0是面向从零到全代码生成的连续结构演化框架,通过Dual-DAG架构等技术,在RepoCraft数据集上相较RPG大幅提升了代码生成的功能覆盖率与通过率。
Comments Our code and data are available at https://github.com/cslsolow/Repo0
RTPO:用于稳定智能体强化学习训练的反向回合策略优化
机构 * Adelaide University(阿德莱德大学) ; The University of Sydney(悉尼大学) ; Curtin University(科廷大学) ; School of CSIT(计算机科学与信息技术学院) ; ACFR(澳大利亚空间研究中心) ; School of EECMS(电子工程、计算机与数学科学学院)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对多回合智能体RL训练不稳定问题,提出RTPO方法,通过反向回合策略优化消除上下文不匹配与异步漂移,实验显示其较基线提升21.50%、10.76%。
FinRCA-Bench:面向金融AI系统的证据检索与推理基准
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究推出FinRCA-Bench基准,评估金融AI系统的证据检索与推理,发现检索架构影响性能,正确根本原因标签是可审计诊断的弱代理。
Comments 19 pages, 4 figures, 7 tables. Code and data: https://github.com/PratikGhawate/FinRCA-AI-Bench
立场:AI推理智能体间的合谋风险证明其在制定市场决策时需满足认证要求
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 该研究指出具备思维链推理能力的AI智能体易出现合谋倾向,提出需对其进行行为认证,实验显示DeepSeek-R1智能体在伯特兰寡头定价场景中存在默契合谋,且其思维链可被隐蔽引导至合谋或竞争状态。
Comments ICML 2026
AdaLens:用于监控和引导长时间运行的智能体数据分析的交互式故事情节
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对长时间智能体数据分析的传统界面无法满足可观测性与可引导性需求,本文提出交互式系统AdaLens,结合故事情节表示与引导交互,经案例及用户研究验证其能有效支持分析师监控与引导此类分析。
SCENARIODIFF:面向多模态时间序列预测的场景级引导框架——扩展版
机构 * VinUniversity ; FPT Software AI Center, FPT Corporation(FPT软件AI中心,FPT集团) ; VNU University of Engineering and Technology(VNU工程技术大学) ; Aalborg University(奥尔堡大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG
AI总结 该研究针对现有多模态时间序列预测方法上下文影响难解释控制的问题,提出SCENARIODIFF分层框架,通过三类智能体生成结构化信号引导多模态扩散Transformer,锚点混合采样优化轨迹,在Time-MMD基准的事件驱动领域表现优异。
Comments 10 pages. An extended version of "SCENARIODIFF: A Scenario-level Guidance Framework for Multimodal Time Series Forecasting" accepted at ICDM 2026
寻求共识的论证:在冲突个体间寻找可能的共识区
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出定量双极论证框架,通过合并冲突双方的推理框架识别可能的共识区(ZOPA),并以巴以冲突的调查数据验证其可行性,为冲突解决提供新方法。
证明是否以其应有的方式被证明?《几何原本》元素证明的忠实形式化
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 本研究提出满足五项必要条件的Pistis智能体式证明搜索方法,通过OrderDecompose分治搜索生成欧几里得《几何原本》前三卷的忠实形式化Lean证明,其性能优于基线方法,可作为证明检查工具。
Comments Preprint. 18 pages, 14 figures, 7 tables
为何视觉无法作为通用桥梁:修正多语言多模态大语言模型(MLLMs)中的模态异步性
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Shenzhen Loop Area Institute(深圳河套学院) ; National Health Data Institute (Shenzhen)(国家健康数据研究院(深圳))
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 针对多语言MLLMs在非英语视觉推理中的性能下降问题,该研究发现其源于“幽灵锚点”模态异步性,提出ANCHOR训练框架,经实验验证可提升跨语言视觉推理性能。
无干净参考的智能体数据清洗:能力与权衡的实验研究
机构 * Faculty of Arts and Sciences(文理学院) ; University of Sciences and Arts in Lebanon(黎巴嫩科学与艺术大学)
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 本研究提出整合多组件的基于证据的无参考智能体数据清洗框架,经多数据集实验发现,额外能力会在多指标间引入权衡,无配置在所有标准上最优。
Comments 21 pages, 3 figures, Submitted to New Generation Computing
评估大语言模型的数学能力需要理解数学创造力的多种机制
机构 * University of Ostrava(俄斯特拉发大学) ; IRAFM
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出数学创造力包含多种不可替代的机制,当前LLMs仅具备部分模式的能力,建议围绕该机制分类而非综合基准评估其数学能力。
先定位,再推理:用于分子性质与编辑的视觉隐式结构推理
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL
AI总结 该研究针对现有化学推理模型无法聚焦分子关键区域的问题,提出VLSR框架,采用先定位再推理策略,在分子性质推理任务上实现9.6倍于文本推理基准的吞吐量提升。
UniTraffic-Agent:面向2026年AI城市挑战赛第3赛道的统一交通视频推理,含两项域外评估
机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences (UCAS)(中国科学院大学计算机科学与技术学院) ; Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS)(中国科学院计算技术研究所) ; Beijing Academy of Artificial Intelligence (BAAI)(北京智源人工智能研究院) ; School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 UniTraffic-Agent是第10届AI城市挑战赛第3赛道的MR-CAS解决方案,采用观察-推理-行动-验证工作流,在TAR、FETV、PSI-VQA三项任务中取得相应排名,为交通视频推理提供了新方案。
Comments This paper has been accepted to ECCV 2026 AI City Challenge Workshop
该引用是否相关?
专题命中 推理与问题求解 :LLM(abstract_cn);prompting(abstract);分类 cs.CL
AI总结 本文针对现有大语言模型法律用例评估忽视的“指向真实案件却不支持主张”的引用问题,通过扰动真实法律引用验证14种模型配置,发现模型易混淆主题识别与页码级支持验证能力,规模与推理能力仅能部分缩小错精准页码扰动的检测差距。
Comments Accepted to the 1st Workshop on AI for Law at ICML 2026
TRACES:用于评估大型语言模型科学推理中认知可靠性的基准
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究构建了名为TRACES的基准,发现30种大型语言模型在识别42篇不可靠科学论文的认知可靠性时表现不佳,仅少数模型能有效拒绝有缺陷前提,凸显科学部署需护栏。
Comments 16 pages + appendices. 4 figures in the main text
CARE:用于可靠医学视觉问答的置信感知推理
机构 * Ant Group(蚂蚁集团) ; University of Michigan(密歇根大学) ; City University of Hong Kong(香港城市大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究针对医学多模态大语言模型的置信度校准问题,提出CARE框架,通过双阶段流程优化准确率与校准度,在三个医学VQA基准上取得最优性能,为临床决策支持提供可信基础。
Comments Accepted by MICCAI 2026
VERDICT:基于分歧感知共识的多模态推理无训练逐步验证方法
机构 * Indian Institute of Technology, Hyderabad(印度理工学院海得拉巴分校) ; Microsoft Research(微软研究院)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究针对多模态大语言模型推理链易出错的问题,提出无训练的VERDICT方法,利用跨模态分歧的闭式解计算共识评分,在六个基准上提升最高达5.95%,性能接近需大量监督的特定领域评论家。
Comments European Conference on Computer Vision 2026
基于可验证情感反馈的双循环自演化多轮共情对话
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 该研究针对大语言模型共情能力不足问题,提出双循环自演化框架,在SAGE数据集上显著提升Qwen3-8B的共情对话性能,优于对比方法。
Comments 10 pages, 4 figures, 6 tables
GeoForge:用于对地观测推理的非参数自进化智能体
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 GeoForge是一种无需训练的自进化框架,通过结构化非参数执行状态及多记忆机制提升EO智能体的规划与推理能力,可改善任务准确率、工具轨迹质量并减少推理错误。
连续交互扩散:面向异步工具增强推理的原生扩散运行时
机构 * Nanjing University(南京大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对扩散语言模型异步工具增强推理的局限,提出连续交互扩散架构,将工具交互整合至迭代去噪,可提升效率并减少冗余,首次聚焦只读工具。
Comments 15 pages, 5 figures, 1 table
面向辅助AI智能体的分层组合性
机构 * University of Edinburgh(爱丁堡大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文针对辅助AI智能体的歧义问题,提出嵌入分层组合性原则的架构,结合语义兼容性等模型推理实现歧义消除,实验表明其性能优于当前最优数据驱动基线,可适配特定用户画像。
Comments 25 pages, 9 figures, 4 tables. Project page: https://tianyi-fu.github.io/HCAA
ColluSkill:用于规避智能体技能扫描器的对抗性跨技能组合
专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI
AI总结 本研究提出ColluSkill攻击框架,可通过跨技能组合规避技能扫描器,攻击成功率达96.0%;还提出ChainGuard防御框架,能将攻击成功率降至22.5%,同时放行99.5%良性工作流。
Comments 9 pages, 3 figures, 4 tables
CircuitReason-1k:电路中的长程视觉到符号推理基准测试
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 CircuitReason-1k是含1000个真实教材电路问题的基准,用于评估多模态模型的长程视觉到符号推理,现有模型在长程问题上表现差,该基准为相关测试提供了聚焦平台。
MMArch:基于建筑证据的多模态推理基准测试
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对多模态大语言模型(MLLM)在工程多模态推理基准上的表现,构建MMArch基准,发现现有MLLM与人类专家存在差距,为相关研究提供评估基准。
面向编码智能体的需求澄清、规划与代码生成的统一问题解决基准
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究推出SWE-RPG编码智能体基准,评估发现主流编码智能体在该基准上平均解决率仅31.5%,隐性需求恢复是主要瓶颈,为改进编码智能体提供了方向。
Comments 9 pages
SkillReason:面向隐式用户请求的推理增强型智能体技能检索
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对隐式用户请求的技能检索难题,提出两阶段框架SkillReason,结合推理增强训练,在SkillReason-Bench等三个基准上取得最优性能,缩小任务目标与技能能力的语义差距。
基于证据的取证推理:检测与定位多模态媒体篡改
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文针对多模态媒体篡改检测与定位问题,提出基于证据的取证推理框架,结合锚定-验证推理链、可验证奖励系统与模态解耦优势路由机制,实现最优性能与可解释性的统一。
Comments accepted by ACM MM 2026
KGCache:基于大型语言模型的知识图谱推理的摊销子图检索
机构 * Texas A&M University(得克萨斯农工大学)
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究针对KGQA中重复检索知识图谱邻域的问题,提出兼容ToG与RoG范式的KGCache,经在WebQSP和CWQ上评估,可显著加速知识图谱检索。
Comments 11 pages, 5 figures
EMMR:异步视频面试中用于人格评估的情绪介导多模态推理
专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究针对异步视频面试人格评估中以文本为中心的方法忽略非言语线索的问题,提出EMMR框架,在OPVA和AVI-6数据集上提升了MAE、MSE和PCC,证明整合情绪线索可优化评估效果。