arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-21 至 2026-01-21 共收录 31 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 31 篇

2508.03140 2026-01-21 cs.CL cs.AI 90%

RCP-Merging: Merging Long Chain-of-Thought Models with Domain-Specific Models by Considering Reasoning Capability as Prior

RCP-Merging: 通过将推理能力作为先验来融合长链式思维模型与领域特定模型

Junyao Yang, Jianwei Wang, Huiping Zhuang, Cen Chen, Ziqian Zeng

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 RCP-Merging通过将推理能力作为先验,融合长链式思维模型与领域特定模型,提升领域任务性能9.5%-9.2%的同时保持原始推理能力。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05134 2026-01-21 cs.AI 85%

Structuring Reasoning for Complex Rules Beyond Flat Representations

为复杂规则构建推理结构超越平面表示

Zhihao Yang, Ancheng Xu, Jingpeng Li, Liang Yan, Jiehui Zhou, Zhen Qin, Hengyu Chang, Yukun Chen, Longze Chen, Ahmadreza Argha, Hamid Alinejad-Rokny, Minghuan Tan, Yujun Cai, Min Yang

机构 * Shenzhen Key Laboratory for High Performance Data Mining, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳高性能数据挖掘重点实验室,深圳先进技术研究院,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) School of Biomedical Engineering, UNSW Sydney(悉尼大学生物医学工程学院) University of Queensland(昆士兰大学) Alibaba Group(阿里巴巴集团)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出DAT框架,通过分阶段处理复杂规则,提升LLM在复杂规则任务中的推理能力与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12720 2026-01-21 cs.AI 83%

Teaching Large Reasoning Models Effective Reflection

教导大型推理模型有效的反思

Hanbin Wang, Jingwei Song, Jinpeng Li, Qi Zhu, Fei Mi, Ganqu Cui, Yasheng Wang, Lifeng Shang

机构 * Peking University(北京大学) The University of Hong Kong(香港大学) Huawei Technologies(华为技术有限公司) Shanghai AI Lab(上海人工智能实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.AI

AI总结 本文提出SCFT和RLERR方法,通过自我批评和强化学习提升大型推理模型的反思能力,实验表明在AIME2024和AIME2025基准上效果优于现有方法。

Comments 14 pages (including appendix), 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09269 2026-01-21 cs.AI 83%

RISER: Orchestrating Latent Reasoning Skills for Adaptive Activation Steering

RISER: 通过潜意识推理技能协调实现自适应激活引导

Wencheng Ye, Xiaoyang Yuan, Yi Bin, Pengpeng Zeng, Hengyu Jin, Liang Peng, Heng Tao Shen

机构 * Tongji University(同济大学) Tencent(腾讯)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract);分类 cs.AI

AI总结 RISER通过构建可重用的推理向量库和轻量级路由器,实现自适应激活引导,提升LLM推理的准确率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18260 2026-01-21 cs.CL 83%

MIRAGE: Scaling Test-Time Inference with Parallel Graph-Retrieval-Augmented Reasoning Chains

MIRAGE: 通过并行图检索增强推理链实现测试时扩展

Kaiwen Wei, Rui Shan, Dongsheng Zou, Jianzhong Yang, Bi Zhao, Junnan Zhu, Jiang Zhong

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 MIRAGE通过并行图检索增强推理链实现测试时扩展,提升医疗问答任务的准确性和可追溯性。

Comments 10 pages, 8 figures (including tables), plus appendix. Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13806 2026-01-21 cs.CL cs.LG 81%

Knowledge Graph-Assisted LLM Post-Training for Enhanced Legal Reasoning

基于知识图谱的LLM后训练以增强法律推理

Dezhao Song, Guglielmo Bonifazi, Frank Schilder, Jonathan Richard Schwarz

机构 * Thomson Reuters Foundational Research(汤姆森·路透基础研究) Imperial College London(帝国理工学院伦敦分校)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于知识图谱的LLM后训练方法,通过构建法律知识图谱提升法律推理能力,在多个基准测试中优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13752 2026-01-21 cs.AI cs.CL 81%

Finding RELIEF: Shaping Reasoning Behavior without Reasoning Supervision via Belief Engineering

寻找RELIFF:通过信念工程塑造推理行为而无需推理监督

Chak Tou Leong, Dingwei Chen, Heming Xia, Qingyu Yin, Sunbowen Lee, Jian Wang, Wenjie Li

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Sun Yat-sen University(中山大学) Zhejiang University(浙江大学) WUST(华中科技大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出RELIFF,通过信念工程无需推理监督塑造大型推理模型的行为,实验表明其在效率和忠实度任务上表现优异。

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14127 2026-01-21 cs.CV cs.CL 79%

The Side Effects of Being Smart: Safety Risks in MLLMs' Multi-Image Reasoning

智能的副作用:MLLMs多图像推理中的安全风险

Renmiao Chen, Yida Lu, Shiyao Cui, Xuan Ouyang, Victor Shea-Jay Huang, Shumin Zhang, Chengwei Pan, Han Qiu, Minlie Huang

机构 * CoAI group, DCST, Tsinghua University(清华大学) Beihang University(北航) Tsinghua University(清华大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 研究发现,多图像推理能力越强的模型在安全测试中越容易产生不安全响应,揭示了模型在任务解决中可能忽视安全约束的风险。

Comments *15 pages, 5 figures. Introduces MIR-SafetyBench (2,676 instances; 9 multi-image relations). Equal contribution; †Corresponding author. Code/data: https://github.com/thu-coai/MIR-SafetyBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09014 2026-01-21 cs.CL 79%

LitE-SQL: A Lightweight and Efficient Text-to-SQL Framework with Vector-based Schema Linking and Execution-Guided Self-Correction

LitE-SQL: 一种轻量高效的文本到SQL框架,具备基于向量的模式链接和执行引导的自我纠正

Shengmin Piao, Jieun Lee, Sanghyun Park

机构 * Yonsei University(延世大学)

专题命中 复杂问题求解 :self-correction(title,abstract);分类 cs.CL

AI总结 LitE-SQL通过轻量高效的框架和基于向量的模式链接技术,实现高准确率的文本到SQL生成,无需多候选采样即可执行引导自我纠正,适用于隐私敏感和资源受限场景。

Comments Accepted by EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18329 2026-01-21 cs.CL 79%

LIR$^3$AG: A Lightweight Rerank Reasoning Strategy Framework for Retrieval-Augmented Generation

LIR$^3$AG:一种轻量级重排序推理策略框架用于检索增强生成

Guo Chen, Junjie Huang, Huaijin Xie, Fei Sun, Tao Jia

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 LIR$^3$AG通过重构检索证据为连贯推理链,使非推理模型在RAG中实现性能超越,减少计算开销并提升F1分数。

Comments AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13607 2026-01-21 cs.CR 78%

When Reasoning Leaks Membership: Membership Inference Attack on Black-box Large Reasoning Models

当推理泄露成员身份:对黑盒大推理模型的成员推断攻击

Ruihan Hu, Yu-Ming Shang, Wei Luo, Ye Tao, Xi Zhang

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 针对黑盒大推理模型的成员推断攻击,通过分析推理轨迹的语义潜在空间构建攻击框架,揭示其隐私风险及改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14041 2026-01-21 cs.CL cs.AI 73%

Top 10 Open Challenges Steering the Future of Diffusion Language Model and Its Variants

推动扩散语言模型及其变体未来发展的十大开放挑战

Yunhe Wang, Kai Han, Huiling Zhen, Yuchuan Tian, Hanting Chen, Yongbing Huang, Yufei Cui, Yingte Shu, Shan Gao, Ismail Elezi, Roy Vaughan Miles, Songcen Xu, Feng Wen, Chao Xu, Sinan Zeng, Dacheng Tao

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) Peking University(北京大学) Huawei Technologies(华为技术有限公司) Nanyang Technological University(南洋理工大学)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 本文提出推动扩散语言模型及其变体发展的十大挑战,并提出以多尺度标记化、主动遮罩和潜在思考为核心的四支柱战略路线图,旨在突破因果瓶颈,实现复杂结构推理和多模态整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13228 2026-01-21 cs.CL cs.AI 73%

Autoregressive Models Rival Diffusion Models at ANY-ORDER Generation

自回归模型在任意阶生成中与扩散模型相媲美

Tianqi Du, Lizhe Fang, Weijie Yang, Chenheng Zhang, Zeming Wei, Yifei Wang, Yisen Wang

机构 * National Key Lab of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(国家关键人工智能实验室,智能科学与技术学院,北京大学) School of Mathematical Sciences, Peking University(数学科学学院,北京大学) Amazon AGI SF Lab(亚马逊人工智能SF实验室) Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 本文提出A3框架,通过自回归建模实现任意阶生成,超越传统扩散模型,提升语言建模的灵活性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05014 2026-01-21 cs.AI cs.LG 73%

Think Then Embed: Generative Context Improves Multimodal Embedding

思考后再嵌入:生成性上下文提升多模态嵌入

Xuanming Cui, Jianpeng Cheng, Hong-you Chen, Satya Narayan Shukla, Abhijeet Awasthi, Xichen Pan, Chaitanya Ahuja, Shlok Kumar Mishra, Yonghuan Yang, Jun Xiao, Qi Guo, Ser-Nam Lim, Aashu Singh, Xiangjun Fan

机构 * AI at Meta(Meta人工智能部门) University of Central Florida(中央佛罗里达大学) New York University(纽约大学)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出Think-Then-Embed框架,通过生成性推理提升多模态嵌入性能,实现更高效的复杂指令处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13383 2026-01-21 cs.AI 70%

A Lightweight Modular Framework for Constructing Autonomous Agents Driven by Large Language Models: Design, Implementation, and Applications in AgentForge

基于大语言模型的轻量模块化框架:用于AgentForge中的设计、实现与应用

Akbar Anbar Jafari, Cagri Ozcinar, Gholamreza Anbarjafari

机构 * University of Tartu(塔尔图大学) S Holding OÜ(3S控股公司)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 AgentForge是一种基于大语言模型的轻量模块化框架,通过可组合的技能抽象、统一的LLM后端接口和声明性配置系统,提升自主代理的开发效率和灵活性。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12762 2026-01-21 cs.SE cs.AI 70%

Teaching LLMs to Learn Tool Trialing and Execution through Environment Interaction

通过环境交互教授LLMs学习工具尝试与执行

Xingjie Gao, Pengcheng Huang, Zhenghao Liu, Yukun Yan, Shuo Wang, Zulong Chen, Chen Qian, Ge Yu, Yu Gu

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Alibaba Group(阿里巴巴集团) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 复杂问题求解 :planning(abstract);self-correction(abstract);分类 cs.AI

AI总结 ToolMaster通过环境交互主动学习工具使用,提升LLMs在新工具上的泛化与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01724 2026-01-21 cs.AI 70%

ReflecSched: Solving Dynamic Flexible Job-Shop Scheduling via LLM-Powered Hierarchical Reflection

ReflecSched: 通过LLM赋能的分层反思解决动态灵活作业车间调度问题

Shijie Cao, Yuan Yuan

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Beihang University(北京航空航天大学) Qingdao Research Institute(青岛研究院) Hangzhou Innovation Institute(杭州创新研究院) Zhongguancun Laboratory(中关村实验室)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 ReflecSched通过LLM赋能的分层反思机制,有效解决动态灵活作业车间调度问题,实现优于传统和学习方法的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11637 2026-01-21 cs.CV 67%

Evaluating Self-Correcting Vision Agents Through Quantitative and Qualitative Metrics

通过定量和定性指标评估自我纠正的视觉代理

Aradhya Dixit

机构 * The Thørväld Group(Thørväld集团) Inria Paris-Rocquencourt(巴黎-罗克琴堡Inria) Rajiv Gandhi University Doimukh(拉贾·甘地大学多伊穆克) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒姆研究实验室) The Kumquat Consortium(昆夸特联盟)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract)

AI总结 本文提出诊断微基准测试,通过量化和定性指标评估视觉代理的自我纠正能力,揭示语义漂移是主要瓶颈,并定义可重复的框架以提升多模态代理的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11579 2026-01-21 cs.CL cs.AI 62%

Bielik 11B v3: Multilingual Large Language Model for European Languages

Bielik 11B v3:面向欧洲语言的多语言大语言模型

Krzysztof Ociepa, Łukasz Flis, Remigiusz Kinas, Krzysztof Wróbel, Adrian Gwoździej

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Bielik 11B v3是一款针对波兰语优化,同时支持多种欧洲语言的高性能大语言模型,通过深度扩展和四阶段训练流程实现了高效参数利用和广泛任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11564 2026-01-21 cs.CL cs.AI 62%

Context Discipline and Performance Correlation: Analyzing LLM Performance and Quality Degradation Under Varying Context Lengths

上下文学科与性能相关性:分析在不同上下文长度下LLM性能及质量退化

Ahilan Ayyachamy Nadar Ponnusamy, Karthic Chandran, M Maruf Hossain

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了不同上下文长度下LLM性能与质量退化的关系,发现KV缓存增长导致性能非线性退化,并揭示了MoE架构在高token体积时受基础设施瓶颈影响的问题。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13453 2026-01-21 cs.CL cs.HC 57%

PhysicsSolutionAgent: Towards Multimodal Explanations for Numerical Physics Problem Solving

PhysicsSolutionAgent: 向数值物理问题求解的多模态解释迈进

Aditya Thole, Anmol Agrawal, Arnav Ramamoorthy, Dhruv Kumar

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 PhysicsSolutionAgent通过生成多模态视频解释,提升数值物理问题的可视化教学效果,揭示了多模态推理与评估的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13114 2026-01-21 cs.NI cs.AI cs.SY eess.SY 57%

IntAgent: NWDAF-Based Intent LLM Agent Towards Advanced Next Generation Networks

IntAgent:基于网络切片分析功能的意图LLM代理面向下一代高级网络

Abdelrahman Soliman, Ahmed Refaey, Aiman Erbad, Amr Mohamed

机构 * University of Guelph(圭尔夫大学) Qatar University(卡塔尔大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 IntAgent通过整合NWDAF分析与工具,实现基于意图的网络自动化管理,提升网络操作的智能化和动态响应能力。

Comments conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12449 2026-01-21 cs.CR cs.AI 57%

AgenTRIM: Tool Risk Mitigation for Agentic AI

AgenTRIM:代理AI的工具风险缓解

Roy Betser, Shamik Bose, Amit Giloni, Chiara Picardi, Sindhu Padakandla, Roman Vainshtein

机构 * Fujitsu Research of Europe (FRE)(富士通欧洲研究(FRE)) Fujitsu Research of India Pvt. Ltd. (FRIPL)(富士通印度私人有限公司(FRIPL))

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 AgenTRIM通过离线和在线阶段检测并缓解代理AI中工具驱动的风险,减少攻击成功率同时保持任务性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21849 2026-01-21 cs.CL cs.MA 57%

Following the TRACE: A Structured Path to Empathetic Response Generation with Multi-Agent Models

遵循TRACE:基于多智能体模型的结构化共情响应生成路径

Ziqi Liu, Ziyang Zhou, Yilin Li, Haiyang Zhang, Yangbin Chen

机构 * School of Advanced Technology (SAT) Xi'an Jiaotong-Liverpool University, Suzhou, China(先进技术学院(SAT)西安交通大学利物浦大学,苏州,中国)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 TRACE通过结构化分解任务,结合深度分析与生成能力,提升共情响应生成的性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12030 2026-01-21 cs.AI 57%

ARC: Active and Reflection-driven Context Management for Long-Horizon Information Seeking Agents

ARC:面向长周期信息检索代理的主动与反思驱动上下文管理

Yilun Yao, Shan Huang, Elsie Dai, Zhewen Tan, Zhenyu Duan, Shousheng Jia, Yanbing Jiang, Tong Yang

机构 * Peking University(北京大学) Beihang University(北京航空航天大学) Qiyuan Tech(启元科技)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 ARC 通过主动和反思驱动的上下文管理方法,提升了长周期信息检索代理的性能,显著提高了准确性。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11974 2026-01-21 cs.AI 57%

Learn Like Humans: Use Meta-cognitive Reflection for Efficient Self-Improvement

像人类学习:利用元认知反思实现高效的自我改进

Xinmeng Hou, Peiliang Gong, Bohao Qu, Wuqi Wang, Qing Guo, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) A*STAR Chang’an University(长安大学) Nankai University(南开大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 MARS通过整合基于原则和程序性的反思,实现高效自我改进,优于现有系统并降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11783 2026-01-21 cs.SE cs.CL 57%

The Stability Trap: Evaluating the Reliability of LLM-Based Instruction Adherence Auditing

稳定性陷阱:评估基于大语言模型的指令遵循审计的可靠性

Murtuza N. Shergadwala

机构 * Workday Inc.(Workday公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过引入有界指令分解框架,揭示了基于大语言模型的指令遵循审计中判决稳定性与推理稳定性之间的矛盾,提出需严格限定自动化评估协议以提升可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02888 2026-01-21 cs.LG 57%

RPIQ: Residual-Projected Multi-Collaboration Closed-Loop and Single Instance Quantization for Visually Impaired Assistance

RPIQ: 基于残差投影多协作闭环和单实例量化的方法用于视障辅助

Xuanyu Wang, Haisen Su, Jingtao Zhang, Xiangxiang Wang, Yongbin Yu, Manping Fan, Jialing Xiao, Bo Gong, Siqi Chen, Mingsheng Cao, Liyong Ren, Zhenglin Yang

机构 * School of Information Software Engineering, University of Electronic Science School of Mathematical Sciences, Sichuan Normal University, Chengdu, Sichuan, China Sichuan Provincial Key Laboratory for Human Disease Gene Study, Sichuan Academy of Medical Sciences \& Sichuan Provincial People's Hospital, University of Electronic Science Research Unit for Blindness Prevention, Chinese Academy of Medical Sciences, Sichuan Academy of Medical Sciences Sichuan Provincial People’s Hospital, Chengdu, Sichuan, China School of Medicine, University of Electronic Science Tibetan Language Intelligence National Key Laboratory, Qinghai Normal University, Xining, Qinghai, China

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 RPIQ通过残差投影多协作闭环和单实例量化方法,实现大规模模型在4位表示下的高效压缩,显著降低内存消耗并保持高性能,适用于视障辅助系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01652 2026-01-21 cs.CL 57%

MIRAGE: Exploring How Large Language Models Perform in Complex Social Interactive Environments

MIRAGE:探索大型语言模型在复杂社会互动环境中的表现

Yin Cai, Zhouhong Gu, Zhaohan Du, Zheyu Ye, Shaosheng Cao, Yiqian Xu, Hongwei Feng, Ping Chen

机构 * Institute of Big Data, Fudan University(复旦大学大数据研究院) Shanghai Key Laboratory of Data Science, School of Computer Science, Fudan University(复旦大学计算机学院) School of Computer Science, Fudan University(复旦大学计算机学院) Xiaohongshu Inc.(小红书公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 MIRAGE通过谋杀谜案游戏评估LLMs在复杂社会互动环境中的表现,揭示其在信任、线索调查、互动和指令遵循方面的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13112 2026-01-21 cs.CR 50%

CODE: A Contradiction-Based Deliberation Extension Framework for Overthinking Attacks on Retrieval-Augmented Generation

CODE:一种基于矛盾的 deliberation 延伸框架,用于对抗检索增强生成中的过度思考攻击

Xiaolei Zhang, Xiaojun Jia, Liquan Chen, Songze Li

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出 CODE 框架,通过构造污染样本引发 RAG 系统的过度思考攻击,导致推理标记消耗激增,同时不影响任务性能。

Comments 12 pages with 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏