arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-31 至 2026-08-31 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 10 篇

2510.00938 2026-08-31 cs.LG 版本更新 87%

Large Reasoning Models Learn Better Alignment from Flawed Thinking

大规模推理模型通过 flawed thinking 学习更好的对齐

ShengYun Peng, Pin-Yu Chen, Eric Smith, Song Jiang, Hongyuan Zhan, Haozhu Wang, Mahesh Pasupuleti, Duen Horng Chau, Jianfeng Chi

机构 * Meta Superintelligence Labs(Meta超级智能实验室) IBM Research(IBM研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.LG

AI总结 RECAP通过强化学习提升模型安全对齐能力,减少偏见并增强鲁棒性,同时保持推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27963 2026-08-31 cs.AI 新提交 79%

SABER: Stability-Aware Early Exit for LLM Reasoning via Adversarial Branch Probing

SABER:基于对抗分支探测的大语言模型推理稳定性感知早停方法

Wanli Cheng, Haiya Xiang, Juntao Li, Hongling Wang, Wenliang Chen

机构 * Soochow University(苏州大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 SABER是一种无需训练的大语言模型推理早停框架,通过对抗分支探测平衡推理效率与可靠性,可平均减少30.2%-39.8%的推理token消耗且保持相当准确率。

Comments 20 pages,10 figures,EMNLP 2026 MainConference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22713 2026-08-31 cs.AI 版本更新 79%

SEGRA: A Structured Experience Guided Reasoning Agent for Property Graph Question Answering

SEGRA:用于基于Gremlin的问答的结构化经验引导图推理代理

Saiyue Lyu, Mariam Dundua, Vishaal Kapoor, Sarthak Ahuja, Neda Kordjazi, Evren Yortucboylu, Harsh Amin, Rebecca Steinert

机构 * University of British Columbia(英属哥伦比亚大学) Amazon(亚马逊)

专题命中 复杂问题求解 :reasoning(title);chain-of-thought(abstract);分类 cs.AI

AI总结 针对企业文本到Gremlin问答难题,SEGRA引入经验引导代理,集成多种技术,包括意图路由、查询生成等。在企业IT支持基准测试中成绩出色,平均评判分数大幅提高,技能库还降低了成本,提升了企业图问答的准确性与效率。

Comments Accepted at EMNLP 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00422 2026-08-31 cs.CR 版本更新 78%

KidnapRAG: A Black-Box Attack for Hijacking Reasoning in Agentic Retrieval-Augmented Generation Systems

KidnapRAG:针对代理式检索增强生成系统中推理劫持的黑盒攻击

Chanwoo Choi, Euntae Kim, Kyuho Lee, Youngsam Chun, Jinhee Jeong, Eunmi Kim, Myunggyo Oh, Junseo Jang, Buru Chang

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 提出KidnapRAG,一种针对代理式RAG系统的黑盒顺序投毒攻击,通过三种角色文档(诱饵、链环、恶意指令)劫持多步推理链,实验表明在多种框架和基准上优于现有方法。

Comments Accepted to the Main Conference of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27462 2026-08-31 cs.CL cs.AI 新提交 62%

Sledgehammer or Scalpel? A Fine-grained Adaptive Framework for Implicit Hate Speech

大锤还是手术刀?用于隐性仇恨言论检测的细粒度自适应框架

Han Wang, Yuhu Cheng, Xuesong Wang, Yi Zhu

机构 * School of Information and Control Engineering, China University of Mining and Technology(中国矿业大学信息与控制工程学院) Yangzhou University(扬州大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对隐性仇恨言论检测中现有方法推理流程单一、计算冗余的问题,提出FAID框架,先细粒度分类再自适应处理不同类型样本,在四个基准数据集上显著优于SOTA基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28264 2026-08-31 cs.AI 新提交 57%

Finding Where the Buck Stops: An Automated Failure Attribution-Based Reflection Framework for Multi-Agent Collaboration

查明责任归属:面向多智能体协作的自动化失败归因式自动反思框架

Xiaoqing Wang, Keman Huang, Bin Liang, Hongyu Li, Xiaoyong Du, Wuqiong Pan

机构 * Renmin University of China(中国人民大学) Ant Group(蚂蚁集团)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对大语言模型驱动多智能体系统的高失败率问题,提出DoCtOR框架,通过自动化失败归因识别决定性错误智能体,仅让其针对性反思,在多个数据集上提升成功率且优于基线方法。

Comments Accepted by EMNLP 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27638 2026-08-31 cs.AI cs.HC 新提交 57%

Generative AI Expands the Intellectual Reach of Course Based Undergraduate Research Experiences (CUREs)

生成式人工智能拓展了基于课程的本科研究经历(CUREs)的智力范围

Aditi Babar, Kristin J. Davin, Alex Dornburg

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本研究通过三个学期生物信息学与基因组学CURE的纵向定性数据,发现GenAI可从三方面拓展CURE的智力范围,同时保留人类判断的核心作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27477 2026-08-31 cs.AI cs.CV 新提交 57%

Benchmarking General Mobile Assistants in Challenging Real-World Scenarios

在具有挑战性的真实场景中对通用移动助手进行基准测试

Yiqi Zhu, Feiyu Gao, Jiaxing Fan, Jiahui Zeng, Minggang Wu, Chenliang Li, Haiyang Xu, Peng Li, Ming Yan, Yang Liu

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR))

专题命中 复杂问题求解 :planning(abstract);分类 cs.AI

AI总结 该研究提出名为GMA的移动助手基准,涵盖七个应用与300个不同难度任务,评估八个前沿模型发现其性能随任务复杂度提升而下降,还证实合适的智能体控制设计可显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26263 2026-08-31 cs.AI cs.MA 版本更新 57%

SKILL.state: Scalable Long-Horizon Agent Skills

SKILL.state:可扩展的长程智能体技能

Sanket Badhe, Priyanka Tiwari, Jonghyun Chung

机构 * Google LLC(谷歌公司) Purdue University(普渡大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对现有智能体运行时的长程延迟与上下文污染问题,提出SKILL.state架构,用显式可变执行状态替代追加式对话历史,提升任务准确率并降低令牌消耗。

Comments accepted at EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12634 2026-08-31 cs.AI 版本更新 57%

Atomic Units of X: The Compression Layer of Intelligence

X的原子单位:智能的压缩层

Sachin Dev Duggal, Pradyumna Swarnalatha Ramanna, Alexandros Vassiliades

机构 * SeKondBrain AI Labs(第二大脑人工智能实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 该论文提出将智能视为原子压缩与组合复用过程的理论框架,借助多学科证据阐述原子单位概念,给出压缩演算等核心方法,为设计自进化知识系统奠基,为智能相关多方面提供统一视角。

详情

展开后加载摘要…

URL PDF HTML 收藏