arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-27 至 2026-08-27 共收录 16 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 16 篇

2608.18504 2026-08-27 cs.AI 版本更新 87%

UMER: Unifying Embedding and Ranking via Pair-Aware Discriminative Reasoning for Universal Multimodal Retrieval

UMER:通过感知对的判别推理统一嵌入与排序以实现通用多模态检索

Libiao Chen, Xiyang Liu, Yanheng Wei, Tao Wang, Zhenyu Tang

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 本研究针对通用多模态检索的需求,提出UMER框架,通过感知对的判别推理联合学习对比式嵌入与判别式排序,在MMEB-V2基准上实现最优性能且支持可调整预算的推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26865 2026-08-27 stat.ML cs.AI cs.IT cs.LG 版本更新 84%

Think Short, Defer Smart, Act, and Repeat: Calibrated Reasoning and Uncertainty-Aware Deferral for Edge LLM Agents

短思考、智能延迟、行动与循环:面向边缘大语言模型智能体的校准推理与感知不确定性的延迟机制

Amirmohammad Farzaneh, Osvaldo Simeone

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出TSDS框架,结合收敛探测器与困惑度延迟规则,经LTT流程校准后,可在边缘LLM智能体上减少43%-73%的思考计算量,同时保证奖励与云端调用率,在多类基准任务上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25542 2026-08-27 cs.LG cs.CL 新提交 81%

Reflection Steering: Disentangling Reflection from Reasoning in Activation Space for Token-Efficient Inference

反射引导:在激活空间中解耦反射与推理以实现高效令牌推理

Jiarui Hu, Zhiyuan Wen, Xiaoyun Liu, Jiaxing Shen, Yu Yang

机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学院) School of Data Science, Lingnan University(岭南大学数据科学学院) Centre for Learning, Teaching and Technology, The Education University of Hong Kong(香港教育大学学习、教学与技术中心)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出无需训练的Reflection Steering框架,通过解耦反射与推理的激活实现高效令牌推理,可减少16.9%推理令牌,还引入参数α平衡令牌节省、准确率与生成稳定性。

Comments 8 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25531 2026-08-27 cs.CL 新提交 79%

ClueWeaver: Reward-Guided Dual-Agent Evidence Reasoning for Compact LLMs on Literary Long Narratives

ClueWeaver:面向紧凑型大语言模型的、针对文学长篇叙事的奖励引导双智能体证据推理框架

Jihao Zhu, Zhiwei Yang, Wenxiao Zhang, Junqian Zhao, Qi You, Fangqi Wang, Zheyuan Deng, Hanzhe Yang, Yu Liu, Jin B. Hong

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) University of Aberdeen(阿伯丁大学) The University of Western Australia(西澳大学) Brown University(布朗大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 ClueWeaver是用于紧凑型本地模型的双智能体证据推理框架,可提升本地语言模型在长篇叙事问答与声明验证任务中的性能,提供可检查的证据推理轨迹。

Comments Accepted by ICONIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25487 2026-08-27 cs.CL cs.IR 新提交 79%

ReliableRAG: Combating Misinformation in Retrieval-Augmented Generation via Reliability-Guided Reasoning Chains

ReliableRAG:通过可靠性引导推理链对抗检索增强生成中的错误信息

Jinpu Jiang, Xuan Wu, Wenhao Song, Bo Yang, You Zhou, Hongwei Ge, Heow Pueh Lee, Yanchun Liang, Chunguo Wu

机构 * College of Software, Jilin University(吉林大学软件学院) College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education, College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院 教育部符号计算与知识工程重点实验室) College of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院) National University of Singapore(新加坡国立大学) School of Computer Science, Zhuhai College of Science and Technology(珠海科技学院计算机学院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 ReliableRAG是首个通过细粒度评估三元组缓解多跳问答中欺骗性错误信息的可靠性驱动框架,可提升RAG系统的事实可靠性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05876 2026-08-27 cs.CL 版本更新 79%

Addressing the Reasoning Gap: Mechanistic Circuit-Based Knowledge Editing in Large Language Models

基于机制电路的知识编辑在大语言模型中

Tianyi Zhao, Yinhan He, Wendy Zheng, Chen Chen

机构 * University of Virginia(弗吉尼亚大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出MCircKE框架,通过识别因果电路实现精准的知识编辑,解决大语言模型在动态环境中更新知识时的推理缺口问题,提升多跳推理能力。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26094 2026-08-27 cs.CV cs.AI cs.ET cs.HC cs.LG 新提交 73%

MyoMechanix: Biomechanically-Grounded Compositional Skilled Activity Understanding and Coaching

MyoMechanix:基于生物力学的可组合技能活动理解与指导

Hao Yin, Paritosh Parmar, Lijun Gu, Lin Xu, Tianxiao Guo, Xiujin Liu, Tianyou Zheng, Yang Zhang, Weiwei Fu

机构 * University of Science and Technology of China(中国科学技术大学) Suzhou Institute of Biomedical Engineering and Technology, Chinese Academy of Sciences(中国科学院苏州生物医学工程技术研究所) Arexeni Research and Technologies Inc.(Arexeni研究与技术公司) Beijing Sports University(北京体育大学) University of Michigan(密歇根大学)

专题命中 复杂问题求解 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MyoMechanix多模态生态系统,构建FKG与CUBIST,建立三类任务,多模态方法提升AQA性能与可解释性,为物理AI提供生物力学基础的技能理解方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03297 2026-08-27 cs.CL cs.AI cs.LG 版本更新 67%

TTSR: Test-Time Self-Evolving via Reflection

TTSR: 测试时自我反思以提升持续推理能力

Haoyang He, Zihua Rong, Yunjia Zhao, Lan Yang, Jian Chang, Honggang Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Southwestern University of Finance and Economics(西南财经大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TTSR通过测试时自我反思机制,利用学生与教师角色交替,持续改进大语言模型的推理能力。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11544 2026-08-27 cs.CL cs.AI 版本更新 62%

Time is Not a Label: Continuous Phase Rotation for Temporal Knowledge Graphs and Agentic Memory

时间并非标签:连续相位旋转用于时间知识图谱与智能记忆

Weixian Waylon Li, Jiaxin Zhang, Xianan Jim Yang, Tiejun Ma, Yiwen Guo

机构 * University of Edinburgh(爱丁堡大学) LIGHTSPEED University of St Andrews(圣安德鲁斯大学) Independent Researcher(独立研究员)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RoMem模块,通过连续相位旋转技术解决时间信息在知识图谱中的表示问题,提升时间推理和记忆保持性能,实现状态-of-the-art结果。

Comments EMNLP 2026, Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01446 2026-08-27 cs.CL cs.LG 版本更新 62%

iFlip: Iterative Feedback-driven Counterfactual Example Refinement

iFlip: 迭代反馈驱动的反事实示例精炼

Yilong Wang, Qianli Wang, Nils Feldhus

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL、cs.LG

AI总结 iFlip通过迭代反馈驱动的方法生成有效反事实示例,提升模型性能和鲁棒性。

Comments Camera-ready version accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25871 2026-08-27 cs.LG 新提交 57%

CEDAR: Controlled and Event-Driven Demand Forecasting via Residual Decomposition

CEDAR:基于残差分解的可控事件驱动需求预测

Junjie Meng, Ranxu Zhang, Zi-an Zhang, Shujun Liu, Xiaoning Qi, Xiaozhou Xu, Yanyong Zhang, Hui Xiong, Chao Wang

机构 * School of Artificial Intelligence and Data Science, University of Science and Technology of China(中国科学技术大学人工智能与数据科学学院) Alibaba Group(阿里巴巴集团) Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能学域)

专题命中 复杂问题求解 :planning(abstract);分类 cs.LG

AI总结 该研究针对现有时间序列预测方法对策略不敏感、反事实分析不可靠的问题,提出基于残差分解的两阶段框架CEDAR,在阿里1688数据集上验证其可提升模拟精度并助力预算规划。

Comments 12 pages, 4 figures, 5 tables. Published in KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25559 2026-08-27 cs.CV cs.AI 新提交 57%

AdaVDR: Adaptive Tool Use and Reflection for Video Deep Research

AdaVDR:面向视频深度研究的自适应工具使用与反思

Xintong Zhang, Xiaomeng Fan, Shilin Yan, Ekko He, Zicheng Liu, Zijian Zou, Guannan Zhang, Yuwei Wu, Zhi Gao, Hongwei Xue

机构 * Alibaba Group(阿里巴巴集团) Beijing Institute of Technology(北京理工大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出AdaVDR自适应视频深度研究智能体,通过自适应工具调用与反思解决视频深度研究的不当工具调用等问题,构建相关基准并在VDR-EE、VideoDR上取得优于基础模型的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25358 2026-08-27 cs.AI 新提交 57%

Where vs What: Decomposing Structural and Content Failures in LLM-Generated Structured Outputs

位置与内容:分解大语言模型生成结构化输出中的结构与内容失败

Yiwei Zhang, Chengke Wu, Li Wang, Jianqiang Li

机构 * Shenzhen University(深圳大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对LLM生成结构化输出的错误,提出SCD框架,发现结构保真度随复杂度下降更快,进而提出SA-RLVR方法,有效提升了JSON和表格领域的值位置准确率。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25711 2026-08-27 cs.CR 新提交 50%

Reassembling Distributed Risk: Trajectory-Conditioned Action Generation for Multi-Turn Agent Safety

重构分布式风险:面向多轮智能体安全的轨迹条件动作生成

Yanbo Dai, Zhenlan Ji, Zongjie Li, Shuai Wang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 针对多轮分解攻击下使用工具的LLM智能体的安全风险,提出生成时防御方法ReDiR,通过轨迹级安全条件整合跨轮安全信息,将攻击成功率降至8%以下,可迁移且开销低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25099 2026-08-27 math.OC math.DS 新提交 50%

A Control-Theoretic Approach for Resource-Aware Consensus in Multi-Agent AI

面向多智能体AI中资源感知共识的控制论方法

James Flagg, Esteban A. Hernandez-Vargas

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 该研究针对LLM-MAS共识性能与计算资源关联保证不足的问题,提出将集体信念动态表征为离散时间切换系统的控制论方法,构建共识-预算证书区域,实现资源感知的多智能体协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12065 2026-08-27 cs.RO 版本更新 50%

Scene2Demo: Self-Evolving Embodied Data Generation via Object-Action Graph

具身学习的可扩展任务生成:基于 affordance 的任务世界

Xiang Liu, Sen Cui, Guocai Yao, Zhong Cao, Jingheng Ma, Min Zhang, Changshui Zhang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出 AGT-World 框架,通过结构化图方法实现任务空间的精确分解,并结合混合反馈机制实现策略的自进化,从而提升机器人任务生成的可扩展性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏