arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-28 至 2026-08-28 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 18 篇

2608.27348 2026-08-28 cs.CL 新提交 86%

INTENT-AS-A-TOOL Makes it Easy to Track Agentic Misalignment

意图作为工具:轻松追踪智能体失配问题

Yutong Zhang, Jianshuo Dong, Peng Xu, Long Wang, Jie Zhang, Tianwei Zhang, Xiaoping Zhang, Han Qiu

机构 * Tsinghua University(清华大学) MatrixOrigin(矩阵起源) SiliconProspect AI(硅景人工智能) Nanyang Technological University(南洋理工大学)

专题命中 其他推理 :CoT(summary_cn,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本研究针对智能体失配问题,提出INTENT-AS-A-TOOL方法,通过添加意图专用工具追踪智能体推理过程中的意图变化,补充CoT监控,为智能体安全追踪提供细粒度信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26870 2026-08-28 cs.AI cs.CL cs.SI 新提交 84%

C-Unseen: Weak Signal Detection in Dynamic Temporal Knowledge Graphs via LLM Reasoning

C-Unseen:基于大语言模型推理的动态时序知识图谱中的弱信号检测

Yassir Lairgi, Ludovic Moncla, Khalid Benabdeslem, Rémy Cazabet, Pierre Cléau

机构 * INSA Lyon(里昂国立应用科学学院) CNRS(法国国家科学研究中心) UCBL(里昂第一大学) GAUC

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出C-Unseen框架,通过LLM的思维链推理识别动态时序知识图谱中与主导叙事有张力的罕见子图并追踪其持续性,实现弱信号检测,性能优于各类基线方法。

Comments Accepted at the AI4SE 2026 Special Track, held within the WISE 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26125 2026-08-28 cs.CL cs.AI 新提交 81%

Training-Time Explainability for Multilingual Hate Speech Detection: Aligning Model Reasoning with Human Rationales

多语言仇恨言论检测的训练时可解释性:对齐模型推理与人类理由

Muhammad Deedahwar Mazhar Qureshi, Sannaan Khan, Muhammad Atif Qureshi, Wael Rashwan

机构 * Technological University Dublin(都柏林理工大学) National University of Sciences and Technology(国家科技大学) Maynooth University(梅努斯大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对多语言仇恨言论检测的不透明问题,提出训练时可解释性框架,对齐模型推理与人类理由,经HateXplain、BullySent数据集及多方法评估,可提升分类性能与解释质量,助力多语言文化敏感的内容审核。

Comments Accepted at NeurIPS Workshops 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27036 2026-08-28 cs.CL 新提交 79%

Reasoning about In-Context Samples for Machine-Translation

针对机器翻译的上下文示例推理

Maxime Bouthors, Josep Crego, François Yvon

机构 * SYSTRAN by ChapsVision Sorbonne Université(索邦大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究提出基于片段的推理框架,结合Qwen3模型家族在6种语言(每语言最多5领域)的实验,验证其机器翻译性能优于标准k-shot等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18325 2026-08-28 cs.LG stat.ML 版本更新 70%

Learning to Reason with Curriculum I: Provable Benefits of Autocurriculum

学习与课程学习:自课程学习的可证明收益

Nived Rajaraman, Audrey Huang, Miro Dudik, Robert Schapire, Dylan J. Foster, Akshay Krishnamurthy

机构 * Microsoft Research(微软研究院)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 本文研究了自课程学习在提升语言模型推理能力方面的有效性,通过自适应数据选择技术,在监督微调和强化学习中分别减少了训练数据和计算成本。

Comments 39 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21599 2026-08-28 cs.IR cs.AI cs.LG 版本更新 62%

Refine-POI: Reinforcement Fine-Tuned Large Language Models for Next Point-of-Interest Recommendation

Refine-POI: 通过强化微调优化大型语言模型用于下一步兴趣点推荐

Peibo Li, Shuang Ao, Hao Xue, Yang Song, Maarten de Rijke, Johan Barthélemy, Tomasz Bednarz, Flora D. Salim

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Refine-POI通过拓扑感知ID生成和强化微调,解决LLMs在POI推荐中的语义连续性和top-k推荐问题,提升推荐准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26949 2026-08-28 cs.AI 新提交 57%

A Table Is Worth 64 Tokens: Pixel-level Compression for Multi-Table Document Question Answering

一张表格值64个Token:面向多表格文档问答的像素级压缩

Iñigo Alonso, Mirella Lapata

机构 * School of Informatics(信息学院) University of Edinburgh(爱丁堡大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文针对多表格文档问答提出无需训练的两步像素级表格压缩方法,在长文档上节省41%总Token,比高效单步压缩配置少用15%Token且无准确率损失,还较原生分辨率单步问答提升7个百分点准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26641 2026-08-28 cs.CL 新提交 57%

Information-Guided Frontier Decoding: Contextual Utility-Driven Commitment in dMLLMs

信息引导的前沿解码:扩散多模态语言模型(dMLLMs)中上下文效用驱动的提交

Xingyou Fang, Jingxing Zhong, Xiaosong Yuan, Xiaofeng Zhang

机构 * Fuzhou University(福州大学) Jilin University(吉林大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 针对扩散多模态语言模型解码时结构令牌过早提交削弱上下文传播的问题,提出无需训练的信息引导前沿解码策略,通过多维度排序优化候选选择,在多类基准上实现了优于现有方法的性能。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15439 2026-08-28 cs.AI 版本更新 57%

Do Coding Agents Need Executable World Models, Simplification, and Verification to Solve ARC-AGI-3?

解决ARC-AGI-3编码智能体是否需要可执行世界模型、简化和验证?

Sergey Rodionov

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨解决ARC-AGI-3时编码智能体是否需可执行世界模型、简化和验证。通过四个基于Codex的嵌套智能体评估,发现各变体随模型和推理强度改进,组件影响因设置而异,完整验证处理最佳,文本变体在部分设置中表现出色。

Comments 45 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04562 2026-08-28 cs.AI cs.NE 版本更新 57%

Heaviside Continuity of Rolling Coefficients for Eliminating Epistemic Entropy in Large Language Models

用于消除大语言模型认知熵的滚动系数的海维赛德连续性

MY Pitsane, Hope Mogale

机构 * North-West University, RSA(南非北开普大学) University of Pretoria, RSA(南非彼得里亚大学) Mankind Research Labs, Sandton(沙顿人类研究实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究大语言模型输出难检测错误的问题,提出海维赛德连续性的滚动系数框架,将推理重新表述为谓词门控状态转换,结合模型置信度与并行验证信号,防止无效状态传播,降低认知熵。

Comments Major revisions are going to be implemented and the paper will be restored later

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14586 2026-08-28 cs.IR cs.AI 版本更新 57%

CPGRec+: A Balance-oriented Framework for Personalized Video Game Recommendations

CPGRec+: 一种面向个性化视频游戏推荐的平衡框架

Xiping Li, Aier Yang, Jianghong Ma, Kangzhe Liu, Shanshan Feng, Haijun Zhang, Yi Zhao

机构 * Harbin Institute of Technology(哈尔滨工业大学) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出CPGRec+框架,通过引入偏好引导边加权和表示生成模块,解决传统推荐系统在准确率与多样性间的平衡问题,实验表明其在Steam数据集上表现更优。

Comments Published in ACM Transactions on Information Systems (TOIS). 43 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09215 2026-08-28 cs.CL eess.AS 版本更新 57%

SPAR-K: Scheduled Periodic Alternating Early Exit for Spoken Language Models

SPAR-K:调度周期性交替早退用于语音语言模型

Hsiao-Ying Huang, Cheng-Han Chiang, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 SPAR-K通过调度周期性交替早退机制,提升语音语言模型的推理效率,同时保持感知质量,减少解码深度并优化性能。

Comments 8 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10002 2026-08-28 cs.AI 版本更新 57%

Interaction Protocol Shapes Moral Judgment in Multi-Agent Debate

辩论动态与价值对齐在大语言模型辩论中

Pratik S. Sachdeva, Tom van Nuenen

机构 * D-Lab University of California, Berkeley(D-Lab 加州大学伯克利分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究通过LLM辩论探讨多轮设置中模型的辩论动态与价值对齐,发现不同模型在同步和轮转结构下的行为差异及价值倾向。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22893 2026-08-28 cs.HC cs.AI 版本更新 57%

Toward a New Science of AI as Cognitive Infrastructure

迈向作为认知基础设施的人工智能新科学

Giuseppe Riva

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出跨学科领域认知基础设施研究(CIS),将AI视为认知基础设施,通过创新方法论研究其对人类认知、公共推理等的潜意识影响,填补多学科缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26715 2026-08-28 cs.HC 新提交 50%

RegulAR: Graph-Grounded Error Recognition and Assistance for Procedural Tasks in AR

RegulAR:面向增强现实中流程任务的基于图的错误识别与辅助

Yi-Lin Ye, Jindu Wang, Hiu Tung Wong, Shuchang Xu, Huamin Qu, Wong Kam-Kwai

专题命中 其他推理 :reasoning(abstract)

AI总结 RegulAR是一款结合分层依赖图与MLLM的AR任务助手,可识别流程任务错误并提供恢复指导,在被试内研究中被证实比仅用MLLM的基线系统更能帮助用户理解任务结构与恢复任务。

Comments 16 pages, 7 figures. Accepted to UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26316 2026-08-28 cs.SE 新提交 50%

When Review Alone No Longer Scales: Layered Supervision in AI-Assisted Software Engineering

当仅靠代码审查不再能扩展时:AI辅助软件工程中的分层监督

Markus Stolze, Mirco Strässle

专题命中 其他推理 :reasoning(abstract)

AI总结 该研究针对AI辅助软件工程中审查护栏无法应对高吞吐量代码生成的问题,提出将监督工作分配至预防性、可执行护栏及人工监督的分层监督模式,实现监督负荷的分散。

Comments Accepted for publication at the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026), Software Engineering in Practice (SEIP) Track, this https URL (https://conf.researchr.org/track/eseiw-2026/eseiw-2026-esem---seip-track). 13 pages, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17316 2026-08-28 cs.IR 版本更新 50%

Empowering Compact LLMs with Fusion of Layer-wise Exits for Recommendation

融合分层出口的紧凑型大语言模型推荐系统

Xurong Liang, Tong Chen, Quoc Viet Hung Nguyen, Jianxin Li, Xiangliang Zhang, Hongzhi Yin

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出FLEXRec框架,通过在紧凑型LLM的Transformer层插入预测头并自适应融合,结合AC-Router与目标k铰链损失,在三个数据集上以Qwen 3 1.7B和Llama 3.2 3B实现紧凑型主干方法中最优准确率且效率高。

Comments Accepted by ICDM'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02475 2026-08-28 cs.SE 版本更新 50%

Lost in Code Generation: Reimagining the Role of Software Models in AI-driven Software Engineering

在代码生成中迷失:重新构想软件模型在AI驱动软件工程中的作用

Jürgen Cito, Dominik Bork

专题命中 其他推理 :reasoning(abstract)

AI总结 该研究针对AI生成软件存在的缺陷,提出从AI生成系统中恢复软件模型,区分智能体与人类反思循环,将软件模型作为连接现有软件工程与AI驱动开发的桥梁,拓展了软件模型的作用。

Comments New version accepted at MODELS'26

详情

展开后加载摘要…

URL PDF HTML 收藏