arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-16 至 2025-12-16 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 9 篇

2512.12777 2025-12-16 cs.CL cs.AI 81%

State over Tokens: Characterizing the Role of Reasoning Tokens

令牌上的状态:阐明推理令牌的作用

Mosh Levy, Zohar Elyoseph, Shauli Ravfogel, Yoav Goldberg

机构 * Bar-Ilan University(巴伊兰大学) University of Haifa(海法大学) New York University(纽约大学) Allen Institute for AI(人工智能研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SoT框架,将LLM的推理令牌视为外部化计算状态,而非文本叙述,以揭示其实际推理机制及未被关注的研究问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12008 2025-12-16 cs.CL cs.AI cs.PF 81%

Hold Onto That Thought: Assessing KV Cache Compression On Reasoning

Hold Onto That Thought: 评估KV缓存压缩在推理中的表现

Minghui Liu, Aadi Palnitkar, Tahseen Rabbani, Hyunwoo Jae, Kyle Rui Sang, Dixi Yao, Shayan Shabihi, Fuheng Zhao, Tian Li, Ce Zhang, Furong Huang, Kunpeng Zhang

机构 * University of Maryland(马里兰大学) University of Chicago(芝加哥大学) University of Utah(犹他大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了多种KV缓存压缩策略在长推理任务中的表现,发现H2O和改进的SnapKV在推理模型中表现优异,揭示了重 hitter 跟踪的有效性及缓存大小与推理成本的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08768 2025-12-16 cs.CL 79%

AraReasoner: Evaluating Reasoning-Based LLMs for Arabic NLP

AraReasoner: 评估基于推理的LLM在阿拉伯语NLP中的表现

Ahmed Hasanaath, Aisha Alansari, Ahmed Ashraf, Chafik Salmane, Hamzah Luqman, Saad Ezzini

机构 * King Fahd University of Petroleum and Minerals(国王法赫德石油和矿物大学) SDAIA–KFUPM Joint Research Center for Artificial Intelligence(SDAIA-KFUPM人工智能联合研究中心) Mohammed VI Polytechnic University(穆莱·易卜拉欣(polytechnic)大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 AraReasoner评估基于推理的LLM在阿拉伯语NLP中的表现,发现通过精心选择示例可显著提升分类任务性能,DeepSeek在复杂推理任务中表现优于GPT基线,LoRA微调进一步提升F1和BLEU分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12818 2025-12-16 cs.CL cs.AI cs.IR cs.LG 67%

Hindsight is 20/20: Building Agent Memory that Retains, Recalls, and Reflects

事后诸葛亮:构建具有保留、回忆和反思能力的智能体记忆

Chris Latimer, Nicoló Boschi, Andrew Neeser, Chris Bartholomew, Gaurav Srivastava, Xuan Wang, Naren Ramakrishnan

机构 * The Washington Post(华盛顿邮报) Virginia Tech(弗吉尼亚理工大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Hindsight通过结构化内存架构提升智能体在长对话中的记忆与推理能力,显著提高多会话和开放领域问题的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23661 2025-12-16 cs.CV 67%

LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training

LLaVA-OneVision-1.5:面向民主化多模态训练的完全开放框架

Xiang An, Yin Xie, Kaicheng Yang, Wenkang Zhang, Xiuwei Zhao, Zheng Cheng, Yirui Wang, Songcen Xu, Changrui Chen, Didi Zhu, Chunsheng Wu, Huajie Tan, Chunyuan Li, Jing Yang, Jie Yu, Xiyao Wang, Bin Qin, Yumeng Wang, Zizhen Yan, Ziyong Feng, Ziwei Liu, Bo Li, Jiankang Deng

机构 * LLaVA-OneVision Community Contributors(LLaVA-OneVision社区贡献者)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract)

AI总结 LLaVA-OneVision-1.5通过开放框架和高效训练方法实现了多模态模型的低成本高性能训练。

Comments LLaVA-OneVision-1.5 Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23188 2025-12-16 cs.CL 57%

Diagnose, Localize, Align: A Full-Stack Framework for Reliable LLM Multi-Agent Systems under Instruction Conflicts

诊断、定位、对齐:一种用于在指令冲突下可靠LLM多智能体系统的全栈框架

Guancheng Wan, Leixin Sun, Longxu Dou, Zitong Shi, Fang Wu, Eric Hanchen Jiang, Wenke Huang, Guibin Zhang, Hejia Geng, Xiangru Tang, Zhenfei Yin, Yizhou Sun, Wei Wang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Sea AI Lab(Sea AI 实验室) Stanford University(斯坦福大学) University of Oxford(牛津大学) Yale University(耶鲁大学) NTU(南洋理工大学) NUS(新加坡国立大学) Boston University(波士顿大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种全栈框架,通过诊断、定位和对齐三个阶段提升LLM多智能体系统在指令冲突下的可靠性。

Comments Upon further review, we realized that the version submitted to arXiv was not the final draft and omits crucial results and discussion. To avoid confusion and ensure the integrity of the record, we request withdrawal and will resubmit once the complete work is ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14029 2025-12-16 cs.CL 57%

Beyond Pass@1: Self-Play with Variational Problem Synthesis Sustains RLVR

超越Pass@1:基于变分问题合成的自我博弈维持RLVR

Xiao Liang, Zhongzhi Li, Yeyun Gong, Yelong Shen, Ying Nian Wu, Zhijiang Guo, Weizhu Chen

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出基于变分问题合成的自我博弈策略,有效维持RLVR训练中的策略熵,显著提升Pass@k性能,在多个基准测试中取得绝对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12957 2025-12-16 cs.DB cs.LO 50%

Database Research needs an Abstract Relational Query Language

数据库研究需要一种抽象关系查询语言

Wolfgang Gatterbauer, Diandre Miguel Sabale

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出了一种抽象关系查询语言(ARQL),旨在通过分离查询意图与语法,提供统一的语义框架,以支持机器生成查询与人类验证调试的交互需求。

Comments CIDR 2026. 16th Annual Conference on Innovative Data Systems Research (CIDR '26). January 18-21, 2026, Chaminade, USA. 16 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12707 2025-12-16 cs.CY 50%

From Linear Risk to Emergent Harm: Complexity as the Missing Core of AI Governance

从线性风险到涌现危害:复杂性作为AI治理的缺失核心

Hugo Roger Paz

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出基于复杂性的AI治理框架,强调通过动态系统映射和因果推理应对AI治理中的不确定性与涌现危害。

Comments White Paper / Policy Brief (Working Paper). Published version available at: https://doi.org/10.5281/zenodo.17929014

详情

展开后加载摘要…

URL PDF HTML 收藏