arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2025-12-03 至 2025-12-03 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 8 篇

2504.21370 2025-12-03 cs.AI 85%

ShorterBetter: Guiding Reasoning Models to Find Optimal Inference Length for Efficient Reasoning

ShorterBetter: 引导推理模型寻找最优推理长度以实现高效推理

Jingyang Yi, Jiazheng Wang, Sida Li

机构 * Data Science Institute, The University of Chicago(芝加哥大学数据科学研究所)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 ShorterBetter通过强化学习引导推理模型自主学习最优推理长度,提升推理效率并减少输出长度。

Comments updated project website

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02185 2025-12-03 cs.CL cs.AI cs.LG 85%

Think Before You Prune: Self-Reflective Structured Pruning for Reasoning Language Models

在行动前剪枝:面向推理语言模型的自反思结构剪枝

Ziyan Wang, Enmao Diao, Qi Le, Pu Wang, Guanchu Wang, Minwoo Lee, Shu-ping Yeh, Li Yang

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) University of Minnesota(明尼苏达大学) Intel Corporation(英特尔公司)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RESP通过自反思结构化剪枝框架,在保持推理连贯性的同时显著提升稀疏度下的性能

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02389 2025-12-03 cs.AI cs.LG 84%

Synthetic Error Injection Fails to Elicit Self-Correction In Language Models

合成错误注入无法在语言模型中引发自我修正

David X. Wu, Shreyas Kapur, Anant Sahai, Stuart Russell

机构 * ucb(伯克利大学)

专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究发现合成错误注入无法有效提升语言模型的自我修正能力,揭示了策略性强化学习在激发自我修正方面的独特优势。

Comments 13 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02835 2025-12-03 cs.CV cs.AI cs.CL 81%

ReVSeg: Incentivizing the Reasoning Chain for Video Segmentation with Reinforcement Learning

ReVSeg:通过强化学习激励视频分割的推理链

Yifan Li, Yingda Yin, Lingting Zhu, Weikai Chen, Shengju Qian, Xin Wang, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) LIGHTSPEED

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 ReVSeg通过强化学习优化视频分割的多步推理链,实现可解释的推理轨迹和先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06192 2025-12-03 cs.DB cs.AI cs.CL cs.LG 67%

SQLBarber: A System Leveraging Large Language Models to Generate Customized and Realistic SQL Workloads

SQLBarber: 借助大型语言模型生成定制化和真实SQL工作负载的系统

Jiale Lao, Immanuel Trummer

机构 * Cornell University(康奈尔大学)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SQLBarber利用大型语言模型生成定制化且真实的SQL工作负载,通过声明式接口和贝叶斯优化器高效生成符合目标成本分布的查询。

Comments Accepted by SIGMOD 2026; extended version with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02720 2025-12-03 cs.AI cs.LG 62%

StockMem: An Event-Reflection Memory Framework for Stock Forecasting

StockMem: 一种用于股票预测的事件反射内存框架

He Wang, Wenyilin Xiao, Songqiao Han, Hailiang Huang

机构 * Shanghai University of Finance and Economics(上海金融学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 StockMem通过事件反射双层内存框架,有效整合事件信息与价格动态,提升股票预测的可解释性和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02228 2025-12-03 cs.AI cs.LG 62%

STRIDE: A Systematic Framework for Selecting AI Modalities -- Agentic AI, AI Assistants, or LLM Calls

STRIDE:一种选择AI模态的系统框架——代理AI、AI助手或LLM调用

Shubhi Asthana, Bing Zhang, Chad DeLuca, Ruchi Mahindru, Hima Patel

机构 * IBM Research – Almaden(IBM阿尔马登研究实验室) IBM Research – Yorktown(IBM约克镇研究实验室) IBM Research – India(IBM印度研究实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 STRIDE提供了一种系统框架,帮助选择AI模态,通过评估任务动态性决定是否使用自主代理,提升效率并降低成本。

Comments 10 pages, 4 Figures, 5 Tables Paper presented at NeurIPS 2025 LAW workshop: Bridging Language, Agent, and World Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22307 2025-12-03 cs.AI cs.LG 62%

Enhanced Conditional Generation of Double Perovskite by Knowledge-Guided Language Model Feedback

通过知识引导语言模型反馈增强双钙钛矿的条件生成

Inhyo Lee, Junhyeong Lee, Jongwon Park, KyungTae Lim, Seunghwa Ryu

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出了一种多智能体框架,通过知识引导的文本梯度提升双钙钛矿生成的稳定性与有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏