arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-02 至 2026-03-02 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 逻辑推理 8 篇

2601.11556 2026-03-02 cs.LG cs.AI cs.CL cs.SD eess.AS 82%

CSyMR: Benchmarking Compositional Music Information Retrieval in Symbolic Music Reasoning

CSyMR:在符号音乐推理中进行组合音乐信息检索的基准测试

Boyang Wang, Yash Vishe, Xin Xu, Zachary Novack, Xunyi Jiang, Julian McAuley, Junda Wu

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CSyMR-Bench通过工具增强的检索和推理框架,在符号音乐推理中实现组合音乐信息检索的准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23810 2026-03-02 cs.CY cs.LG 79%

ReasonX: Declarative Reasoning on Explanations

ReasonX: 基于表达式的声明性推理

Laura State, Salvatore Ruggieri, Franco Turini

机构 * University of Pisa(比萨大学) Scuola Normale Superiore(正常大学) Alexander von Humboldt Institute for Internet and Society(亚历山大·冯·洪堡互联网与社会研究所)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.LG

AI总结 ReasonX是一种基于线性约束理论的声明性解释工具,通过混合整数线性规划实现对决策树的多层抽象推理,提供交互式解释并优于现有XAI方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22465 2026-03-02 cs.AI 79%

ConstraintBench: Benchmarking LLM Constraint Reasoning on Direct Optimization

ConstraintBench: 对直接优化的LLM约束推理进行基准测试

Joseph Tso, Preston Schmittou, Quan Huynh, Jibran Hutchins

机构 * Haladir Research Team(Haladir研究团队)

专题命中 逻辑推理 :reasoning(title);verifier(abstract);分类 cs.AI

AI总结 ConstraintBench评估LLM在约束优化任务中的直接推理能力,发现可行性是主要瓶颈,最佳模型仅达65%可行性,但可行解接近最优解。

Comments Preprint. 10 pages, 1 figure, 6 tables. Benchmark and evaluation code will be publicly released

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23730 2026-03-02 cs.AI 70%

Unlocking Cognitive Capabilities and Analyzing the Perception-Logic Trade-off

解锁认知能力并分析感知-逻辑权衡

Longyin Zhang, Shuo Sun, Yingxu He, Won Cheng Yi Lewis, Muhammad Huzaifah Bin Md Shahrin, Hardik Bhupendra Sailor, Heng Meng Jeremy Wong, Tarun Kumar Vangani, Yi Ma, Qiongqiong Wang, Minh Duc Pham, Ridong Jiang, Jingtao Li, Jingyi Liao, Zhuohan Liu, Yanfeng Lu, Manas Gupta, Ai Ti Aw

机构 * Institute for Infocomm Research (I 2 R), A*STAR, Singapore(信息与通信研究 institute(I 2 R),A*STAR,新加坡)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 MERaLiON2-Omni(Alpha)通过解耦感知与推理能力,针对东南亚地区提出多语言全方位感知模型,揭示感知与逻辑之间的效率-稳定性权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14069 2026-03-02 cs.CL 57%

Open Rubric System: Scaling Reinforcement Learning with Pairwise Adaptive Rubric

开放评分系统:通过成对自适应评分表扩展强化学习

Ruipeng Jia, Yunyi Yang, Yuxin Wu, Yongbo Gai, Siyuan Tao, Mengyu Zhou, Jianhe Lin, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴文勤大模型应用团队) Beijing University Of Posts and Telecommunications(北京邮电大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL

AI总结 开放评分系统通过成对自适应评分表和可验证评分表实现强化学习的稳健对齐,提升开放性任务的辨别力和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24275 2026-03-02 cs.CV 50%

Hierarchical Action Learning for Weakly-Supervised Action Segmentation

分层动作学习用于弱监督动作分割

Junxian Huang, Ruichu Cai, Hao Zhu, Juntao Fang, Boyan Xu, Weilin Chen, Zijian Li, Shenghua Gao

机构 * Guangdong University of Technology(广东技术大学) Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Hong Kong(香港大学)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 HAL模型通过分层因果数据生成和稀疏转换约束,提升弱监督动作分割的识别能力。

Journal ref CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21778 2026-03-02 cs.CV 50%

From Statics to Dynamics: Physics-Aware Image Editing with Latent Transition Priors

从静态到动态:基于物理的图像编辑与潜在过渡先验

Liangbing Zhao, Le Zhuo, Sayak Paul, Hongsheng Li, Mohamed Elhoseiny

机构 * CUHK MMLab(香港中文大学多模态实验室)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出PhysicEdit,通过引入物理状态过渡和大规模数据集,提升图像编辑的物理真实性和知识引导能力,达到开源方法的新水平。

Comments All code, checkpoints, and datasets are available at https://liangbingzhao.github.io/statics2dynamics/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23553 2026-03-02 cs.CV 50%

LE-NeuS: Latency-Efficient Neuro-Symbolic Video Understanding via Adaptive Temporal Verification

LE-NeuS: 通过自适应时间验证实现低延迟的神经符号视频理解

Shawn Liang, Sahil Shah, Chengwei Zhou, SP Sharan, Harsh Goel, Arnab Sanyal, Sandeep Chinchali, Gourav Datta

机构 * Case Western Reserve University(凯斯西储大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 逻辑推理 :reasoning(abstract)

AI总结 LE-NeuS通过自适应时间验证优化,实现低延迟的神经符号视频理解,在保持高准确率的同时大幅减少推理延迟。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏