arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 19038 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 19038 篇

2603.02091 2026-03-03 cs.LG cs.AI cs.CL 80%

Learning from Synthetic Data Improves Multi-hop Reasoning

通过合成数据学习提升多跳推理能力

Anmol Kabra, Yilun Yin, Albert Gong, Kamilė Stankevičiūtė, Dongyoung Go, Johann Lee, Katie Z. Luo, Carla P. Gomes, Kilian Q. Weinberger

机构 * Cornell University(康奈尔大学) University of Cambridge(剑桥大学) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过规则生成的合成数据提升LLM多跳推理能力,发现合成数据能有效训练模型组成知识,从而在现实问答任务中表现更优。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07484 2026-03-03 cs.IR 80%

Reasoning by Exploration: A Unified Approach to Retrieval and Generation over Graphs

通过探索进行推理:一种统一的图检索与生成方法

Haoyu Han, Kai Guo, Harry Shomer, Yu Wang, Yucheng Chu, Hang Li, Li Ma, Jiliang Tang

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 RoE通过统一检索与生成过程,利用图探索机制提升大型语言模型在结构化图推理中的性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11556 2026-03-02 cs.LG cs.AI cs.CL cs.SD eess.AS 80%

CSyMR: Benchmarking Compositional Music Information Retrieval in Symbolic Music Reasoning

CSyMR:在符号音乐推理中进行组合音乐信息检索的基准测试

Boyang Wang, Yash Vishe, Xin Xu, Zachary Novack, Xunyi Jiang, Julian McAuley, Junda Wu

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CSyMR-Bench通过工具增强的检索和推理框架,在符号音乐推理中实现组合音乐信息检索的准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25992 2026-03-02 cs.CL cs.AI cs.LG 80%

Supervised Reinforcement Learning: From Expert Trajectories to Step-wise Reasoning

监督强化学习:从专家轨迹到逐步推理

Yihe Deng, I-Hung Hsu, Jun Yan, Zifeng Wang, Rujun Han, Gufeng Zhang, Yanfei Chen, Wei Wang, Tomas Pfister, Chen-Yu Lee

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SRL框架,通过生成逻辑动作序列提升小模型的多步推理能力,结合监督与强化学习实现更有效的训练。

Comments Paper accepted by ICLR 2026. The first two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19514 2026-02-26 cs.IR 80%

SCoTER: Structured Chain-of-Thought Transfer for Enhanced Recommendation

SCoTER: 结构化推理链转移以提升推荐

Jie Jiang, Yang Wu, Qian Li, Yuling Xiong, Hongbo Tang, Xun Liu, Haoze Wang, Jun Zhang, Huan Yu, Hailong Shi

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 SCoTER通过结构化推理链转移提升推荐系统,解决推理模式发现和结构保持问题,实现推荐效果和成本的双重优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23115 2026-02-25 cs.LG cs.AI cs.CL 80%

RHYTHM: Reasoning with Hierarchical Temporal Tokenization for Human Mobility

RHYTHM:基于层次时间标记的人类移动推理

Haoyu He, Haozheng Luo, Yan Chen, Qi R. Wang

机构 * Northeastern University(东北大学) Northwestern University(西北大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RHYTHM通过层次时间标记框架提升人类移动预测的准确性和效率,实现更高效的时空推理与预测。

Comments Advances in Neural Information Processing Systems 39 (NeurIPS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11409 2026-02-23 cs.LG cs.AI cs.CL cs.CV 80%

Visual Planning: Let's Think Only with Images

视觉规划:只用图像来思考

Yi Xu, Chengzu Li, Han Zhou, Xingchen Wan, Caiqi Zhang, Anna Korhonen, Ivan Vulić

机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) Google(谷歌公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出视觉规划范式,通过图像进行推理,优于纯文本推理,在视觉导航任务中表现更优。

Comments ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13419 2026-02-17 q-bio.QM cs.AI cs.CL cs.LG q-bio.BM 80%

Protect$^*$: Steerable Retrosynthesis through Neuro-Symbolic State Encoding

Protect$^*$: 通过神经符号状态编码实现可操控的逆合成

Shreyas Vinaya Sathyanarayana, Shah Rahil Kirankumar, Sharanabasava D. Hiremath, Bharath Ramsundar

机构 * Deep Forest Sciences(深林科技) Departament de Farmacologia, Toxicologia i Química Terapèutica, Universitat de Barcelona(巴塞罗那大学药理学、毒理学与治疗化学系) Institut de Nanociència i Nanotecnologia IN2UB, Universitat de Barcelona(巴塞罗那大学纳米科学与纳米技术研究所)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Protect$^*$通过神经符号状态编码实现逆合成的可控生成,结合规则推理与神经模型,提升化学合成路径的可靠性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11176 2026-02-13 cs.CL cs.AI cs.CE cs.LG 80%

Evaluating Few-Shot Temporal Reasoning of LLMs for Human Activity Prediction in Smart Environments

评估LLM在智能环境中的少样本时间推理用于人类活动预测

Maral Doctorarastoo, Katherine A. Flanigan, Mario Bergés, Christopher McComb

机构 * organization= Department of Civil \& Environmental Engineering, Carnegie Mellon University , addressline= 5000 Forbes Ave , city= Pittsburgh , state= PA , postcode= 15213 , country= USA organization= Department of Mechanical Engineering, Carnegie Mellon University , addressline= 5000 Forbes Ave , city= Pittsburgh , state= PA , postcode= 15213 , country= USA

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了预训练语言模型在智能环境中的少样本时间推理能力,通过评估其在人类活动预测中的表现,发现其在低数据环境下具备强大的时间理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20295 2026-02-06 cs.CL cs.AI cs.LG stat.ML 80%

SelfReflect: Can LLMs Communicate Their Internal Answer Distribution?

SelfReflect: LLMs能否传达其内部答案分布?

Michael Kirchhof, Luca Füger, Adam Goliński, Eeshan Gunesh Dhekane, Arno Blaas, Seong Joon Oh, Sinead Williamson

机构 * Apple(苹果公司) Independent Researcher(独立研究者) Tübingen AI Center(图宾根人工智能中心)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SelfReflect通过评估LLM内部信念分布与总结之间的信息论距离,发现现代LLM无法有效传达其不确定性,但通过多输出采样可生成忠实的不确定性总结。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21436 2026-02-05 cs.LG cs.AI cs.CL cs.CV 80%

From Consistency to Complementarity: Aligned and Disentangled Multi-modal Learning for Time Series Understanding and Reasoning

从一致性到互补性:面向时间序列理解和推理的对齐与解缠多模态学习

Hang Ni, Weijia Zhang, Fei Wang, Zezhi Shao, Hao Liu

机构 * The Hong Kong University of Science(香港科学与技术大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MADI通过细粒度对齐和解缠交互提升多模态时间序列理解和推理能力,实现更精确的数值-视觉模态整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00504 2026-02-03 cs.CV 80%

RGBX-R1: Visual Modality Chain-of-Thought Guided Reinforcement Learning for Multimodal Grounding

RGBX-R1: 多视觉模态链式推理引导的多模态接地强化学习

Jiahe Wu, Bing Cao, Qilong Wang, Qinghua Hu, Dongdong Li, Pengfei Zhu

机构 * School of Artificial Intelligence, Tianjin University(天津大学人工智能学院) Low-Altitude Intelligence Lab, Xiong’an National Innovation Center(雄安国家创新中心低空智能实验室) Xiong’an Guochuang Lantian Technology Co., Ltd.(雄安国创莲田科技有限公司) College of Electronic Science and Technology, National University of Defense Technology(国防科技大学电子科学学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);prompting(abstract)

AI总结 RGBX-R1通过视觉模态链式推理引导的强化学习提升多模态接地能力,首次构建RGBX-接地基准并在多个任务中取得显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01945 2026-02-03 cs.LG cs.AI cs.CL 80%

Agentic Policy Optimization via Instruction-Policy Co-Evolution

通过指令-策略共演进行代理策略优化

Han Zhou, Xingchen Wan, Ivan Vulić, Anna Korhonen

机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) Machine Learning Research Group, University of Oxford(牛津大学机器学习研究组)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 INSPO通过指令与策略的共演机制,动态优化指令以提升代理在多轮检索和推理任务中的性能,显著优于静态指令基线。

Comments 8 pages, 4 figures, 1 table (17 pages including references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22628 2026-02-02 cs.LG cs.AI cs.CL 80%

TTCS: Test-Time Curriculum Synthesis for Self-Evolving

TTCS: 测试时课程合成用于自演化

Chengyi Yang, Zhishang Xiang, Yunbo Tang, Zongpei Teng, Chengsong Huang, Fei Long, Yuhan Liu, Jinsong Su

机构 * Xiamen University(厦门大学) Washington University in St. Louis(华盛顿大学圣路易斯分校) Renmin University of China(中国人民大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TTCS通过共进化框架提升LLM推理能力,利用生成器和求解器的协同进化,动态构建测试时课程以增强模型性能。

Comments 10 pages, 4 figures, Our code and implementation details are available at https://github.com/XMUDeepLIT/TTCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21634 2026-01-30 cs.CV 80%

RSGround-R1: Rethinking Remote Sensing Visual Grounding through Spatial Reasoning

RSGround-R1: 重新思考通过空间推理的遥感视觉定位

Shiqi Huang, Shuting He, Bihan Wen

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(电气电子工程学院,南洋理工大学) MoE Key Laboratory of Interdisciplinary Research of Computation and Economics, Shanghai University of Finance and Economics(教育部计算与经济交叉学科重点实验室,上海财经大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);SFT(abstract)

AI总结 RSGround-R1通过引入空间推理引导的后训练框架,提升遥感图像中目标物体的定位精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17498 2026-01-28 cs.LG cs.AI cs.CL 80%

Improving Value-based Process Verifier via Structural Prior Injection

通过结构先验注入改进基于价值的过程验证器

Zetian Sun, Dongfang Li, Baotian Hu, Jun Yu, Min Zhang

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过注入结构先验改进基于价值的过程验证器,提升其性能并减少误差。

Comments This version is deprecated. Please refer to our new version: arXiv:2508.10539

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05516 2026-01-22 cs.LG cs.AI cs.CL 80%

BayesAgent: Bayesian Agentic Reasoning Under Uncertainty via Verbalized Probabilistic Graphical Modeling

BayesAgent: 通过 verbalized 概率图模型实现不确定性下的贝叶斯代理推理

Hengguan Huang, Xing Shen, Songtao Wang, Lingfa Meng, Dianbo Liu, David Alejandro Duchene, Hao Wang, Samir Bhatt

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BayesAgent 通过 verbalized 概率图模型实现不确定性下的贝叶斯代理推理,提升置信度校准和文本生成质量。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24574 2026-01-21 cs.CL cs.AI cs.LG 80%

Understanding and Steering the Cognitive Behaviors of Reasoning Models at Test-Time

在测试时理解并引导推理模型的认知行为

Zhenyu Zhang, Xiaoxia Wu, Zhongzhu Zhou, Qingyang Wu, Yineng Zhang, Pragaash Ponnusamy, Harikaran Subbaraj, Jue Wang, Shuaiwen Leon Song, Ben Athiwaratkun

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Together AI University of Sydney(悉尼大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CREST通过引导推理模型的认知行为,提高推理准确性和效率,减少计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12766 2026-01-21 cs.CV cs.SY eess.SY 80%

Spatial-VLN: Zero-Shot Vision-and-Language Navigation With Explicit Spatial Perception and Exploration

空间视觉导航:具有显式空间感知和探索的零样本视觉-语言导航

Lu Yue, Yue Fan, Shiwei Lian, Yu Zhao, Jiaxin Yu, Liang Xie, Feitian Zhang

机构 * Robotics and Control Laboratory, School of Advanced Manufacturing and Robotics, and the State Key Laboratory of Turbulence and Complex Systems, Peking University(机器人与控制实验室、先进制造与机器人学院,以及湍流与复杂系统国家重点实验室,北京大学) Defense Innovation Institute, Academy of Military Sciences, Beijing(国防科技创新研究院,军事科学院,北京) Tianjin Artificial Intelligence Innovation Center, Tianjin(天津人工智能创新中心,天津) Institute of Computing and Intelligence, Harbin Institute of Technology (Shenzhen)(计算与智能学院,哈尔滨工业大学(深圳))

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 Spatial-VLN通过增强空间感知和探索机制,提升零样本视觉-语言导航在复杂环境中的泛化与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12948 2026-01-06 cs.CL cs.AI cs.LG 80%

DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

DeepSeek-R1: 通过强化学习激励大语言模型的推理能力

DeepSeek-AI, Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Peiyi Wang, Qihao Zhu, Runxin Xu, Ruoyu Zhang, Shirong Ma, Xiao Bi, Xiaokang Zhang, Xingkai Yu, Yu Wu, Z. F. Wu, Zhibin Gou, Zhihong Shao, Zhuoshu Li, Ziyi Gao, Aixin Liu, Bing Xue, Bingxuan Wang, Bochao Wu, Bei Feng, Chengda Lu, Chenggang Zhao, Chengqi Deng, Chenyu Zhang, Chong Ruan, Damai Dai, Deli Chen, Dongjie Ji, Erhang Li, Fangyun Lin, Fucong Dai, Fuli Luo, Guangbo Hao, Guanting Chen, Guowei Li, H. Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Qu, Hui Li, Jianzhong Guo, Jiashi Li, Jiawei Wang, Jingchang Chen, Jingyang Yuan, Junjie Qiu, Junlong Li, J. L. Cai, Jiaqi Ni, Jian Liang, Jin Chen, Kai Dong, Kai Hu, Kaige Gao, Kang Guan, Kexin Huang, Kuai Yu, Lean Wang, Lecong Zhang, Liang Zhao, Litong Wang, Liyue Zhang, Lei Xu, Leyi Xia, Mingchuan Zhang, Minghua Zhang, Minghui Tang, Meng Li, Miaojun Wang, Mingming Li, Ning Tian, Panpan Huang, Peng Zhang, Qiancheng Wang, Qinyu Chen, Qiushi Du, Ruiqi Ge, Ruisong Zhang, Ruizhe Pan, Runji Wang, R. J. Chen, R. L. Jin, Ruyi Chen, Shanghao Lu, Shangyan Zhou, Shanhuang Chen, Shengfeng Ye, Shiyu Wang, Shuiping Yu, Shunfeng Zhou, Shuting Pan, S. S. Li, Shuang Zhou, Shaoqing Wu, Shengfeng Ye, Tao Yun, Tian Pei, Tianyu Sun, T. Wang, Wangding Zeng, Wanjia Zhao, Wen Liu, Wenfeng Liang, Wenjun Gao, Wenqin Yu, Wentao Zhang, W. L. Xiao, Wei An, Xiaodong Liu, Xiaohan Wang, Xiaokang Chen, Xiaotao Nie, Xin Cheng, Xin Liu, Xin Xie, Xingchao Liu, Xinyu Yang, Xinyuan Li, Xuecheng Su, Xuheng Lin, X. Q. Li, Xiangyue Jin, Xiaojin Shen, Xiaosha Chen, Xiaowen Sun, Xiaoxiang Wang, Xinnan Song, Xinyi Zhou, Xianzu Wang, Xinxia Shan, Y. K. Li, Y. Q. Wang, Y. X. Wei, Yang Zhang, Yanhong Xu, Yao Li, Yao Zhao, Yaofeng Sun, Yaohui Wang, Yi Yu, Yichao Zhang, Yifan Shi, Yiliang Xiong, Ying He, Yishi Piao, Yisong Wang, Yixuan Tan, Yiyang Ma, Yiyuan Liu, Yongqiang Guo, Yuan Ou, Yuduan Wang, Yue Gong, Yuheng Zou, Yujia He, Yunfan Xiong, Yuxiang Luo, Yuxiang You, Yuxuan Liu, Yuyang Zhou, Y. X. Zhu, Yanhong Xu, Yanping Huang, Yaohui Li, Yi Zheng, Yuchen Zhu, Yunxian Ma, Ying Tang, Yukun Zha, Yuting Yan, Z. Z. Ren, Zehui Ren, Zhangli Sha, Zhe Fu, Zhean Xu, Zhenda Xie, Zhengyan Zhang, Zhewen Hao, Zhicheng Ma, Zhigang Yan, Zhiyu Wu, Zihui Gu, Zijia Zhu, Zijun Liu, Zilin Li, Ziwei Xie, Ziyang Song, Zizheng Pan, Zhen Huang, Zhipeng Xu, Zhongyu Zhang, Zhen Zhang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DeepSeek-R1通过强化学习提升大语言模型的推理能力,无需人工标注数据,实现更复杂的推理任务表现。

Journal ref Nature volume 645, pages 633-638 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21855 2025-12-29 cs.AI cs.CL cs.LG cs.MA 80%

SIGN: Schema-Induced Games for Naming

SIGN:基于模式的命名游戏

Ryan Zhang, Herbert Woisetschläger

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SIGN通过引入轻量结构引导惯例形成,提升了多代理协调效率,其在命名游戏中展示了更高的收敛速度和一致性。

Comments AAAI 2026 Student Abstract (Oral). Code available ar https://github.com/ryanzhangofficial/schema-induced-games-for-naming

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21728 2025-12-23 cs.CL cs.AI cs.LG 80%

Affective Multimodal Agents with Proactive Knowledge Grounding for Emotionally Aligned Marketing Dialogue

具有主动知识 grounding 的情感多模态代理用于情感对齐的营销对话

Lin Yu, Xiaofei Han, Yifei Kang, Chiung-Yi Tseng, Danyang Zhang, Ziqian Bi, Zhimo Han

机构 * Hunan Police Academy, Department of Criminal Investigation(湖南警察学院犯罪侦查系) Business College, California State University(加州州立大学长滩分校商学院) Northwestern University(西北大学) AI Agent Lab, Vokram Group(Vokram集团AI代理实验室) Beijing University of Technology(北京理工大学) Zheng Zhou University of Light Industry(郑州轻工业大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AffectMind通过主动知识 grounding 和情绪-意图对齐模型,提升营销对话中的情感一致性与说服效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13704 2025-12-23 cs.CV 80%

TiViBench: Benchmarking Think-in-Video Reasoning for Video Generative Models

TiViBench: 用于视频生成模型的视频推理基准测试

Harold Haodong Chen, Disen Lan, Wen-Jie Shu, Qingyang Liu, Zihan Wang, Sirui Chen, Wenkai Cheng, Kanghao Chen, Hongfei Zhang, Zixin Zhang, Rongjin Guo, Yu Cheng, Ying-Cong Chen

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 TiViBench提出用于评估视频生成模型的推理能力,结合VideoTPO提升推理性能,揭示商业与开源模型在推理潜力上的差异。

Comments Project: https://haroldchen19.github.io/TiViBench-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12794 2025-12-16 eess.SY cs.SY 80%

A Rule-Aware Prompt Framework for Structured Numeric Reasoning in Cyber-Physical Systems

面向物理系统结构化数值推理的规则感知提示框架

Yichen Liu, Hongyu Wu, Bo Liu

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出一种规则感知提示框架,用于在基于物理的系统中实现结构化数值推理,通过模块化设计提升规则遵循性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09616 2025-12-11 cs.CV cs.AI cs.CL cs.LG 80%

Rethinking Chain-of-Thought Reasoning for Videos

重新思考视频中的链式推理

Yiwu Zhong, Zi-Yuan Hu, Yin Li, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出了一种高效的视频推理框架,通过简洁推理和减少的视觉标记提升推理效率和性能,无需依赖传统CoT注释或监督微调。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05318 2025-12-08 cs.CL cs.AI cs.LG 80%

To Think or Not to Think: The Hidden Cost of Meta-Training with Excessive CoT Examples

思考还是不思考:过度使用Co-T示例的元训练隐藏成本

Vignesh Kothapalli, Ata Fatahibaarzi, Hamed Firooz, Maziar Sanjabi

机构 * Stanford University(斯坦福大学) LinkedIn AI

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CoT-Recipe方法,通过调节元训练序列中CoT和非CoT示例的比例,提升大型语言模型在新任务上的推理准确性,实验显示在无CoT示例时准确率可提升300%。

Comments 26 pages, 45 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05105 2025-12-05 cs.CL cs.AI cs.IT cs.LG eess.SP math.IT 80%

Semantic Soft Bootstrapping: Long Context Reasoning in LLMs without Reinforcement Learning

语义软引导:无需强化学习的LLM长上下文推理

Purbesh Mitra, Sennur Ulukus

机构 * University of Maryland(马里兰大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出语义软引导方法,通过自我蒸馏技术无需强化学习提升LLM长上下文推理能力,实验显示在数学和编程基准测试中准确率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17701 2025-12-04 cs.CL cs.AI cs.LG 80%

Investigating Bias: A Multilingual Pipeline for Generating, Solving, and Evaluating Math Problems with LLMs

探究偏差:一种多语言流水线用于生成、解决和评估LLM数学问题

Mariam Mahran, Katharina Simbeck

机构 * HTW Berlin University of Applied Sciences(柏林应用科学大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出多语言流水线生成、解决和评估数学问题,发现英语解决方案质量优于阿拉伯语,揭示语言偏差问题。

Comments Published in CEUR Workshop Proceedings, Vol. 4114, edu4AI'25: 2nd Workshop on Education for Artificial Intelligence, co-located with ECAI 2025, Bologna, Italy

Journal ref In: Proceedings of the 2nd International Workshop on Education for Artificial Intelligence (edu4AI 2025), CEUR Workshop Proceedings, Vol. 4114, Bologna, Italy, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23477 2025-12-01 cs.CV 80%

Video-CoM: Interactive Video Reasoning via Chain of Manipulations

Video-CoM:通过操作链进行交互式视频推理

Hanoona Rasheed, Mohammed Zumri, Muhammad Maaz, Ming-Hsuan Yang, Fahad Shahbaz Khan, Salman Khan

机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) University of California Merced(加州梅尔 Ced 大学) Google Research(谷歌研究院) Linköping University(林奈大学) Australian National University(澳大利亚国立大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);instruction tuning(abstract);SFT(abstract)

AI总结 Video-CoM通过操作链实现交互式视频推理,提升视频理解任务的性能和可解释性

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17473 2025-11-24 cs.CL cs.AI cs.LG 80%

Masked-and-Reordered Self-Supervision for Reinforcement Learning from Verifiable Rewards

基于掩码与重排的自监督学习用于可验证奖励的强化学习

Zhen Wang, Zhifeng Gao, Guolin Ke

机构 * DP Technology(DP技术)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MR-RLVR方法,通过掩码与重排自监督学习提升RLVR在仅结果可验证场景下的可扩展性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏