SRPO: Self-Reflective Policy Optimization for Long-Horizon Reasoning
SRPO:用于长程推理的自反思策略优化
Jialong Liu, Yuling Shi, Ning Yang, Xiaodong Gu, Zuchao Li
机构
*
School of artificial intelligence, Wuhan University(武汉大学人工智能学院)
;
School of computer science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院)
;
Institute of automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中
推理与问题求解
:large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI
CommentsExtended version of the paper accepted at DAC 2026. Extends the conference version with evaluations on AIME 2024 and GPQA-Diamond and a prediction-oracle upper-bound analysis
机构
*
State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)
;
iFLYTEK AI Research (Central China), iFLYTEK Co., Ltd(iFLYTEK中央中国AI研究院,iFLYTEK公司)
专题命中
推理与问题求解
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
机构
*
State Key Laboratory of AI Safety(人工智能安全国家重点实验室)
;
Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Meituan(美团)
Thinking Beyond Videos: Unifying Video Reasoning and Deep Research for Open-World Video Agents
超越视频:统一视频推理与深度研究的开放世界视频智能体
Wenqi Liu, Shijie Ma, Yunxiao Wang, Meng Liu, Qile Su, Han Liu, Bohan Hou, Xuanyu Zheng, Changyi Liu, Tianke Zhang, Haonan Fan, Kaiyu Jiang, Yingxin Li, Jiankang Chen, Xu Wang, Bin Wen, Tingting Gao, Han Li, Jianhua Yin, Yinwei Wei, Xuemeng Song
机构
*
Shandong University(山东大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Beihang University(北京航空航天大学)
;
City University of Hong Kong(香港城市大学)
;
Nanyang Technological University(南洋理工大学)
;
Kuaishou Technology(快手科技)
;
Southern University of Science and Technology(南方科技大学)
机构
*
Microsoft Research India(微软研究院印度分部)
;
LinkedIn(领英公司)
;
Nutanix(Nutanix公司)
;
Indian Institute of Science(印度科学学院)
;
Apple(苹果公司)
;
Fujitsu Research India(富士通印度研究院)
;
Indian Institute of Technology Kharagpur(印度克勒格布尔印度理工学院)
机构
*
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS)
;
School of Vehicle and Mobility, Tsinghua University(清华大学车辆与 mobility学院)
;
Ant Group(蚂蚁集团)
专题命中
推理与问题求解
:large language model(abstract);language model(abstract);分类 cs.AI
Latent Reward Steering: An Adaptive Inference-Time Framework that Implicitly Promotes Cognitive Behaviors in Reasoning LLMs
潜在奖励引导:一种自适应推理时框架,隐式促进推理大语言模型中的认知行为
Jiakang Li, Guanyu Zhu, Can Jin, Chenxi Huang, Dexu Yu, Ronghao Chen, Yang Zhou, Hongwu Peng, Xuanqi Lan, Dimitris N. Metaxas, Youhua Li
机构
*
Rutgers University(罗格斯大学)
;
South China Agricultural University(华南农业大学)
;
Columbia University(哥伦比亚大学)
;
Fenz.AI
;
QuantaAlpha
;
Adobe
;
Santa Clara University(圣克拉拉大学)
;
City University of Hong Kong(香港城市大学)
Beyond RGB: Benchmarking and Enhancing MLLMs for Hyperspectral Image Understanding via Training-Free Reasoning Framework
HM-Bench:多模态大语言模型在高光谱遥感中的综合基准
Xinyu Zhang, Zurong Mai, Qingmei Li, Xiaoya Fan, Zjin Liao, Haoyuan Liang, Yibin Wen, Yuhang Chen, Chan Tsz Ho, Bi Tianyuan, Ruifeng Su, Zihao Qiang, Juepeng Zheng, Jianxi Huang, Yutong Lu, Haohuan Fu
机构
*
Sun Yat-sen University(中山大学)
;
Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)
;
China Agricultural University(中国农业大学)
;
Southwest Jiaotong University(西南交通大学)
;
Southwest University(西南大学)
;
National Supercomputing Center in Shenzhen(国家超级计算深圳中心)
专题命中
推理与问题求解
:large language model(abstract);language model(abstract);分类 cs.AI
SkyNative: A Native Multimodal Architecture for Remote Sensing Vision-Language Understanding
SkyNative: 一种面向遥感视觉证据推理的原生多模态框架
Xiao Yang, Ronghao Fu, Zhiwen Lin, Zhuoran Duan, Lang Sun, Jiaqi Liu, Jiashun Zhu, Jiasen Hu, Xu Na, Bo Yang
机构
*
College of Computer Science and Technology, Jilin University, China(吉林大学计算机科学与技术学院)
;
Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education(教育部符号计算与知识工程重点实验室)
专题命中
推理与问题求解
:large language model(abstract);language model(abstract)
Commentsv2: substantive self-correction of v1 against raw transcripts; title changed. Corrects game specs to the implemented games; exact equilibrium solve (conditional bluff rate 2/3, not 0.340); response-validity audit: parser-substituted defaults retract Kimi K2's profile; prompt-framing result reversed. Appendix itemizes all changes. Data: https://doi.org/10.5281/zenodo.21943627. 28 pages, 7 figures