An evidence-guided reinforcement learning method to improve psychiatric reasoning in small language models
评估一种证据引导的强化学习框架在对齐光参数大语言模型与精神科临床推理决策认知中的作用
Xinxin Lin, Guangxin Dai, Yi Zhong, Xiang Li, Xue Xiao, Jian Liu, Yixin Zhang, Lingming Hu, Zhengdong Wu, Yongbo Zheng, Runchuan Zhu, Ming Zhao, Huizi Yu, Yi Zhang, Fangting Lu, Shuo Wu, Jun Zhao, Ping Yin, Joey W. Y. Chan, Ngan Yin Chan, Yumei Wang, Lejin Yang, Yanqiu Xing, Sijing Chen, Yun Kwok Wing, Lin Lu, Xin Ma, Lizhou Fan
机构
*
The Chinese University of Hong Kong, Shatin, N.T., Hong Kong SAR, China(香港中文大学)
;
Shandong University, Jinan, China(山东大学)
;
Peking University Sixth Hospital, Beijing, China(北京大学第六医院)
;
Inspur Cloud Information Technology Co., Ltd., Jinan, China(Inspur 云技术有限公司)
;
Fudan University, Shanghai, China(复旦大学)
;
Shandong Provincial Hospital Affiliated to Shandong First Medical University, Jinan, China(山东第一医科大学附属山东省人民医院)
;
Jilin University, Changchun, China(吉林大学)
;
Hong Kong ICI Cloud Service Limited, Hong Kong SAR, China(香港ICI云服务有限公司)
;
Shandong First Medical University, Jinan, China(山东第一医科大学)
专题命中
推理与问题求解
:language model(title,abstract);small language model(title,abstract);LLM(summary_cn,abstract_cn);large language model(abstract)
CommentsAccepted in Findings of the Association for Computational Linguistics: EMNLP 2026. Index Terms: Collaborative agentic workflows, LLM agent orchestration, Quality-cost trade-off, Task progress prediction, Online decision-making
When LLM Meets Tree Search: A Systematic View of Inference as Search in Large Language Models
当大语言模型遇到树搜索:大语言模型中作为搜索的推理的系统视角
Jiaqi Wei, Xiang Zhang, Yuejin Yang, Wenxuan Huang, Juntai Cao, Sheng Xu, Xiang Zhuang, Zhangyang Gao, Muhammad Abdul-Mageed, Laks VS Lakshmanan, Chenyu You, Wanli Ouyang, Siqi Sun
机构
*
Zhejiang University(浙江大学)
;
Fudan University(复旦大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
University of British Columbia(不列颠哥伦比亚大学)
;
Stony Brook University(石溪大学)
;
The Chinese University of Hong Kong(香港中文大学)
专题命中
推理与问题求解
:LLM(title);large language model(title);language model(title);pretraining(abstract)
Large Language Models and Evolutionary Computation: A Critical Review of Bidirectional Interaction, Automated Algorithm Design, and Co-Adaptive Systems
基于景观与搜索行为分析的粒子群优化可解释信息处理
Dikshit Chauhan, Bapi Dutta, Indu Bala, Niki van Stein, Thomas Bäck, Anupam Yadav
机构
*
Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系)
;
Department of Computer Science, Universidad de Jaén(西班牙Jaén大学计算机科学系)
;
School of Computer and Mathematical Sciences, University of Adelaide(阿德莱德大学计算机与数学科学学院)
;
Leiden Institute of Advanced Computer Science, University Leiden(莱顿大学先进计算机科学研究所)
;
Department of Mathematics and Computing, Dr. B. R. Ambedkar National Institute of Technology(德拉·B·R·阿姆贝卡尔国立理工学院数学与计算系)
专题命中
推理与问题求解
:large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
MMPCBench: Benchmarking Multimodal Large Language Models on Proactive Critique of Flawed Inputs
MMPCBench:评估多模态大语言模型对有缺陷输入的主动批判能力的基准
Jinzhe Li, Gengxu Li, Jinnan Li, Yuan Wu, Yi Chang
机构
*
School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)
;
International Center of Future Science, Jilin University(吉林大学未来科学国际中心)
;
Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(教育部知识驱动人机智能工程研究中心)
专题命中
推理与问题求解
:large language model(title,abstract);language model(title,abstract);分类 cs.AI