arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-17 至 2026-02-17 共收录 166 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 10 篇

2512.00499 2026-02-17 cs.LG cs.AI stat.ML 62%

ESPO: Entropy Importance Sampling Policy Optimization

ESPO:熵重要性采样策略优化

Yuepeng Sheng, Yuwei Huang, Shuman Liu, Anxiang Zeng, Haibo Zhang

机构 * LLM Team, Shopee Pte. Ltd.(Shopee 股份有限公司大语言模型团队)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 ESPO通过结合细粒度更新与稳定训练,解决梯度利用率不足问题,提升大语言模型在复杂推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14060 2026-02-17 cs.CL 57%

LM-Lexicon: Improving Definition Modeling via Harmonizing Semantic Experts

LM-Lexicon:通过和谐语义专家提升定义建模

Yang Liu, Jiaye Yang, Weikang Li, Jiahui Liang, Yang Li, Lingyong Yan

机构 * BIGAI Baidu Inc.(百度公司) Peking University(北京大学)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL

AI总结 LM-Lexicon通过语义专家学习和混合架构提升定义建模效果,实现BLEU分数提升7%,并优化领域级路由机制

Comments EACL 2026 (Oral), 22 pages, 12 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14050 2026-02-17 cs.LG 57%

Position Encoding with Random Float Sampling Enhances Length Generalization of Transformers

基于随机浮点采样的位置编码增强变换器的长度泛化能力

Atsushi Shimizu, Shohei Taniguchi, Yutaka Matsuo

机构 * Daiwa Securities(大和证券) The University of Tokyo(东京大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 本研究提出随机浮点采样方法,通过增强位置编码的泛化能力,提升变换器在长序列处理和常识推理任务中的表现。

Comments To appear at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17315 2026-02-17 cs.CL 57%

HIPPO: Enhancing the Table Understanding Capability of LLMs through Hybrid-Modal Preference Optimization

HIPPO:通过混合模态偏好优化增强大语言模型的表格理解能力

Haolan Wang, Zhenghao Liu, Xinze Li, Xiaocui Yang, Yu Gu, Yukun Yan, Qi Shi, Fangfang Li, Chong Chen, Ge Yu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 HIPPO 通过混合模态偏好优化提升大语言模型的表格理解能力,实现 4% 的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 复杂问题求解 17 篇

2512.18956 2026-02-17 cs.AI cs.LG 90%

Training Multimodal Large Reasoning Models Needs Better Thoughts: A Three-Stage Framework for Long Chain-of-Thought Synthesis and Selection

训练多模态大推理模型需要更优质的思考:一种用于长链式思考合成与选择的三阶段框架

Yizhi Wang, Linan Yue, Min-Ling Zhang

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Key Laboratory of Computer Network and Information Integration (SEU), Ministry of Education(计算机网络与信息集成重点实验室(SEU))

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SynSelect框架,通过三阶段合成与选择生成高质量多模态推理数据,提升模型推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13979 2026-02-17 cs.CL 89%

Chain-of-Thought Reasoning with Large Language Models for Clinical Alzheimer's Disease Assessment and Diagnosis

基于大语言模型的链式推理在临床阿尔茨海默病评估与诊断中的应用

Tongze Zhang, Jun-En Ding, Melik Ozolcer, Fang-Ming Hung, Albert Chih-Chieh Yang, Feng Liu, Yi-Rou Ji, Sang Won Bae

机构 * Stevens Institute of Technology(斯蒂文斯理工学院) Surgical Trauma Intensive Care Unit(外科创伤重症护理科) Institute of Brain Science(脑科学研究所) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出利用大语言模型的链式推理进行阿尔茨海默病的评估与诊断,通过生成推理路径提升诊断稳定性和性能,F1分数提升达15%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13407 2026-02-17 cs.AI 85%

On-Policy Supervised Fine-Tuning for Efficient Reasoning

在线监督微调用于高效推理

Anhao Zhao, Ziyang Chen, Junlong Tong, Yingqi Fan, Fanghua Ye, Shuhao Li, Yunpu Ma, Wenjie Li, Xiaoyu Shen

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Eastern Institute of Technology, Ningbo(宁波工程技术学院) Shanghai Jiao Tong University(上海交通大学) Ludwig Maximilian University of Munich(慕尼黑大学) Tencent Hunyuan / AI Lab(腾讯混元/AI实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出在线监督微调方法,通过简化奖励机制提升推理效率和准确性,减少计算成本并优化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14763 2026-02-17 cs.CL cs.AI 84%

Unlocking Reasoning Capability on Machine Translation in Large Language Models

在大语言模型中解锁机器翻译的推理能力

Sara Rajaee, Sebastian Vincent, Alexandre Berard, Marzieh Fadaee, Kelly Marchisio, Tom Kocmi

机构 * University of Amsterdam(阿姆斯特丹大学) Cohere Labs(Cohere实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种针对翻译的结构化推理框架,通过多步骤草稿、充分性细化、流畅性提升和选择性迭代修订,显著提升了大语言模型在机器翻译中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14216 2026-02-17 cs.CY cs.AI cs.CL 81%

Reasoning Language Models for complex assessments tasks: Evaluating parental cooperation from child protection case reports

用于复杂评估任务的推理语言模型:从儿童保护案件报告中评估父母合作

Dragan Stoll, Brian E. Perron, Zia Qi, Selina Steinmann, Nicole F. Eicher, Andreas Jud

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了推理语言模型在评估儿童保护案件中父母合作方面的有效性,发现模型在母亲合作评估上表现更佳,但对父亲合作的评估准确性较低,提示需关注性别差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14386 2026-02-17 cs.CL 79%

Beyond Token-Level Policy Gradients for Complex Reasoning with Large Language Models

超越令牌级策略梯度:用于大语言模型复杂推理的多令牌策略梯度优化

Mufan Xu, Kehai Chen, Xuefeng Bai, Zhengyu Niu, Muyun Yang, Tiejun Zhao, Min Zhang

机构 * School of Computer Science and Technology, Harbin Institute of Technology, China(哈尔滨工业大学计算机科学与技术学院) Baidu Inc.(百度公司)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出MPO框架,通过多令牌级优化提升大语言模型在复杂推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13685 2026-02-17 cs.SD cs.AI 79%

AuTAgent: A Reinforcement Learning Framework for Tool-Augmented Audio Reasoning

AuTAgent: 一个用于工具增强音频推理的强化学习框架

Siqian Tong, Xuan Li, Yiwei Wang, Baolong Bi, Yujun Cai, Shenghua Liu, Yuchen He, Chengpeng Hao

机构 * Institute of Acoustics, Chinese Academy of Sciences(中国科学院声学研究所) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) The University of Queensland(昆士兰大学) University of Chinese Academy of Sciences(中国科学院大学) University of California, Merced(加州大学默塞德分校)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 AuTAgent通过强化学习框架学习何时及使用哪些工具,提升音频模型的推理能力,实验显示在多个基准上显著提高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01784 2026-02-17 cs.CL cs.AI 62%

iQUEST: An Iterative Question-Guided Framework for Knowledge Base Question Answering

iQUEST: 一种迭代式问题引导的知识库问答框架

Shuai Wang, Yinan Yu

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 iQUEST通过迭代分解复杂查询和集成图神经网络,提升多跳知识库问答的推理准确性与连贯性。

Comments Accepted to the 63rd Annual Meeting of the Association for Computational Linguistics (ACL 2025), Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14526 2026-02-17 cs.RO cs.AI cs.LG 62%

TWISTED-RL: Hierarchical Skilled Agents for Knot-Tying without Human Demonstrations

TWISTED-RL:无人类示范的分层技能代理用于打结

Guy Freund, Tom Jurgenson, Matan Sudry, Erez Karpas

机构 * Reichman University(雷赫曼大学) Technion – Israel Institute of Technology(技术学院——以色列理工学院) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 复杂问题求解 :planning(abstract);分类 cs.AI、cs.LG

AI总结 TWISTED-RL通过强化学习和拓扑动作实现无示范的复杂打结任务,提升泛化能力和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13949 2026-02-17 cs.LG cs.AI 62%

Experiential Reinforcement Learning

经验强化学习

Taiwei Shi, Sihao Chen, Bowen Jiang, Linxin Song, Longqi Yang, Jieyu Zhao

机构 * University of Southern California(南加州大学) Microsoft(微软公司) University of Pennsylvania(宾夕法尼亚大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 经验强化学习通过显式经验-反思-巩固循环提升语言模型在稀疏奖励环境中的学习效率和性能。

Comments 26 pages, 9 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07262 2026-02-17 cs.AI cs.CE cs.LG 62%

AgenticSciML: Collaborative Multi-Agent Systems for Emergent Discovery in Scientific Machine Learning

AgenticSciML: 基于协作多智能体系统的科学机器学习中的涌现发现

Qile Jiang, George Karniadakis

机构 * Brown University(布朗大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 AgenticSciML通过协作多智能体系统实现科学机器学习中的涌现发现,生成超越单智能体和人类设计基线的高效方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13210 2026-02-17 cs.NI cs.AI cs.LG 62%

Large Language Model (LLM)-enabled Reinforcement Learning for Wireless Network Optimization

基于大语言模型的强化学习用于无线网络优化

Jie Zheng, Ruichen Zhang, Dusit Niyato, Haijun Zhang, Jiacheng Wang, Hongyang Du, Jiawen Kang, Zehui Xiong

机构 * State-Province Joint Engineering and Research Center of Advanced Networking and Intelligent Information Services, College of Computer Science, Northwest University(高级网络与智能信息服务省-市联合工程与研究中心,计算机科学学院,西北大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) Institute of Artificial Intelligence, University of Science and Technology Beijing(人工智能研究院,北京科技大学) Department of Electrical and Electronic Engineering, the University of Hong Kong(电子与电气工程系,香港大学) Automation of School, Guangdong University of Technology(自动化学院,广东工业大学) Queen’s University Belfast(贝尔法斯特女王大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用大语言模型增强强化学习,以优化6G无线网络,通过多智能体强化学习框架提升网络性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14833 2026-02-17 eess.SP cs.LG 57%

RF-GPT: Teaching AI to See the Wireless World

RF-GPT:教AI看见无线世界

Hang Zou, Yu Tian, Bohao Wang, Lina Bariah, Samson Lasaulce, Chongwen Huang, Mérouane Debbah

机构 * Research Institute for Digital Future, Khalifa University(数字未来研究院,哈利法大学) College of Information Science and Electronic Engineering, Zhejiang University(信息科学与电子工程学院,浙江大学) Université de Lorraine, CNRS, CRAN(洛林大学,CNRS,CRAN)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 RF-GPT通过多模态LLM的视觉编码器处理RF频谱图,实现射频信号的高级推理与生成,无需人工标注即可在多个无线任务中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02744 2026-02-17 cs.CL 57%

SYNAPSE: Empowering LLM Agents with Episodic-Semantic Memory via Spreading Activation

SYNAPSE:通过扩散激活实现LLM代理的片段语义记忆

Hanqi Jiang, Junhao Chen, Yi Pan, Ling Chen, Weihang You, Yifan Zhou, Ruidong Zhang, Andrea Sikora, Lin Zhao, Yohannes Abate, Tianming Liu

机构 * School of Computing, University of Georgia(佐治亚大学计算机学院) Department of Biosystems Engineering and Soil Science, University of Tennessee(田纳西大学生物系统工程与土壤科学系) Department of Biomedical Informatics, University of Colorado School of Medicine(科罗拉多医学院生物医学信息学系) Department of Biomedical Engineering, New Jersey Institute of Technology(新泽西理工学院生物医学工程系) Department of Physics and Astronomy, The University of Georgia(佐治亚大学物理与天文学系)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 SYNAPSE通过动态图与扩散激活机制,提升LLM在复杂时间序列和多跳推理任务中的性能,解决上下文隧道问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13890 2026-02-17 cs.CL 57%

Evaluating Prompt Engineering Techniques for RAG in Small Language Models: A Multi-Hop QA Approach

评估用于RAG的提示工程技术在小型语言模型中的表现:一种多跳问答方法

Amir Hossein Mohammadi, Ali Moeinian, Zahra Razavizade, Afsaneh Fatemi, Reza Ramezani

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文通过评估24种提示模板,发现优化RAG在小型语言模型上的表现提升显著,为资源受限环境下的RAG系统提供实用建议。

Comments 32 Pages, Submitted to Journal of Computing and Security

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13893 2026-02-17 physics.optics physics.app-ph physics.comp-ph 50%

Prompt-to-prescription: towards generative design of diffraction-limited refractive optics

提示到处方:迈向生成式差分限折射光学设计

Roy Maman, David Ohana, Jacob Engelberg, Uriel Levy

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出一种结合大语言模型和可微分光线追踪的生成框架,实现差分限折射光学设计的自动化,适用于工业计量、红外目镜和非球面透镜等多种场景。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13245 2026-02-17 cs.NI 50%

Embodied Intelligent Spectrum Management: A New Paradigm for Dynamic Spectrum Access

具身智能频谱管理:动态频谱接入的新范式

Yihe Diao, Yuhang Wu, Hongtao Liang, Ming Xu, Rui Ding, Fuhui Zhou, Qihui Wu, Jun Zhang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出具身智能频谱管理范式,通过具身智能技术解决动态频谱接入中的灵活性和通用性问题,展示原型平台并探讨未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 推理评测 41 篇

2510.02410 2026-02-17 cs.LG 85%

OpenTSLM: Time-Series Language Models for Reasoning over Multivariate Medical Text- and Time-Series Data

OpenTSLM:用于多变量医学文本和时间序列数据推理的时间序列语言模型

Patrick Langer, Thomas Kaar, Max Rosenblattl, Maxwell A. Xu, Winnie Chow, Martin Maritsch, Robert Jakob, Ning Wang, Juncheng Liu, Aradhana Verma, Brian Han, Daniel Seung Kim, Henry Chubb, Scott Ceresnak, Aydin Zahedivash, Alexander Tarlochan Singh Sandhu, Fatima Rodriguez, Daniel McDuff, Elgar Fleisch, Oliver Aalami, Filipe Barata, Paul Schmiedmayer

机构 * Stanford Mussallem Center for Biodesign(斯坦福 Mussallem 生物设计中心) Centre for Digital Health Interventions(数字健康干预中心) Agentic Systems Lab(代理系统实验室) National University of Singapore(新加坡国立大学) Microsoft(微软) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google Research(谷歌研究) Stanford University(斯坦福大学) Amazon(亚马逊) Division of Cardiovascular Medicine(心血管医学部) Division of Cardiology(心内科部) Pediatric Cardiology(儿童心内科) University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 OpenTSLM通过整合时间序列作为原生模态,提升对多变量医学文本和时间序列数据的推理能力,其模型在多个任务中均优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03346 2026-02-17 cs.AI 85%

Making Slow Thinking Faster: Compressing LLM Chain-of-Thought via Step Entropy

让慢思考更快:通过步骤熵压缩LLM的链式思考

Zeju Li, Jianyuan Zhong, Ziyang Zheng, Xiangyu Wen, Zhijian Xu, Yingying Cheng, Fan Zhang, Qiang Xu

机构 * The Chinese University of Hong Kong(中国香港大学) Huawei Technologies Co., Ltd(华为技术有限公司) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 通过步骤熵压缩LLM的链式思考,提升推理效率并保持准确性。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13217 2026-02-17 cs.AI 83%

VeRA: Verified Reasoning Data Augmentation at Scale

VeRA: 在大规模上验证推理数据增强

Zerui Cheng, Jiashuo Liu, Chunjie Wu, Jianzhu Yao, Pramod Viswanath, Ge Zhang, Wenhao Huang

机构 * Princeton University(普林斯顿大学)

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 VeRA通过验证推理数据增强框架,实现大规模、可靠的评估基准生成,提升评估的稳健性和成本效益。

Comments 36 pages; VeRA technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14404 2026-02-17 cs.AI cs.LG cs.NE 81%

Boule or Baguette? A Study on Task Topology, Length Generalization, and the Benefit of Reasoning Traces

面包还是法棍?一项关于任务拓扑、长度泛化和推理轨迹益处的研究

William L. Tong, Ege Cakar, Cengiz Pehlevan

机构 * School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院) Kempner Institute for the Study of Artificial and Natural Intelligence, Harvard University(哈佛大学人工智能与自然智能研究所) Center for Brain Sciences, Harvard University(哈佛大学脑科学中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究通过PITA数据集探讨推理轨迹在不同任务拓扑和长度泛化中的表现,揭示了RT模型在广度任务中的优势及深度任务的局限性。

Comments 38 pages, 11 figures, code available at https://github.com/wtong98/boule-or-baguette

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14189 2026-02-17 cs.CL cs.AI 81%

Knowing When Not to Answer: Abstention-Aware Scientific Reasoning

知道何时不回答:具有退避意识的科学推理

Samir Abdaljalil, Erchin Serpedin, Hasan Kurban

机构 * Texas A&M University(德克萨斯农工大学) Hamad Bin Khalifa University(哈马德·本·哈利法大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种具有退避意识的科学推理框架,通过分解科学主张并利用自然语言推理评估证据,以减少错误风险,强调退避在科学验证中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01055 2026-02-17 cs.LG cs.AI q-bio.BM q-bio.QM 81%

FGBench: A Dataset and Benchmark for Molecular Property Reasoning at Functional Group-Level in Large Language Models

FGBench: 一个用于大语言模型中功能基团级分子属性推理的数据集和基准

Xuan Liu, Siru Ouyang, Xianrui Zhong, Jiawei Han, Huimin Zhao

机构 * Department of Chemical and Biomolecular Engineering, University of Illinois Urbana-Champaign(化学与生物分子工程系,伊利诺伊大学厄巴纳-香槟分校) Department of Computer Science, University of Illinois Urbana-Champaign(计算机科学系,伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 FGBench通过构建包含功能基团级信息的数据集,提升大语言模型在分子属性推理任务中的能力。

Comments NeurIPS 2025 (Datasets and Benchmarks Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13274 2026-02-17 cs.AI cs.CL 81%

ProMoral-Bench: Evaluating Prompting Strategies for Moral Reasoning and Safety in LLMs

ProMoral-Bench:评估大语言模型中道德推理与安全性的提示策略

Rohan Subramanian Thomas, Shikhar Shiromani, Abdullah Chaudhry, Ruizhe Li, Vasu Sharma, Kevin Zhu, Sunishchal Dev

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 ProMoral-Bench通过统一道德安全评分评估多种提示策略,发现紧凑示例引导框架在道德和安全方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14160 2026-02-17 cs.AI 79%

Process-Supervised Multi-Agent Reinforcement Learning for Reliable Clinical Reasoning

过程监督多智能体强化学习用于可靠的临床推理

Chaeeun Lee, T. Michael Yates, Pasquale Minervini, T. Ian Simpson

机构 * School of Informatics, University of Edinburgh, UK(信息学院,爱丁堡大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出了一种过程监督的多智能体强化学习框架,用于提升基因-疾病有效性校准的临床推理准确性与过程忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13313 2026-02-17 cs.CV cs.AI 79%

Agentic Spatio-Temporal Grounding via Collaborative Reasoning

基于协作推理的代理时空 grounding

Heng Zhao, Yew-Soon Ong, Joey Tianyi Zhou

机构 * CFAR, IHPC, Agency for Science, Technology and Research(A*STAR)(CFAR、IHPC、新加坡科技研究局) CCDS, Nanyang Technological University(CCDS、南洋理工大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出ASTG框架,通过协作推理实现开放世界下的时空视频grounding,提升检索效率并优于现有弱监督和零样本方法。

详情

展开后加载摘要…

URL PDF HTML 收藏