arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-16 至 2026-01-16 共收录 69 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 6 篇

2410.10336 2026-01-16 cs.AI cs.CL cs.LG cs.SC 87%

CoMAT: Chain of Mathematically Annotated Thought Improves Mathematical Reasoning

CoMAT:数学注释的思维链提升数学推理

Joshua Ong Jun Leang, Aryo Pradipta Gema, Shay B. Cohen

机构 * School of Informatics, The University of Edinburgh(信息学院,爱丁堡大学) Imperial College London(伦敦帝国学院)

专题命中 数学推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CoMAT通过符号转换和推理执行两个阶段提升数学推理能力,在多个基准测试中超越传统CoT方法。

Comments 9 pages, 12 figures

Journal ref Proc. EMNLP 2025, pp. 20245-20274

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09667 2026-01-16 cs.AI cs.CL 81%

Collaborative Multi-Agent Test-Time Reinforcement Learning for Reasoning

协同多智能体测试时间强化学习用于推理

Zhiyuan Hu, Yunhai Hu, Juncheng Liu, Shuyue Stella Li, Yucheng Wang, Zhen Xu, See-Kiong Ng, Anh Tuan Luu, Xinxing Xu, Bryan Hooi, Cynthia Breazeal, Hae Won Park

机构 * MIT(麻省理工学院) NUS(新加坡国立大学) NYU(纽约大学) Microsoft(微软) Columbia(哥伦比亚大学) NTU(国立科技大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 MATTRL通过在推理阶段注入结构化文本经验,提升多智能体在医学、数学和教育等领域的推理准确性,比多智能体基线提升3.67%,比单智能体基线提升8.67%。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10094 2026-01-16 cs.CV cs.AI cs.LG 81%

V-Zero: Self-Improving Multimodal Reasoning with Zero Annotation

V-Zero:基于零标注的自改进多模态推理

Han Wang, Yi Yang, Jingyuan Hu, Minfeng Zhu, Wei Chen

机构 * State Key Laboratory of CAD&CG(计算机辅助设计与图形学国家重点实验室) Zhejiang University(浙江大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 V-Zero通过自改进机制在无需人工标注的情况下提升多模态模型的视觉数学推理和通用视觉能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10064 2026-01-16 cs.CL 79%

Long-Chain Reasoning Distillation via Adaptive Prefix Alignment

通过自适应前缀对齐实现长链推理蒸馏

Zhenghao Liu, Zhuoyang Wu, Xinze Li, Yukun Yan, Shuo Wang, Zulong Chen, Yu Gu, Ge Yu, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学计算机科学与技术系) Alibaba Group, China(阿里巴巴集团)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 通过自适应前缀对齐方法提升学生模型的推理能力,有效蒸馏教师生成的长推理轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10349 2026-01-16 cs.LG cs.AI cs.CL cs.GT 67%

SuS: Strategy-aware Surprise for Intrinsic Exploration

SuS:基于策略的惊喜用于内在探索

Mark Kashirskiy, Ilya Makarov

机构 * Higher School of Economics(俄罗斯高等经济学院) AI Talent Hub(人工智能人才中心) ITMO University(ITMO大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SuS通过结合策略稳定性与策略惊喜,提升强化学习中探索的准确性和多样性,实现显著性能提升。

Comments 8 pages, 7 figures, 3 tables. Code available at https://github.com/mariklolik/sus

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23281 2026-01-16 cs.AI cs.CL 62%

MathArena: Evaluating LLMs on Uncontaminated Math Competitions

MathArena: 在无污染数学竞赛中评估大语言模型

Mislav Balunović, Jasper Dekoninck, Ivo Petrov, Nikola Jovanović, Martin Vechev

机构 * ETH Zurich(苏黎世联邦理工学院) INSAIT

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MathArena通过评估数学竞赛中的LLM,揭示了模型在推理和证明写作上的能力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 1 篇

2601.09771 2026-01-16 cs.AI 70%

PCN-Rec: Agentic Proof-Carrying Negotiation for Reliable Governance-Constrained Recommendation

PCN-Rec: 基于代理的证明携带协商用于可靠约束下的推荐

Aradhya Dixit, Shreem Dixit

机构 * Wake Technical Community College(韦克技术社区学院) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 代码与定理证明 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 PCN-Rec通过代理证明携带协商机制,在满足治理约束的同时提升推荐可靠性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 6 篇

2601.09727 2026-01-16 cs.CL cs.AI cs.IR cs.LG 82%

SciNets: Graph-Constrained Multi-Hop Reasoning for Scientific Literature Synthesis

SciNets: 图约束多跳推理用于科学文献综合

Sauhard Dubey

机构 * Jaypee Institute of Information Technology(杰伊佩 Institute 信息科技学院)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SciNets通过图约束多跳推理实现科学文献综合,通过多跳路径连接罕见共现的概念,提升机制解释的稳定性和多样性。

Comments 19 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10173 2026-01-16 cs.CR cs.AI cs.CL 81%

ReasAlign: Reasoning Enhanced Safety Alignment against Prompt Injection Attack

ReasAlign: 基于推理增强的安全对齐以抵御提示注入攻击

Hao Li, Yankai Yang, G. Edward Suh, Ning Zhang, Chaowei Xiao

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) NVIDIA(NVIDIA公司) Johns Hopkins University(约翰霍普金斯大学)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 ReasAlign通过结构化推理和测试时缩放机制,有效防御提示注入攻击,实现安全与效用的最佳平衡。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09980 2026-01-16 cond-mat.mtrl-sci cs.AI cs.LG 81%

Performance of AI agents based on reasoning language models on ALD process optimization tasks

基于推理语言模型的AI代理在ALD过程优化任务中的性能

Angel Yanguas-Gil

机构 * Applied Materials Division, Argonne National Laboratory, Lemont, IL 60439, USA(阿贡国家实验室应用材料部)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究基于推理语言模型的AI代理在ALD过程优化中的性能,发现其能有效完成优化任务,但存在响应不确定性及潜在的推理偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25626 2026-01-16 cs.CL cs.AI cs.LG cs.LO 67%

Are Language Models Efficient Reasoners? A Perspective from Logic Programming

语言模型是高效的推理者吗?从逻辑编程的角度看

Andreas Opedal, Yanick Zengaffinen, Haruki Shirakami, Clemente Pasti, Mrinmaya Sachan, Abulhair Saparov, Ryan Cotterell, Bernhard Schölkopf

机构 * ETH Zürich(苏黎世联邦理工学院) MPI for Intelligent Systems, Tübingen(智能系统马克斯·普朗克研究所) EPFL(苏黎世联邦理工学院) Idiap Research Institute(Idiap研究机构) Purdue University(普渡大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文从逻辑编程角度评估语言模型的推理效率,发现其在存在无关信息时推理能力下降,生成证明常包含不必要的推理步骤。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10108 2026-01-16 cs.CL cs.AI cs.MM 62%

SIN-Bench: Tracing Native Evidence Chains in Long-Context Multimodal Scientific Interleaved Literature

SIN-Bench:在长上下文多模态科学交织文献中追踪原生证据链

Yiming Ren, Junjie Wang, Yuxin Meng, Yihang Shi, Zhiqiang Lin, Ruihang Chu, Yiran Xu, Ziming Li, Yunfei Zhao, Zihan Wang, Yu Qiao, Ruiming Tang, Minghao Liu, Yujiu Yang

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) KuaiShou Inc.(快手公司) Stanford University(斯坦福大学) Harvard University(哈佛大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 SIN-Bench 通过构建科学交织语料库和四个逐步任务,评估多模态模型在长上下文科学文献中追踪证据链的能力,揭示接地是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09728 2026-01-16 cs.CL cs.AI 62%

Eliminating Agentic Workflow for Introduction Generation with Parametric Stage Tokens

通过参数化阶段令牌消除引言生成中的代理工作流

Meicong Zhang, Tiancheng su, Guoxiu He

机构 * School of Economics and Management, East China Normal University(经济管理学院,东华大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出STIG方法,通过参数化阶段令牌消除代理工作流,使LLM在单次推理中生成连贯的引言,提升逻辑结构和语义相似性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 10 篇

2601.10342 2026-01-16 cs.AI 79%

C-GRASP: Clinically-Grounded Reasoning for Affective Signal Processing

C-GRASP:基于临床的感知信号处理推理

Cheng Lin Cheng, Ting Chuan Lin, Chai Kai Chang

机构 * Department of Physics National Central University(物理系国立中央大学) Center for Education National Central University(教育中心国立中央大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 C-GRASP通过临床基础推理提升情感信号处理的准确性与临床一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10222 2026-01-16 cs.AI 79%

Compartmentalised Agentic Reasoning for Clinical NLI

临床自然语言推理中的 compartmentalised agentic 推理

Maël Jullien, Lei Xu, Marco Valentino, André Freitas

机构 * Department of Computer Science, University of Manchester, UK(曼彻斯特大学计算机科学系) National Biomarker Centre, CRUK-MI, University of Manchester, UK(曼彻斯特大学国家生物标记中心) Idiap Research Institute, Switzerland(日内瓦IDIAP研究所) School of Computer Science, University of Sheffield, UK(谢菲尔德大学计算机科学系) École Polytechnique Fédérale de Lausanne (EPFL), Switzerland(洛桑联邦理工学院(EPFL))

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 CARENLI 通过 compartmentalisation 和验证提升临床自然语言推理的准确率,从 23% 提高到 57%

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10148 2026-01-16 cs.AI 70%

DecisionLLM: Large Language Models for Long Sequence Decision Exploration

DecisionLLM: 用于长序列决策探索的大型语言模型

Xiaowei Lv, Zhilin Zhang, Yijun Li, Yusen Huo, Siyuan Ju, Xuyan Li, Chunxiang Hong, Tianyu Wang, Yongcai Wang, Peng Sun, Chuan Yu, Jian Xu, Bo Zheng

机构 * Renmin University of China, Beijing China(中国人民大学) Alibaba Group, Beijing, China(阿里巴巴集团)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 DecisionLLM基于Transformer架构,通过将轨迹视为独立模态,解决LLMs在连续值解释上的不足,实现长序列决策任务的高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09858 2026-01-16 cs.CL cs.AI cs.LG 67%

OUTLINEFORGE: Hierarchical Reinforcement Learning with Explicit States for Scientific Writing

OUTLINEFORGE: 基于显式状态的分层强化学习用于科学写作

Yilin Bao, Ziyao He, Zayden Yang

机构 * UC San Diego(圣迭戈大学) Ohio State University(俄亥俄州立大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 OUTLINEFORGE通过分层强化学习和显式状态管理,提升科学写作的全局结构和引用一致性,改进文档规划和事实准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11788 2026-01-16 cs.CL cs.AI 62%

WebRollback: Enhancing Web Agents with Explicit Rollback Mechanisms

WebRollback: 通过显式回滚机制增强网络代理

Zhisong Zhang, Tianqing Fang, Kaixin Ma, Wenhao Yu, Hongming Zhang, Haitao Mi, Dong Yu

机构 * City University of Hong Kong(香港城市大学) Tencent AI Lab(腾讯人工智能实验室)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 通过显式回滚机制提升网络代理的导航效率与灵活性

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09770 2026-01-16 cs.AI 57%

GUI-Eyes: Tool-Augmented Perception for Visual Grounding in GUI Agents

GUI-Eyes: 用于GUI代理视觉接地的工具增强感知

Chen Chen, Jiawei Shao, Dakuan Lu, Haoyi Hu, Xiangcheng Liu, Hantao Yao, Wu Liu

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 GUI-Eyes通过分阶段策略推理和细粒度奖励反馈实现工具感知主动感知,显著提升GUI代理的接地准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09755 2026-01-16 cs.NE cs.AI cs.RO 57%

Heterogeneous computing platform for real-time robotics

异构计算平台用于实时机器人

Jakub Fil, Yulia Sandamirskaya, Hector Gonzalez, Loïc Azzalin, Stefan Glüge, Lukas Friedenstab, Friedrich Wolf, Tim Rosmeisl, Matthias Lohrmann, Mahmoud Akl, Khaleel Khan, Leonie Wolf, Kristin Richter, Holm Puder, Mazhar Ali Bari, Xuan Choo, Noha Alharthi, Michael Hopkins, Mansoor Hanif Christian Mayr, Jens Struckmeier, Steve Furber

机构 * WAIYS GmbH(WAIYS公司) Zurich University of Applied Sciences(苏黎世应用科学大学) SpiNNcloud Systems GmbH(SpiNNcloud系统公司) TU Dresden(德累斯顿技术大学) Applied Brain Research(应用脑科研) NEOM The University of Manchester(曼彻斯特大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出一种异构计算平台,结合神经形态计算硬件与AI计算集群,用于实时机器人感知与交互任务,提升机器人自主性和智能水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09100 2026-01-16 cs.AI 57%

DScheLLM: Enabling Dynamic Scheduling through a Fine-Tuned Dual-System Large language Model

DScheLLM:通过微调双系统大语言模型实现动态调度

Lixiang Zhang, Chenggong Zhao, Qing Gao, Xiaoke Zhao, Gengyi Bai, Jinhu Lv

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 DScheLLM通过微调双系统大语言模型,首次在动态环境中应用大语言模型解决作业车间调度问题,展示其在智能调度优化中的潜力。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10123 2026-01-16 cs.MA 50%

Fairness Driven Multi-Agent Path Finding Problem

基于公平性的多智能体路径寻找问题

Aditi Anand, Dildar Ali, Suman Banerjee

专题命中 规划推理 :planning(abstract)

AI总结 本文提出基于公平性的多智能体路径寻找问题解决方案,针对理性与非理性智能体分别设计机制和启发式方法,确保激励相容与个体理性。

Comments This paper has been accepted in the 18th International Conference on Agents and Artificial Intelligence (ICCART 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20412 2026-01-16 cs.CR 50%

MindGuard: Intrinsic Decision Inspection for Securing LLM Agents Against Metadata Poisoning

MindGuard:内在决策检查用于保护LLM代理免受元数据中毒攻击

Zhiqiang Wang, Haohua Du, Guanquan Shi, Junyang Zhang, HaoRan Cheng, Yunhao Yao, Kaiwen Guo, Xiang-Yang Li

专题命中 规划推理 :reasoning(abstract)

AI总结 MindGuard通过决策依赖图检测和归因LLM代理中的元数据中毒攻击,实现高精度的污染调用检测与溯源。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 5 篇

2601.10254 2026-01-16 cs.AI 79%

NoReGeo: Non-Reasoning Geometry Benchmark

NoReGeo:非推理几何基准

Irina Abdullaeva, Anton Vasiliuk, Elizaveta Goncharova, Temurbek Rahmatullaev, Zagorulko Ivan, Maxim Kurkin, Andrey Kuznetsov

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 NoReGeo基准评估LLMs在不依赖推理或代数计算的情况下对几何问题的理解能力,发现即使先进模型在二分类任务中也仅达65%准确率,揭示了当前LLMs在几何认知上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09879 2026-01-16 cs.CV cs.AI 79%

MedVL-SAM2: A unified 3D medical vision-language model for multimodal reasoning and prompt-driven segmentation

MedVL-SAM2:一种统一的3D医学视觉-语言模型,用于多模态推理和基于提示的分割

Yang Xing, Jiong Wu, Savas Ozdemir, Ying Zhang, Yang Yang, Wei Shao, Kuang Gong

机构 * Department of Biomedical Engineering, University of Florida(佛罗里达大学生物医学工程系) Department of Radiology, University of Florida(佛罗里达大学放射学系) Research Computing, University of Florida(佛罗里达大学研究计算中心) Department of Medicine, University of Florida(佛罗里达大学医学系) Department of Radiology, UC San Francisco(旧金山大学放射学系)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 MedVL-SAM2是一种统一的3D医学多模态模型,通过联合训练实现报告生成、VQA和多任务分割的高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07695 2026-01-16 cs.CV 78%

Smooth Operator: Smooth Verifiable Reward Activates Spatial Reasoning Ability of Vision-Language Model

平滑操作符:平滑可验证奖励激活视觉-语言模型的空间推理能力

Siwen Jiao, Tianxiong Lv, Kangan Qian, Chenxu Zhao, Xiuyuan Zhu, Tianlun Li, Xiaolong Cheng, Jinyu Li, Zhihao Liao, Yang Cai

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出平滑可验证奖励激活方法,通过平滑操作符和绝对保持GRPO框架提升视觉-语言模型对3D场景的理解能力,实现性能与数据效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09775 2026-01-16 cs.LG cs.CL 73%

The Geometry of Thought: Disclosing the Transformer as a Tropical Polynomial Circuit

思维的几何学:揭示Transformer为热带多项式电路

Faruk Alpay, Bilge Senturk

机构 * Bahçeşehir University(巴切希尔大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 本研究揭示Transformer在高置信度下通过热带多项式电路实现动态规划,为链式思维提供几何解释。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10208 2026-01-16 cs.RO 50%

Terrain-Adaptive Mobile 3D Printing with Hierarchical Control

地形自适应移动三维打印与分层控制

Shuangshan Nors Li, J. Nathan Kutz

机构 * Department of Electrical and Computer Engineering, University of Washington, USA(电气与计算机工程系,华盛顿大学) Department of Applied Mathematics, University of Washington, USA(应用数学系,华盛顿大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本研究提出了一种结合人工智能与分层控制的地形自适应移动三维打印框架,通过多传感器融合和闭环控制实现高精度打印与移动性平衡。

Comments Submitted to the 43rd International Symposium on Automation and Robotics in Construction (ISARC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 测试时计算 1 篇

2601.09668 2026-01-16 cs.CV 67%

STEP3-VL-10B Technical Report

STEP3-VL-10B 技术报告

Ailin Huang, Chengyuan Yao, Chunrui Han, Fanqi Wan, Hangyu Guo, Haoran Lv, Hongyu Zhou, Jia Wang, Jian Zhou, Jianjian Sun, Jingcheng Hu, Kangheng Lin, Liang Zhao, Mitt Huang, Song Yuan, Wenwen Qu, Xiangfeng Wang, Yanlin Lai, Yingxiu Zhao, Yinmin Zhang, Yukang Shi, Yuyang Chen, Zejia Weng, Ziyang Meng, Ang Li, Aobo Kong, Bo Dong, Changyi Wan, David Wang, Di Qi, Dingming Li, En Yu, Guopeng Li, Haiquan Yin, Han Zhou, Hanshan Zhang, Haolong Yan, Hebin Zhou, Hongbo Peng, Jiaran Zhang, Jiashu Lv, Jiayi Fu, Jie Cheng, Jie Zhou, Jisheng Yin, Jingjing Xie, Jingwei Wu, Jun Zhang, Junfeng Liu, Kaijun Tan, Kaiwen Yan, Liangyu Chen, Lina Chen, Mingliang Li, Qian Zhao, Quan Sun, Shaoliang Pang, Shengjie Fan, Shijie Shang, Siyuan Zhang, Tianhao You, Wei Ji, Wuxun Xie, Xiaobo Yang, Xiaojie Hou, Xiaoran Jiao, Xiaoxiao Ren, Xiangwen Kong, Xin Huang, Xin Wu, Xing Chen, Xinran Wang, Xuelin Zhang, Yana Wei, Yang Li, Yanming Xu, Yeqing Shen, Yuang Peng, Yue Peng, Yu Zhou, Yusheng Li, Yuxiang Yang, Yuyang Zhang, Zhe Xie, Zhewei Huang, Zhenyi Lu, Zhimin Fan, Zihui Cheng, Daxin Jiang, Qi Han, Xiangyu Zhang, Yibo Zhu, Zheng Ge

机构 * Multimodal Intelligence Team(多模态智能团队)

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract)

AI总结 STEP3-VL-10B 是一个轻量级开源基础模型,通过统一预训练和强化学习策略,在紧凑规模下实现多模态智能,超越大规模模型并在复杂推理任务中表现优异。

Comments 50 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 复杂问题求解 11 篇

2601.09876 2026-01-16 cs.CL 83%

Patient-Similarity Cohort Reasoning in Clinical Text-to-SQL

基于患者相似群体的临床文本到SQL推理

Yifei Shen, Yilun Zhao, Justice Ou, Tinglin Huang, Arman Cohan

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 CLINSQL基准测试集通过多表连接、临床意义过滤和多步骤查询,推动临床可靠的文本到SQL系统发展。

Comments Accepted by EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏