arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-13 至 2026-02-13 共收录 93 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 24 篇

2511.13853 2026-02-13 cs.CV 87%

Can World Simulators Reason? Gen-ViRe: A Generative Visual Reasoning Benchmark

世界模拟器能推理吗?Gen-ViRe:一个生成性视觉推理基准

Xinxin Liu, Zhaopan Xu, Ming Li, Kai Wang, Yong Jae Lee, Yuzhang Shang

机构 * University of Central Florida(中央佛罗里达大学) National University of Singapore(新加坡国立大学) UW-Madison(威斯康星大学麦迪逊分校)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

AI总结 Gen-ViRe提出一个生成性视觉推理基准,通过分解CoF推理为六个认知维度和24个子任务,评估视频模型的推理能力,揭示视觉质量与推理深度的差异。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11170 2026-02-13 cs.CL 83%

PRIME: Policy-Reinforced Iterative Multi-agent Execution for Algorithmic Reasoning in Large Language Models

PRIME:基于策略强化的迭代多智能体执行框架用于大语言模型中的算法推理

Jiawei Xu, Zhenyu Yu, Ziqian Bi, Minh Duc Pham, Xiaoyi Qu, Danyang Zhang

机构 * Purdue University(普渡大学) University of Malaya(马来亚大学) Faculty of Information Technology, Beijing University of Technology(北京理工大学信息学院) School of Computer Science, Georgia Institute of Technology(佐治亚理工学院计算机科学学院) Department of Industrial and Systems Engineering, Lehigh University(莱斯大学工业与系统工程系)

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.CL

AI总结 PRIME通过多智能体框架提升大语言模型在算法推理中的性能,显著提高复杂任务的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11176 2026-02-13 cs.CL cs.AI cs.CE cs.LG 82%

Evaluating Few-Shot Temporal Reasoning of LLMs for Human Activity Prediction in Smart Environments

评估LLM在智能环境中的少样本时间推理用于人类活动预测

Maral Doctorarastoo, Katherine A. Flanigan, Mario Bergés, Christopher McComb

机构 * organization= Department of Civil \& Environmental Engineering, Carnegie Mellon University , addressline= 5000 Forbes Ave , city= Pittsburgh , state= PA , postcode= 15213 , country= USA organization= Department of Mechanical Engineering, Carnegie Mellon University , addressline= 5000 Forbes Ave , city= Pittsburgh , state= PA , postcode= 15213 , country= USA

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了预训练语言模型在智能环境中的少样本时间推理能力,通过评估其在人类活动预测中的表现,发现其在低数据环境下具备强大的时间理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24836 2026-02-13 cs.AI cs.CL cs.LG 82%

Logical Structure as Knowledge: Enhancing LLM Reasoning via Structured Logical Knowledge Density Estimation

逻辑结构作为知识:通过结构化逻辑知识密度估计增强LLM推理

Zhen Bi, Zhenlin Hu, Xueshu Chen, Mingyang Chen, Cheng Deng, Yida Xue, Zhen Wang, Qing Shen, Ningyu Zhang, Jungang Lou

机构 * Huzhou University(湖州大学) Zhejiang Key Laboratory of Intelligent Education Technology and Application(浙江智能教育技术与应用重点实验室) Banbu AI Foundation(Banbu AI基金会) Baichuan Inc(白川公司) University of Edinburgh(爱丁堡大学) Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过结构化逻辑知识密度估计提升LLM推理能力,通过增强逻辑密度而非扩大数据量来提高模型认知潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12196 2026-02-13 cs.CL cs.AI 81%

Visual Reasoning Benchmark: Evaluating Multimodal LLMs on Classroom-Authentic Visual Problems from Primary Education

视觉推理基准:评估多模态大语言模型在小学课堂真实视觉问题上的能力

Mohamed Huti, Alasdair Mackintosh, Amy Waldock, Dominic Andrews, Maxime Lelièvre, Moritz Boos, Tobias Murray, Paul Atherton, Robin A. A. Ince, Oliver G. B. Garrod

机构 * Fab AI

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出视觉推理基准,用于评估多模态大语言模型在小学课堂真实视觉问题上的能力,揭示模型在静态与动态任务上的能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12143 2026-02-13 cs.AI cs.LG 81%

STAR : Bridging Statistical and Agentic Reasoning for Large Model Performance Prediction

STAR:连接统计推理与代理推理以提升大模型性能预测

Xiaoxiao Wang, Chunxiao Li, Junying Wang, Yijin Guo, Zijian Chen, Chunyi Li, Xiaohong Liu, Zicheng Zhang, Guangtao Zhai

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 STAR框架通过结合统计推理与代理推理,有效提升大模型性能预测的准确性与可靠性,尤其在数据稀疏情况下表现突出。

Comments 10 pages, 8 figures, 17 tables. Code available at https://github.com/xiaoxiaostudy/star

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15414 2026-02-13 cs.AI 79%

MARSHAL: Incentivizing Multi-Agent Reasoning via Self-Play with Strategic LLMs

通过战略性大语言模型的自我对战激励多智能体推理的MARSHAL

Huining Yuan, Zelai Xu, Zheyue Tan, Xiangmin Yi, Mo Guang, Kaiwen Long, Haojia Hui, Boxun Li, Xinlei Chen, Bo Zhao, Xiao-Ping Zhang, Chao Yu, Yu Wang

机构 * SIGS, Tsinghua University(清华大学信号与系统系) EE, Tsinghua University(清华大学电子工程系) Aalto University(阿alto大学) Li Auto Inc.(李汽车公司) Infinigence AI Project Page Code Models(Infinigence AI项目页面代码模型)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 MARSHAL通过战略性LLM的自我对战激励多智能体推理,实现多智能体系统的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11451 2026-02-13 cs.CL 79%

LoopFormer: Elastic-Depth Looped Transformers for Latent Reasoning via Shortcut Modulation

LoopFormer: 基于快捷键调制的弹性深度循环变换器用于潜在推理

Ahmadreza Jeddi, Marco Ciccone, Babak Taati

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) University Health Network(大学健康网络)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 LoopFormer通过弹性深度循环变换器实现基于快捷键调制的潜在推理,具备适应不同计算预算的鲁棒性与扩展性。

Comments ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11409 2026-02-13 cs.AI 74%

TRACER: Trajectory Risk Aggregation for Critical Episodes in Agentic Reasoning

TRACER:轨迹风险聚合用于代理推理中的关键事件

Sina Tayebati, Divake Kumar, Nastaran Darabi, Davide Ettori, Ranganath Krishnan, Amit Ranjan Trivedi

机构 * University of Illinois at Chicago(伊利诺伊大学芝加哥分校) AI Labs at Capital One(Capital One 人工智能实验室)

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 TRACER通过轨迹级不确定性度量提升复杂对话工具使用中的不确定性检测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11730 2026-02-13 cs.CV 71%

STVG-R1: Incentivizing Instance-Level Reasoning and Grounding in Videos via Reinforcement Learning

STVG-R1: 通过强化学习激励视频中实例级推理与 grounding

Xiaowen Zhang, Zhi Gao, Licheng Jiao, Lingling Li, Qing Li

机构 * Xidian University(西电大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) Beijing Institute of Technology(北京理工大学)

专题命中 推理评测 :reasoning(title)

AI总结 STVG-R1通过强化学习框架提升视频中实例级推理与 grounding 的准确性,实现显著的性能提升和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11964 2026-02-13 cs.AI 70%

Gaia2: Benchmarking LLM Agents on Dynamic and Asynchronous Environments

Gaia2:在动态和异步环境中评估大语言模型代理的基准测试

Romain Froger, Pierre Andrews, Matteo Bettini, Amar Budhiraja, Ricardo Silveira Cabral, Virginie Do, Emilien Garreau, Jean-Baptiste Gaya, Hugo Laurençon, Maxime Lecanu, Kunal Malkan, Dheeraj Mekala, Pierre Ménard, Gerard Moreno-Torres Bertran, Ulyana Piterbarg, Mikhail Plekhanov, Mathieu Rita, Andrey Rusakov, Vladislav Vorotilov, Mengjue Wang, Ian Yu, Amine Benhalloum, Grégoire Mialon, Thomas Scialom

专题命中 推理评测 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 Gaia2通过动态和异步环境评估大语言模型代理,揭示了推理、效率和鲁棒性之间的权衡,为代理系统的发展提供灵活的基础设施。

Comments Accepted as Oral at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00772 2026-02-13 cs.DB cs.LG stat.AP 70%

Reliable Curation of EHR Dataset via Large Language Models under Environmental Constraints

通过环境约束下的大型语言模型可靠地整理EHR数据集

Raymond M. Xiong, Panyu Chen, Tianze Dong, Jian Lu, Louis Hu, Nathan Yu, Benjamin Goldstein, Danyang Zhuo, Anru R. Zhang

机构 * Duke University(杜克大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 CELEC通过环境约束下的大型语言模型可靠地整理EHR数据集,提升数据提取和分析的准确性和隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16390 2026-02-13 cs.CL cs.AI cs.LG 67%

A Large-Scale Benchmark for Evaluating Large Language Models on Medical Question Answering in Romanian

面向罗马尼亚语医疗问答的大型基准测试

Ana-Cristina Rogoz, Radu Tudor Ionescu, Alexandra-Valentina Anghel, Ionut-Lucian Antone-Iordache, Simona Coniac, Andreea Iuliana Ionescu

机构 * University of Bucharest(布加勒斯特大学) Colţea Clinical Hospital(科尔切亚临床医院) Hospice Hope Bucharest(希望临终关怀布加勒斯特医院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出首个罗马尼亚语医疗问答基准测试MedQARo,评估了多种LLM在医疗问答任务中的表现,发现微调模型在泛化能力上优于零样本模型。

Comments Accepted in npj Digital Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13779 2026-02-13 cs.CL cs.AI cs.LG 67%

NewsInterview: a Dataset and a Playground to Evaluate LLMs' Ground Gap via Informational Interviews

NewsInterview: 一个用于通过信息性访谈评估LLM地面间隙的数据集和游乐场

Alexander Spangher, Michael Lu, Sriya Jeslyn Kalyan, Hyundong Justin Cho, Weiyan Shi, Jonathan May

机构 * University of California, Berkeley(加州大学伯克利分校) University of Southern California(南加州大学) Information Sciences Institute(信息科学研究所) Northeastern University(东北大学)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 NewsInterview通过信息性访谈数据集和模拟环境,揭示LLMs在战略对话和多轮规划方面的能力不足,强调需提升其对话策略与说服力。

Comments Accepted at ACL 2025: https://aclanthology.org/2025.acl-long.1580/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10664 2026-02-13 cs.CL cs.AI 62%

Evaluating Modern Large Language Models on Low-Resource and Morphologically Rich Languages:A Cross-Lingual Benchmark Across Cantonese, Japanese, and Turkish

评估现代大语言模型在低资源和形态丰富的语言上的表现:跨语言基准测试在粤语、日语和土耳其语之间

Chengxuan Xia, Qianye Wu, Hongbin Guan, Sixuan Tian, Yilun Hao, Xiaoyu Wu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了七种先进LLMs在粤语、日语和土耳其语上的表现,发现专有模型在多语言任务中表现优异,但文化理解和形态泛化仍有不足。

Comments This paper requires XeLaTeX for proper Unicode rendering of Japanese and Cantonese text

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14182 2026-02-13 cs.CL cs.LG 62%

LabSafety Bench: Benchmarking LLMs on Safety Issues in Scientific Labs

LabSafety Bench: 对科学实验室中AI安全问题的LLM基准测试

Yujun Zhou, Jingdong Yang, Yue Huang, Kehan Guo, Zoe Emory, Bikram Ghosh, Amita Bedar, Sujay Shekar, Zhenwen Liang, Pin-Yu Chen, Tian Gao, Werner Geyer, Nuno Moniz, Nitesh V Chawla, Xiangliang Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 LabSafety Bench通过评估LLMs和VLMs在实验室安全问题上的表现,揭示了当前模型在危险识别和风险评估方面的不足,强调了对AI安全评估框架的迫切需求。

Comments Published at Nature Machine Intelligence

Journal ref Nat Mach Intell 8, 20-31 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11700 2026-02-13 cs.LG cs.AI 62%

TabSieve: Explicit In-Table Evidence Selection for Tabular Prediction

TabSieve: 表格内证据选择用于表格预测

Yongyao Wang, Ziqi Miao, Lu Yang, Haonan Jia, Wenting Yan, Chen Qian, Lijun Li

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 TabSieve通过显式选择表格内证据提升预测性能,采用强化学习优化证据选择与预测正确性,实验显示在分类和回归任务中均取得显著提升。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10081 2026-02-13 cs.CL cs.AI 62%

Anagent For Enhancing Scientific Table & Figure Analysis

一个增强科学表格及图表分析的代理

Xuehang Guo, Zhiyong Lu, Tom Hope, Qingyun Wang

机构 * College of William \& Mary The Allen Institute for AI (AI2)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Anagent通过多代理框架提升科学表格及图表分析的准确性和效率,实现显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12056 2026-02-13 cs.AI 57%

LawThinker: A Deep Research Legal Agent in Dynamic Environments

LawThinker: 动态环境中的一种深度法律研究代理

Xinyu Yang, Chenlong Deng, Tongyu Wen, Binyu Xie, Zhicheng Dou

机构 * Renmin University of China(中国人民大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 LawThinker是一种用于动态司法环境的自主法律研究代理,通过探索-验证-记忆策略提升法律推理的准确性和程序合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11898 2026-02-13 cs.CL 57%

Benchmark Illusion: Disagreement among LLMs and Its Scientific Consequences

基准幻觉:大语言模型之间的分歧及其科学后果

Eddie Yang, Dashun Wang

机构 * Department of Political Science, Purdue University(政治学系,普渡大学) Kellogg School of Management, Center for Science of Science and Innovation, Northwestern Innovation Institute, Ryan Institute on Complexity, and McCormick School of Engineering(凯洛格管理学院、科学与创新中心、西北创新研究所、复杂性研究院以及麦科马克工程学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究揭示大语言模型在基准测试中存在显著分歧,影响科学可重复性,指出模型选择对研究结果有重要影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11412 2026-02-13 cs.CY cs.AI cs.HC 57%

When Visibility Outpaces Verification: Delayed Verification and Narrative Lock-in in Agentic AI Discourse

当可见性超越验证:代理AI discourse中的延迟验证与叙述锁定

Hanjing Shi, Dominic DiFranzo

机构 * Lehigh University(莱文大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文研究了代理AI讨论中可见性与验证时间的关系,揭示了高可见度讨论因延迟验证导致的叙述锁定现象,并提出知识摩擦作为平衡平台的干预措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07011 2026-02-13 cs.CV cs.AI eess.IV 57%

MAU-GPT: Enhancing Multi-type Industrial Anomaly Understanding via Anomaly-aware and Generalist Experts Adaptation

MAU-GPT:通过异常感知和通用专家适应增强多类型工业异常理解

Zhuonan Wang, Zhenxuan Fan, Siwen Tan, Yu Zhong, Yuqian Yuan, Haoyuan Li, Hao Jiang, Wenqiao Zhang, Feifei Shao, Hongwei Wang, Jun Xiao

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 MAU-GPT通过异常感知和通用专家适应机制,提升多类型工业异常理解的性能,实现更高效的质量控制。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02182 2026-02-13 cs.CL 57%

Evaluating Metalinguistic Knowledge in Large Language Models across the World's Languages

在世界各语言中评估大型语言模型的元语言知识

Tjaša Arčon, Matej Klemen, Marko Robnik-Šikonja, Kaja Dobrovoljc

机构 * University of Ljubljana, Faculty of Computer and Information Science(卢布尔雅那大学计算机与信息科学学院) University of Ljubljana, Faculty of Arts(卢布尔雅那大学艺术学院) Jožef Stefan Institute(乔塞夫·斯塔芬研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过跨语言评估揭示LLM在元语言知识上的局限性,发现其表现受数据可用性和语言资源影响,而非广泛语法能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04988 2026-02-13 cs.CV cs.AI 57%

Remote Sensing Retrieval-Augmented Generation: Bridging Remote Sensing Imagery and Comprehensive Knowledge with a Multi-Modal Dataset and Retrieval-Augmented Generation Model

遥感检索增强生成:通过多模态数据集和检索增强生成模型连接遥感图像与综合知识

Congcong Wen, Yiting Lin, Xiaokang Qu, Nan Li, Yong Liao, Xiang Li, Hui Lin

机构 * School of Cyber Science and Technology, University of Science and Technology of China(信息科学技术学院,中国科学技术大学) China Academy of Electronics and Information Technology(电子信息技术研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出RS-RAG框架,通过多模态数据集和检索增强生成模型,提升遥感图像与综合知识的连接能力,有效提升复杂查询的语义推理性能。

Comments Accepted by IEEE Geoscience and Remote Sensing Magazine (GRSM)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 9 篇

2602.11530 2026-02-13 cs.LG cs.AR 85%

PASCAL: A Phase-Aware Scheduling Algorithm for Serving Reasoning-based Large Language Models

PASCAL:一种面向推理型大语言模型的服务调度算法

Eunyeong Cho, Jehyeon Bang, Ranggi Hwang, Minsoo Rhu

机构 * KAIST(韩国科学技术院)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 PASCAL通过优先处理推理阶段和控制回答阶段的令牌节奏,有效降低了推理型大语言模型的TTFT并保持服务等级目标。

Comments Accepted for publication at the 32nd IEEE International Symposium on High-Performance Computer Architecture (HPCA-32), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12013 2026-02-13 cs.AI 79%

InjectRBP: Steering Large Language Model Reasoning Behavior via Pattern Injection

InjectRBP: 通过模式注入引导大语言模型推理行为

Xiuping Wu, Zhao Yu, Yuxin Cheng, Ngai Wong, Liangjun Ke, Tapas Mishra, Konstantinos V. Katsikopoulos

机构 * Xi'an Jiaotong University(西安交通大学) University of Southampton(南安普顿大学) University of Hongkong(香港大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 InjectRBP通过注入行为模式提升大语言模型推理能力,无需参数更新,实验显示在多种推理任务中性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11455 2026-02-13 cs.AI 79%

Credit Where It is Due: Cross-Modality Connectivity Drives Precise Reinforcement Learning for MLLM Reasoning

应得之 credit:跨模态连接驱动精确强化学习用于 MLLM 推理

Zhengbo Jiao, Shaobo Wang, Zifan Zhang, Wei Wang, Bing Zhao, Hu Wei, Linfeng Zhang

机构 * AI DATA, Alibaba Group Holding Limited(阿里数据,阿里巴巴集团控股有限公司) EPIC Lab, SJTU(EPIC实验室,上海交通大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 通过跨模态连接驱动精确强化学习,提升多模态大语言模型的推理能力,仅引入1.2%开销即超越基线模型。

Comments 20pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12064 2026-02-13 cs.DB 78%

DIVER: A Robust Text-to-SQL System with Dynamic Interactive Value Linking and Evidence Reasoning

DIVER: 一种具有动态交互值链接和证据推理的鲁棒文本到SQL系统

Yafeng Nan, Haifeng Sun, Zirui Zhuang, Qi Qi, Guojun Chu, Jianxin Liao, Dan Pei, Jingyu Wang

专题命中 其他推理 :reasoning(title,abstract)

AI总结 DIVER通过动态交互值链接和证据推理,提升文本到SQL系统的鲁棒性,实验显示其在执行准确率和验证效率分数上均有显著提升。

Comments Accepted by SIGMOD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12108 2026-02-13 cs.AI 57%

The Pensieve Paradigm: Stateful Language Models Mastering Their Own Context

Pensieve范式:具备状态的语言模型掌握自身上下文

Xiaoyuan Liu, Tian Liang, Dongyang Ma, Deyu Zhou, Haitao Mi, Pinjia He, Yan Wang

机构 * Tencent AI Lab(腾讯人工智能实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 StateLM 通过内部推理循环和记忆工具,使语言模型具备状态管理能力,从而在长文档问答、聊天记忆和深度研究任务中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11651 2026-02-13 cs.CR cs.AI 57%

DMind-3: A Sovereign Edge--Local--Cloud AI System with Controlled Deliberation and Correction-Based Tuning for Safe, Low-Latency Transaction Execution

DMind-3:一种主权边缘-本地-云AI系统,具备受控推理与基于纠正的调优,用于安全低延迟交易执行

Enhao Huang, Frank Li, Tony Lin, Lowes Yang

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 DMind-3通过边缘-本地-云三层架构,结合受控推理与纠正调优,实现安全低延迟的交易执行,提升金融执行的可靠性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏