arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-01-08 至 2026-01-08 共收录 99 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 18 篇

2601.04191 2026-01-08 cs.RO cs.AI 57%

Embedding Autonomous Agents in Resource-Constrained Robotic Platforms

在资源受限的机器人平台上嵌入自主代理

Negar Halakou, Juan F. Gutierrez, Ye Sun, Han Jiang, Xueming Wu, Yilun Song, Andres Gomez

机构 * Institut für Datentechnik und Kommunikationsnetze, TU Braunschweig(数据技术与通信网络研究所, Braunschweig 技术大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究在资源受限的机器人平台上嵌入自主代理,通过AgentSpeak编程实现迷宫探索,展示高效推理过程适用于实时自主操作。

Comments This is an open-access, author-archived version of a manuscript published in European Conference on Multi-Agent Systems 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04056 2026-01-08 cs.CL 57%

Bridging the Discrete-Continuous Gap: Unified Multimodal Generation via Coupled Manifold Discrete Absorbing Diffusion

弥合离散-连续鸿沟:通过耦合流形离散吸收扩散实现统一多模态生成

Yuanfeng Xu, Yuhao Chen, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Lab of Big Data Analysis & Processing(广东省大数据分析与处理重点实验室) X-Era AI Lab(X-Era AI实验室)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 CoM-DAD通过耦合流形离散吸收扩散框架,实现离散与连续数据的统一多模态生成,解决多模态对齐与训练稳定性问题。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03775 2026-01-08 cs.CL 57%

Do LLM Self-Explanations Help Users Predict Model Behavior? Evaluating Counterfactual Simulatability with Pragmatic Perturbations

LLM自我解释是否有助于用户预测模型行为?通过语用扰动评估反事实可模拟性

Pingjun Hong, Benjamin Roth

机构 * Faculty of Computer Science, University of Vienna(计算机科学系,维也纳大学) UniVie Doctoral School Computer Science, University of Vienna(UniVie 计算机科学博士学院,维也纳大学) Faculty of Philological and Cultural Studies, University of Vienna(文学与文化研究系,维也纳大学)

专题命中 规划推理 :chain-of-thought(abstract);分类 cs.CL

AI总结 本文通过语用扰动评估LLM自我解释对用户预测模型行为的帮助,发现自我解释能提升模拟准确性,但效果受扰动策略和评判者能力影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03662 2026-01-08 cs.AI 57%

How Does the Thinking Step Influence Model Safety? An Entropy-based Safety Reminder for LRMs

思考步骤如何影响模型安全性?一种基于熵的安全提醒机制用于大型推理模型

Su-Hyeon Kim, Hyundong Jin, Yejin Lee, Yo-Sub Han

机构 * Yonsei University(延世大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SafeRemind,一种通过熵触发在推理过程中动态注入安全提醒短语,提升大型推理模型安全性的解码时防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03475 2026-01-08 cs.AI 57%

CPGPrompt: Translating Clinical Guidelines into LLM-Executable Decision Support

CPGPrompt:将临床指南转化为LLM可执行的决策支持

Ruiqi Deng, Geoffrey Martin, Tony Wang, Gongbo Zhang, Yi Liu, Chunhua Weng, Yanshan Wang, Justin F Rousseau, Yifan Peng

机构 * Information Science (Health Tech), Cornell Tech, New York, NY, USA(信息科学(健康科技),康奈尔科技,纽约,纽约州) Systems Engineering, Cornell University, Ithaca, NY, USA(系统工程,康奈尔大学,伊萨卡,纽约州) Population Health Sciences, Weill Cornell Medicine, New York, NY, USA(人口健康科学,韦尔医学院,纽约,纽约州) Computer and Information Science, Cornell University, Ithaca, NY, USA(计算机与信息科学,康奈尔大学,伊萨卡,纽约州) Department of Biomedical Informatics, Columbia University, New York, NY, USA(生物医学信息学系,哥伦比亚大学,纽约,纽约州) Department of Medicine, Weill Cornell Medicine, New York, NY, USA(医学系,韦尔医学院,纽约,纽约州) Department of Health Information Management, University of Pittsburgh, Pittsburgh, PA, USA(健康信息管理系,匹兹堡大学,匹兹堡,宾夕法尼亚州) Clinical and Translational Science Institute, University of Pittsburgh, Pittsburgh, PA, USA(临床与转化科学研究所,匹兹堡大学,匹兹堡,宾夕法尼亚州) Department of Neurology, UT Southwestern Medical Center, Dallas, TX, USA(神经病学系,德克萨斯西南医学中心,达拉斯,德克萨斯州) Peter O’Donnell Jr. Brain Institute, UT Southwestern Medical Center, Dallas, TX, USA(彼得·奥·donnell Jr.脑研究所,德克萨斯西南医学中心,达拉斯,德克萨斯州) Clinical Informatics Center, University of Texas Southwestern Medical Center, Dallas, USA(临床信息学中心,德克萨斯西南医学中心,达拉斯,美国) Institute of Artificial Intelligence for Digital Health, Weill Cornell Medicine, New York, NY USA(数字健康人工智能研究所,韦尔医学院,纽约,纽约州)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 CPGPrompt通过将临床指南转化为LLM可执行的结构化决策树,实现对患者病例的高效评估,提升了专科转诊和路径分类的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03436 2026-01-08 astro-ph.IM cs.AI 57%

MARVEL: A Multi Agent-based Research Validator and Enabler using Large Language Models

MARVEL:基于大语言模型的多智能体研究验证器与促进器

Nikhil Mukund, Yifang Luo, Fan Zhang, Lisa Barsotti, Erik Katsavounidis

机构 * MIT Kavli Institute for Astrophysics and Space Research and LIGO Laboratory(麻省理工学院凯斯利天文与空间研究所及LIGO实验室) Massachusetts Institute of Technology(麻省理工学院) State Key Laboratory of Ocean Sensing & Ocean College(海洋传感国家重点实验室) Zhejiang University(浙江大学) NSF AI Institute for Artificial Intelligence and Fundamental Interactions (IAIFI)(国家科学基金会人工智能与基本相互作用研究所) Cambridge, MA, USA(美国马萨诸塞州剑桥市)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 MARVEL通过结合快速查询路径和深度搜索模式,为科学领域提供可部署的验证器,其在探测器操作内容上显著优于GPT-4o基线。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03376 2026-01-08 cs.LG 57%

Weather-Aware Transformer for Real-Time Route Optimization in Drone-as-a-Service Operations

考虑天气的变换器用于无人机即服务操作中的实时路线优化

Kamal Mohamed, Lillian Wassim, Ali Hamdi, Khaled Shaban

机构 * Dept. of Computer Science, Qatar University, Doha, Qatar(计算机科学系,卡塔尔大学,多哈)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出一种天气感知的变换器框架,用于实时优化无人机即服务操作的路线,通过天气启发式方法提升动态环境下的路由决策效率与安全性。

Comments 2025 IEEE/ACS 22nd International Conference on Computer Systems and Applications (AICCSA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02110 2026-01-08 cs.AI 57%

Attractive Metadata Attack: Inducing LLM Agents to Invoke Malicious Tools

吸引性元数据攻击:诱导LLM代理调用恶意工具

Kanghua Mo, Li Hu, Yucheng Long, Zhihao Li

机构 * Cyberspace Institute of Advanced Technology, Guangzhou University(广州大学网络空间研究院) Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电子与电气工程系)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出AMA攻击,通过操纵工具元数据诱导LLM代理调用恶意工具,揭示了系统性安全漏洞。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03655 2026-01-08 cs.CV 50%

VideoMemory: Toward Consistent Video Generation via Memory Integration

VideoMemory: 通过记忆整合实现一致的视频生成

Jinsong Zhou, Yihua Du, Xinli Xu, Luozhou Wang, Zijie Zhuang, Yehang Zhang, Shuaibo Li, Xiaojun Hu, Bolan Su, Ying-cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) ByteDance(字节跳动)

专题命中 规划推理 :planning(abstract)

AI总结 VideoMemory通过动态记忆库整合叙事规划与视觉生成,实现多镜头中角色、道具和环境的一致性生成。

Comments Project page: https://hit-perfect.github.io/VideoMemory/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27251 2026-01-08 cs.MA 50%

FinPos: A Position-Aware Trading Agent System for Real Financial Markets

FinPos:一种面向真实金融市场的位置感知交易代理系统

Bijia Liu, Ronghao Dang

专题命中 规划推理 :reasoning(abstract)

AI总结 FinPos提出了一种位置感知的交易代理系统,通过专业信息解读、双代理决策结构和多时间尺度奖励信号,提升对连续仓位的管理能力,实验证明其在真实市场条件下的优越性。

Comments LLM Applications, LLM Agents, Financial Technology

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 6 篇

2601.03956 2026-01-08 cs.RO 67%

CoINS: Counterfactual Interactive Navigation via Skill-Aware VLM

基于技能感知的反事实交互导航:通过技能感知视觉语言模型

Kangjie Zhou, Zhejia Wen, Zhiyong Zhuo, Zike Yan, Pengying Wu, Ieng Hou U, Shuaiyang Li, Han Gao, Kang Ding, Wenhan Cao, Wei Pan, Chang Liu

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(香港中文大学机械与自动化工程系) College of Design and Engineering, National University Of Singapore(新加坡国立大学设计与工程学院) Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 CoINS通过整合技能感知推理与稳健执行,提升机器人在复杂环境中的交互导航能力。

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01513 2026-01-08 cs.CV cs.AI 57%

FastV-RAG: Towards Fast and Fine-Grained Video QA with Retrieval-Augmented Generation

FastV-RAG: 向快速且细粒度的视频问答迈进:基于检索增强生成的框架

Gen Li, Peiyu Liu

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) University of International Business and Economics(国际商务经济大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 FastV-RAG通过引入推测解码和基于相似性的过滤策略,提升视频问答任务的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07344 2026-01-08 cs.DC cs.AI 57%

Venus: An Efficient Edge Memory-and-Retrieval System for VLM-based Online Video Understanding

Venus: 一种高效的边缘内存与检索系统用于基于VLM的在线视频理解

Shengyuan Ye, Bei Ouyang, Tianyi Qian, Liekang Zeng, Mu Yuan, Xiaowen Chu, Weijie Hong, Xu Chen

机构 * School of Computer Science and Engineering, Sun Yat-sen University, Guangzhou, China(计算机科学与工程学院,中山大学,广州,中国) Department of Information Engineering, The Chinese University of Hong Kong, Hong Kong SAR, China(信息工程系,香港中文大学,香港特别行政区,中国) Shenzhen Smart City Communications Co., Ltd., China(深圳智慧城市通信有限公司,中国)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 Venus提出了一种高效的边缘内存与检索系统,通过边缘-云解耦架构实现快速的在线视频理解,显著降低系统开销并提升响应速度。

Comments Accepted by IEEE International Conference on Computer Communications 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03713 2026-01-08 cs.CV 50%

BREATH-VL: Vision-Language-Guided 6-DoF Bronchoscopy Localization via Semantic-Geometric Fusion

BREATH-VL:基于视觉-语言引导的6自由度支气管镜定位:通过语义-几何融合

Qingyao Tian, Bingyu Yang, Huai Liao, Xinyan Huang, Junyong Li, Dong Yi, Hongbin Liu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Department of Pulmonary and Critical Care Medicine, The First Affiliated Hospital of Sun Yat-sen University(中山大学附属第一医院呼吸与危重症医学科) Centre of AI and Robotics, Hong Kong Institute of Science & Innovation, Chinese Academy of Sciences(香港科学院人工智能与机器人中心) School of Biomedical Engineering and Imaging Sciences, King’s College London(伦敦国王学院生物医学工程与影像科学学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 BREATH-VL通过融合语义和几何信息,实现高精度的6自由度支气管镜定位,减少定位误差并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03449 2026-01-08 cs.RO 50%

FIRE-VLM: A Vision-Language-Driven Reinforcement Learning Framework for UAV Wildfire Tracking in a Physics-Grounded Fire Digital Twin

FIRE-VLM:一种基于视觉-语言驱动的强化学习框架,用于在物理基础火灾数字孪生中无人机火灾跟踪

Chris Webb, Mobin Habibpour, Mayamin Hamid Raha, Ali Reza Tavakkoli, Janice Coen, Fatemeh Afghah

机构 * Clemson University(克莱姆森大学) University of Nevada, Reno(内华达大学拉斯维加斯分校) NSF NCAR(国家科学基金会NCAR)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 FIRE-VLM是一种基于视觉-语言模型的强化学习框架,用于在物理基础火灾数字孪生中实现无人机火灾跟踪,通过结合物理术语与VLM语义的奖励设计,提升了火灾检测效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13683 2026-01-08 cs.CV 50%

I-Scene: 3D Instance Models are Implicit Generalizable Spatial Learners

I-Scene: 3D实例模型是隐式可泛化的空间学习者

Lu Ling, Yunhao Ge, Yichen Sheng, Aniket Bera

机构 * Purdue University(普渡大学) NVIDIA Research(英伟达研究)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 I-Scene提出了一种基于3D实例模型的隐式空间学习方法,通过重新编程生成器实现跨场景的泛化能力,展示了其在空间推理和生成中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 4 篇

2510.13935 2026-01-08 cs.CL cs.AI 84%

Big Reasoning with Small Models: Instruction Retrieval at Inference Time

大模型的推理:推理时的指令检索

Kenan Alkiek, David Jurgens, Vinod Vydiswaran

机构 * School of Information University of Michigan(信息学院 华盛顿大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种在推理时通过检索结构化指令来增强小型模型推理能力的方法,通过领域背景与分步程序的配对,提升模型在医学、法律和数学等领域的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03605 2026-01-08 cs.CL 79%

DiVA: Fine-grained Factuality Verification with Agentic-Discriminative Verifier

DiVA: 基于代理-判别验证器的细粒度事实性验证

Hui Huang, Muyun Yang, Yuki Arase

机构 * Harbin Institute of Technology(哈尔滨工业大学) Institute of Science Tokyo(东京科学研究所)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.CL

AI总结 DiVA通过结合生成模型和判别模型的能力,提出了一种细粒度事实性验证方法,并构建了FGVeriBench基准,有效提升了事实性验证的精度和适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11963 2026-01-08 cs.CL 57%

ToolRM: Outcome Reward Models for Tool-Calling Large Language Models

ToolRM: 用于工具调用大型语言模型的成果奖励模型

Mayank Agarwal, Ibrahim Abdelaziz, Kinjal Basu, Merve Unuvar, Luis A. Lastras, Yara Rizk, Pavan Kapanipathi

机构 * IBM Research(IBM研究院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 ToolRM通过领域特定建模提升工具调用奖励模型性能,实现25%的改进并增强鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03725 2026-01-08 cs.LG 57%

EDCO: Dynamic Curriculum Orchestration for Domain-specific Large Language Model Fine-tuning

EDCO:面向领域特定大语言模型微调的动态课程编排

Jing-Cheng Pang, Liu Sun, Chang Zhou, Xian Tang, Haichuan Ma, Kun Jiang, Jianlong Wang, Kai Zhang, Sijie Wu, Haoran Cai, Chenwei Wu, Xubin Li, Xin Chen

机构 * Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.LG

AI总结 EDCO通过动态课程编排和熵估计提升领域特定大语言模型微调效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 11 篇

2601.03717 2026-01-08 cs.CL 88%

MIND: From Passive Mimicry to Active Reasoning through Capability-Aware Multi-Perspective CoT Distillation

MIND:通过能力感知的多视角CoT蒸馏从被动模仿到主动推理

Jin Cui, Jiaqi Guo, Jiepeng Zhou, Ruixuan Yang, Jiayi Lu, Jiajun Xu, Jiangcheng Song, Boran Zhao, Pengju Ren

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, National Engineering Research Center for Visual Information and Applications, and Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人机混合增强智能国家重点实验室、视觉信息与应用国家工程研究中心、人工智能与机器人研究所) Nankai University(南开大学) The Hong Kong University of Science and Technology(Guangzhou)(香港科技大学(广州)) School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件学院)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(title);chain-of-thought(abstract);分类 cs.CL

AI总结 MIND通过能力感知的多视角CoT蒸馏,从被动模仿转向主动推理,提升模型在分布内和分布外任务中的性能。

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17306 2026-01-08 cs.CV 85%

Deep But Reliable: Advancing Multi-turn Reasoning for Thinking with Images

深度但可靠:提升图像思考的多轮推理

Wenhao Yang, Yu Xia, Jinlong Huang, Shiyin Lu, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Yuanyu Wan, Lijun Zhang

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 DRIM通过多阶段流程提升图像思考的多轮推理能力,通过冗余惩罚策略优化实现自我反思的推理模式,从而在视觉理解任务中取得优越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03537 2026-01-08 cs.AI cs.CL 81%

STAR-S: Improving Safety Alignment through Self-Taught Reasoning on Safety Rules

通过安全规则的自教推理提升安全性

Di Wu, Yanyan Zhao, Xin Lu, Mingzhe Li, Bing Qin

机构 * Research Center for Social Computing and Information Retrieval(社会计算与信息检索研究中心) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 STAR-S通过自教推理提升大型语言模型的安全性,有效防御对抗攻击。

Comments 19 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07198 2026-01-08 cs.CV cs.CL 79%

Generating Storytelling Images with Rich Chains-of-Reasoning

通过丰富的推理链生成叙事图像

Xiujie Song, Qi Jia, Shota Watanabe, Xiaoyi Pang, Ruijie Chen, Mengyue Wu, Kenny Q. Zhu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, China(X-LANCE实验室,计算机科学学院,上海交通大学,中国) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室,中国) East China University of Technology, China(东华大学,中国) University of Texas at Arlington, USA(德克萨斯大学阿灵顿分校,美国)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出StorytellingPainter,通过结合大语言模型推理与文本到图像合成,生成具有丰富推理链的叙事图像,并引入评估框架和轻量级模型以提升生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04301 2026-01-08 cs.LG cs.AR 79%

The Cost of Dynamic Reasoning: Demystifying AI Agents and Test-Time Scaling from an AI Infrastructure Perspective

动态推理的成本:从AI基础设施视角解密AI代理与测试时扩展

Jiin Kim, Byeongjun Shin, Jinha Chung, Minsoo Rhu

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 本文从AI基础设施视角解密AI代理与测试时扩展,揭示动态推理带来的高成本与可持续性问题,呼吁转向计算高效的代理设计。

Comments Accepted for publication at the 32nd IEEE International Symposium on High-Performance Computer Architecture (HPCA-32), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04060 2026-01-08 cs.AI 74%

ComfySearch: Autonomous Exploration and Reasoning for ComfyUI Workflows

ComfySearch: 为ComfyUI工作流实现自主探索与推理

Jinwei Su, Qizhen Lan, Zeyu Wang, Yinghui Xia, Hairu Wen, Yiqun Duan, Xi Xiao, Tianyu Shi, Yang Jingsong, Lewei He

机构 * ComfyUI

专题命中 复杂问题求解 :reasoning(title);分类 cs.AI

AI总结 ComfySearch通过验证引导的工作流构建,有效提升ComfyUI工作流的通过率和解决方案率,适用于复杂创意任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03743 2026-01-08 cs.CL cs.AI 62%

O-Researcher: An Open Ended Deep Research Model via Multi-Agent Distillation and Agentic RL

O-Researcher: 通过多智能体蒸馏和智能体强化学习构建开放式深度研究模型

Yi Yao, He Zhu, Piaohong Wang, Jincheng Ren, Xinlong Yang, Qianben Chen, Xiaowan Li, Dingfeng Shi, Jiaxian Li, Qiexiang Wang, Sinuo Wang, Xinpeng Liu, Jiaqi Wu, Minghao Liu, Wangchunshu Zhou

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 O-Researcher通过多智能体蒸馏和智能体强化学习,构建开放式深度研究模型,实现开源模型在多个基准上的性能提升。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03483 2026-01-08 cs.CL cs.CY cs.LG 62%

CALM: Culturally Self-Aware Language Models

CALM:具有文化自感知能力的语言模型

Lingzhi Shen, Xiaohao Cai, Yunfei Long, Imran Razzak, Guanming Chen, Shoaib Jameel

机构 * University of Southampton(索姆塞特大学) Queen Mary University of London(伦敦女王学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL、cs.LG

AI总结 CALM通过对比学习和专家混合机制,赋予语言模型文化自感知能力,提升其在跨文化任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08726 2026-01-08 cs.CL cs.AI 62%

Improved LLM Agents for Financial Document Question Answering

改进的金融文档问答大型语言模型代理

Nelvin Tan, Zian Seng, Liang Zhang, Yu-Ching Shih, Dong Yang, Amol Salunkhe

机构 * American Express(美国美国运通)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.CL、cs.AI

AI总结 本文提出改进的金融文档问答代理,通过实验展示其在无 oracle 标签情况下的有效性,并引入更安全的计算代理。

Comments 13 pages, 6 figures. More analysis is added to Appendix C

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04170 2026-01-08 cs.AI 57%

Agent Drift: Quantifying Behavioral Degradation in Multi-Agent LLM Systems Over Extended Interactions

智能体漂移:多智能体大语言模型系统在长时间交互中的行为退化量化

Abhishek Rath

机构 * Independent Researcher(独立研究者)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出智能体漂移概念,通过理论框架和量化指标,探讨多智能体系统在长时间交互中的行为退化问题,并提出缓解策略以提升系统稳定性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏