arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10549 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10549 篇

2601.03281 2026-01-08 eess.SY cs.AI cs.SY 57%

$α^3$-Bench: A Unified Benchmark of Safety, Robustness, and Efficiency for LLM-Based UAV Agents over 6G Networks

$α^3$-Bench:一种统一的安全性、鲁棒性和效率评估基准,用于基于大语言模型的无人机代理在6G网络中的自主性

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(计算机与网络工程系,信息科技学院,阿联酋大学) Khalifa University of Science and Technology(科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出$α^3$-Bench,用于评估基于LLM的无人机代理在6G网络中的安全性、鲁棒性和效率,通过多轮对话推理和控制问题测试其性能。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03023 2026-01-08 cs.CL cs.HC 57%

MedDialogRubrics: A Comprehensive Benchmark and Evaluation Framework for Multi-turn Medical Consultations in Large Language Models

MedDialogRubrics: 一种用于大型语言模型多轮医疗咨询的综合基准和评估框架

Lecheng Gong, Weimin Fang, Ting Yang, Dongjie Tao, Chunxiao Guo, Peng Wei, Bo Xie, Jinqun Guan, Zixiao Chen, Fang Shi, Jinjie Gu, Junwei Liu

机构 * Ant Group(蚂蚁集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 MedDialogRubrics提出了一种用于评估大型语言模型多轮医疗对话能力的综合基准和评估框架,通过合成患者案例和细粒度评估 rubrics,揭示了当前模型在医疗对话管理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02757 2026-01-08 cs.AI 57%

LLM Agent Framework for Intelligent Change Analysis in Urban Environment using Remote Sensing Imagery

基于遥感影像的城市环境智能变化分析LLM代理框架

Zixuan Xiao, Jun Ma

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于LLM和视觉基础模型的ChangeGPT框架,通过分层结构提升变化检测的智能与适应性,实现在城市环境中的高效变化分析。

Journal ref Automation in Construction 177 (2025) 106341

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13936 2026-01-08 cs.CL 57%

FinDeepResearch: Evaluating Deep Research Agents in Rigorous Financial Analysis

FinDeepResearch:在严谨的金融分析中评估深度研究代理

Fengbin Zhu, Xiang Yao Ng, Ziyang Liu, Chang Liu, Xianwei Zeng, Chao Wang, Tianhui Tan, Xuan Yao, Pengyang Shao, Min Xu, Zixuan Wang, Jing Wang, Xin Lin, Junfeng Li, Jingxian Zhu, Yang Zhang, Wenjie Wang, Fuli Feng, Richang Hong, Huanbo Luan, Ke-Wei Huang, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) Estates Pte Ltd(6Estates公司) Asian Institute of Digital Finance(亚洲数字金融研究所) Hefei University of Technology(合肥工业大学) University of Science and Technology of China(中国科学技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 FinDeepResearch通过HisRubric框架评估深度研究代理在金融分析中的能力,构建包含多语言和多市场的基准测试,揭示不同方法在财务分析中的优劣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10549 2026-01-08 cs.AI 57%

ELAIPBench: A Benchmark for Expert-Level Artificial Intelligence Paper Understanding

ELAIPBench: 一个用于专家级人工智能论文理解的基准

Xinbang Dai, Huikang Hu, Yongrui Chen, Jiaqi Li, Rihui Jin, Yuyang Zhang, Xiaoguang Li, Lifeng Shang, Guilin Qi

机构 * Southeast University(东南大学) Noah’s Ark Lab(诺亚实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 ELAIPBench通过专家编纂的多选题评估LLM对AI论文的理解能力,发现最佳模型准确率仅为39.95%,远低于人类,揭示了LLM在学术论文理解上的显著不足。

Comments 24 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03227 2026-01-07 cs.SD cs.AI 57%

The Sonar Moment: Benchmarking Audio-Language Models in Audio Geo-Localization

声纳时刻:在音频地理定位中基准测试音频语言模型

Ruixing Zhang, Zihan Liu, Leilei Sun, Tongyu Zhu, Weifeng Lv

机构 * The State Key Laboratory of Complex and Critical Software Environment, Beihang University(复杂与关键软件环境国家重点实验室,北航) Shanghai AI Laboratory(上海人工智能实验室) The Key Laboratory of Data Science and Intelligent Computing, International Innovation Institute, Beihang University(数据科学与智能计算重点实验室,国际创新研究院,北航)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AGL1K基准,用于评估音频语言模型在音频地理定位中的能力,发现封闭源模型表现更优,语言线索在预测中起主导作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03194 2026-01-07 cs.CL 57%

X-MuTeST: A Multilingual Benchmark for Explainable Hate Speech Detection and A Novel LLM-consulted Explanation Framework

X-MuTeST:一个用于可解释仇恨言论检测的多语言基准及一种新颖的LLM咨询解释框架

Mohammad Zia Ur Rehman, Sai Kartheek Reddy Kasu, Shashivardhan Reddy Koppula, Sai Rithwik Reddy Chirra, Shwetank Shekhar Singh, Nagendra Kumar

机构 * Indian Institute of Technology Indore(印度理工学院Indore) Indian Institute of Information Technology Dharwad(印度信息科技学院Dharwad) Arizona State University(亚利桑那州立大学) Indian Institute of Technology Mandi(印度理工学院Mandi)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 X-MuTeST提出一种结合LLM和传统技术的多语言仇恨言论检测框架,通过人类注释的解释提升分类性能和可解释性。

Comments Accepted in the proceedings of AAAI 2026

Journal ref AAA 2026 (AISI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11078 2026-01-07 cs.AI 57%

Patient-Zero: Scaling Synthetic Patient Agents to Real-World Distributions without Real Patient Data

Patient-Zero: 通过无需真实患者数据实现对真实世界分布的合成患者代理扩展

Yunghwei Lai, Ziyue Wang, Weizhi Ma, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(计算机科学与技术系,人工智能学院,清华大学) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院,清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 Patient-Zero通过无需真实患者数据的合成方法,实现了对真实世界分布的高效模拟,提升了医疗数据质量和交互保真度,且在临床任务中表现出显著的性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13271 2026-01-07 cs.CL 57%

Do You Get the Hint? Benchmarking LLMs on the Board Game Concept

你得到提示了吗?对大型语言模型的棋盘游戏概念基准测试

Ine Gevers, Walter Daelemans

机构 * CLiPS, University of Antwerp(CLiPS,安特卫普大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文通过棋盘游戏Concept测试LLMs的演绎推理能力,发现人类易解而LLMs表现不佳,尤其在低资源语言中更差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01118 2026-01-06 cs.IR cs.AI cs.DL 57%

ScienceDB AI: An LLM-Driven Agentic Recommender System for Large-Scale Scientific Data Sharing Services

ScienceDB AI: 基于大语言模型的代理推荐系统用于大规模科学数据共享服务

Qingqing Long, Haotian Chen, Chenyang Zhao, Xiaolei Du, Xuezhi Wang, Pengyao Wang, Chengzan Li, Yuanchun Zhou, Hengshu Zhu

机构 * Computer Network Information Center, Chinese Academy of Sciences, Beijing, China(中国科学院计算机网络信息中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 ScienceDB AI 是首个基于大语言模型的对话推荐系统,专为大规模科学数据共享服务设计,通过自然语言对话和深度推理实现精准的数据集推荐。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24181 2026-01-06 cs.CL 57%

MedKGI: Iterative Differential Diagnosis with Medical Knowledge Graphs and Information-Guided Inquiring

MedKGI: 基于医学知识图谱和信息引导提问的迭代诊断

Qipeng Wang, Rui Sheng, Yafei Li, Huamin Qu, Yushi Sun, Min Zhu

机构 * Sichuan University(四川大学) HKUST(香港科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 MedKGI通过整合医学知识图谱和信息引导提问,提升临床诊断的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18829 2026-01-06 cs.AI 57%

HARBOR: Holistic Adaptive Risk assessment model for BehaviORal healthcare

HARBOR:面向行为医疗的综合自适应风险评估模型

Aditya Siddhant

机构 * Aditya Siddhant(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 HARBOR模型通过整合多模态数据,有效预测行为医疗中的情绪和风险评分,实现69%的准确率,优于传统方法和现有LLMs。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14133 2026-01-06 cs.CL 57%

Performance Gap in Entity Knowledge Extraction Across Modalities in Vision Language Models

视觉语言模型中实体知识提取跨模态性能差距

Ido Cohen, Daniela Gottesman, Mor Geva, Raja Giryes

机构 * Tel Aviv University(特拉维夫大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究视觉语言模型在跨模态实体知识提取中的性能差异,揭示信息流动限制及模型推理效率问题。

Comments Accepted to ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00897 2026-01-06 cs.CV cs.AI 57%

CornViT: A Multi-Stage Convolutional Vision Transformer Framework for Hierarchical Corn Kernel Analysis

CornViT:一种多阶段卷积视觉变换器框架用于分层玉米粒分析

Sai Teja Erukude, Jane Mascarenhas, Lior Shamir

机构 * Kansas State University(堪萨斯州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 CornViT通过多阶段卷积视觉变换器框架实现玉米粒的自动化分级与分析,准确率高达93.76%至94.11%。

Comments 23 pages

Journal ref Published in Computers MDPI 2026, 15(1)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00559 2026-01-05 cs.CR cs.AI 57%

Cracking IoT Security: Can LLMs Outsmart Static Analysis Tools?

破解物联网安全:大语言模型能否超越静态分析工具?

Jason Quantrill, Noura Khajehnouri, Zihan Guo, Manar H. Alalfi

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文评估大语言模型在物联网交互威胁检测中的性能,发现其在语义理解上有潜力,但在结构推理方面表现不佳,需结合符号分析提升可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00506 2026-01-05 cs.CL 57%

Rule-Based Approaches to Atomic Sentence Extraction

基于规则的方法用于原子句子提取

Lineesha Kamana, Akshita Ananda Subramanian, Mehuli Ghosh, Suman Saha

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过分析复杂句子结构对基于规则的原子句子提取性能的影响,提出了依赖关系提取规则,并在WikiSplit数据集上实现了较高的提取准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00254 2026-01-05 cs.SE cs.AI 57%

An Empirical Evaluation of LLM-Based Approaches for Code Vulnerability Detection: RAG, SFT, and Dual-Agent Systems

基于大型语言模型的代码漏洞检测方法实证评估:RAG、SFT和双智能体系统

Md Hasan Saju, Maher Muhtadi, Akramul Azim

机构 * Department of Electrical, Computer, and Software Engineering(电气、计算机与软件工程系) Ontario Tech University(安大略技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文通过实证评估,比较了RAG、SFT和双智能体系统在代码漏洞检测中的有效性,发现RAG在准确率和F1分数上表现最佳,SFT和双智能体系统也展示了良好的性能,证明了领域专业知识对LLM在实际漏洞检测中的重要性。

Journal ref https://conf.researchr.org/home/cascon-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00166 2026-01-05 cs.CL 57%

Pat-DEVAL: Chain-of-Legal-Thought Evaluation for Patent Description

Pat-DEVAL: 专利描述的法律思维链评估

Yongmin Yoo, Kris W Pan

机构 * Macquarie University(麦考瑞大学) Amazon(亚马逊公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 Pat-DEVAL通过法律约束的推理机制,首次提出评估专利描述的多维框架,显著提升法律合规性评估效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15206 2026-01-05 cs.CV cs.LG cs.RO 57%

AutoTrust: Benchmarking Trustworthiness in Large Vision Language Models for Autonomous Driving

AutoTrust: 评估自动驾驶大视觉语言模型的可信度

Shuo Xing, Hongyuan Hua, Xiangbo Gao, Shenzhe Zhu, Renjie Li, Kexin Tian, Xiaopeng Li, Heng Huang, Tianbao Yang, Zhangyang Wang, Yang Zhou, Huaxiu Yao, Zhengzhong Tu

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 AutoTrust研究自动驾驶大视觉语言模型的可信度问题,发现通用模型在可信度上优于专用模型,同时揭示DriveVLMs在隐私、安全和公平性方面的漏洞。

Comments Published at TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23165 2026-01-01 cs.LG 57%

Evaluating Parameter Efficient Methods for RLVR

评估用于RLVR的参数高效方法

Qingyu Yin, Yulun Wu, Zhennan Shen, Sunbowen Li, Zhilin Wang, Yanshu Li, Chak Tou Leong, Jiale Kang, Jinjin Gu

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本研究评估了RLVR中多种参数高效微调方法,发现结构变体如DoRA优于LoRA,并揭示了初始化策略中的谱崩溃现象及参数减少对推理能力的限制。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07017 2026-01-01 cs.SE cs.AI 57%

Benchmarking LLMs for Fine-Grained Code Review with Enriched Context in Practice

基于实践丰富上下文的LLM细粒度代码审查基准测试

Ruida Hu, Xinchen Wang, Xin-Cheng Wen, Zhao Zhang, Bo Jiang, Pengfei Gao, Chao Peng, Cuiyun Gao

机构 * Harbin Institute of Technology(哈尔滨工业大学) ByteDance(字节跳动)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 ContextCRBench通过丰富上下文的细粒度代码审查基准测试,评估LLM在代码审查中的性能,发现文本上下文比代码上下文更有效,且在工业应用中提升了审查系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23029 2025-12-30 cs.DC cs.AI 57%

Viability and Performance of a Private LLM Server for SMBs: A Benchmark Analysis of Qwen3-30B on Consumer-Grade Hardware

私有LLM服务器的可行性和性能:基于Qwen3-30B在消费级硬件上的基准分析

Alex Khalil, Guillaume Heilles, Maria Parraga, Simon Heilles

机构 * UCLouvain(列日大学) Universidad Espíritu Santo(圣灵大学) DENEM Labs(DENEM实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文基于Qwen3-30B在消费级硬件上评估私有LLM服务器的可行性和性能,证明其在成本和隐私方面对SMBs的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22899 2025-12-30 cs.AI cs.CV 57%

HiSciBench: A Hierarchical Multi-disciplinary Benchmark for Scientific Intelligence from Reading to Discovery

HiSciBench: 一个分层多学科基准,用于从阅读到发现的科学智能

Yaping Zhang, Qixuan Zhang, Xingquan Zhang, Zhiyuan Chen, Wenwen Zhuang, Yupu Liang, Lu Xiang, Yang Zhao, Jiajun Zhang, Yu Zhou, Chengqing Zong

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 HiSciBench是一个分层多学科基准,用于评估从阅读到发现的科学智能,涵盖五个层次,揭示了模型在不同科学推理阶段的能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12411 2025-12-30 cs.CL 57%

The Cultural Gene of Large Language Models: A Study on the Impact of Cross-Corpus Training on Model Values and Biases

大语言模型的文化基因:跨语料库训练对模型价值观与偏见的影响研究

Emanuel Z. Fenech-Borg, Tilen P. Meznaric-Kos, Milica D. Lekovic-Bojovic, Arni J. Hentze-Djurhuus

机构 * Department of Communications(通讯系) University of Malta(马耳他大学) Faculty of Mathematics(数学系) University of Primorska(普里摩尔卡大学) Faculty of Electrical Engineering(电气工程系) University of Montenegro(黑山大学) Faculty of Science & Technology(科学与技术系) University of the Faroe Islands(法罗群岛大学) Department of Computer Science(计算机科学系) San Francisco State University(旧金山州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过跨文化探针数据集分析大语言模型在个人主义-集体主义和权力距离维度上的文化偏见,揭示模型价值观与训练语料文化背景的关联。

Comments 10 pages, 5 figures, IEEE conference format, submitted to [Conference Name]

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10516 2025-12-30 cs.CV cs.AI 57%

CogStream: Context-guided Streaming Video Question Answering

CogStream: 基于上下文的流视频问答

Zicheng Zhao, Kangyu Wang, Shijie Li, Rui Qian, Weiyao Lin, Huabin Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出CogStream任务,通过视觉流压缩和历史对话检索,解决流视频中关键信息识别与问答问题。

Comments Project page: https://github.com/LiamZhao326/CogStream

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19466 2025-12-30 cs.CV cs.LG 57%

ForgerySleuth: Empowering Multimodal Large Language Models for Image Manipulation Detection

ForgerySleuth: 赋能多模态大语言模型进行图像篡改检测

Zhihao Sun, Haoran Jiang, Haoran Chen, Yixin Cao, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

机构 * Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(上海智能信息处理关键实验室,复旦大学计算机学院) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 ForgerySleuth通过多模态大语言模型进行图像篡改检测,利用线索融合和数据集构建提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22737 2025-12-30 cs.CL 57%

WeDLM: Reconciling Diffusion Language Models with Standard Causal Attention for Fast Inference

WeDLM:弥合扩散语言模型与标准因果注意力以实现快速推理

Aiwei Liu, Minghua He, Shaoxun Zeng, Sijun Zhang, Linhao Zhang, Chuhan Wu, Wei Jia, Yuan Liu, Xiao Zhou, Jie Zhou

机构 * WeChat AI, Tencent(腾讯微信AI) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 WeDLM通过使用标准因果注意力实现高效并行解码,显著提升推理速度,优于优化的AR引擎。

Comments 23 pages, 8 figures, project page: https://wedlm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22629 2025-12-30 cs.AI cs.IR 57%

DICE: Discrete Interpretable Comparative Evaluation with Probabilistic Scoring for Retrieval-Augmented Generation

DICE:基于概率评分的离散可解释比较评估用于检索增强生成

Shiyan Liu, Jian Ma, Rui Qu

机构 * School of Computer Science and Technology(计算机科学与技术学院) Huazhong University of Science and Technology(华中科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 DICE提出一种基于概率评分的两阶段框架,提升RAG评估的可解释性和稳健性,通过透明判断和系统性错误诊断,实现高效且可信的评估。

Comments Accepted at ResponsibleFM @ NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22496 2025-12-30 cs.MA cs.AI 57%

Hierarchical Pedagogical Oversight: A Multi-Agent Adversarial Framework for Reliable AI Tutoring

层级教学监督:一种多智能体对抗框架用于可靠的AI辅导

Saisab Sadhu, Ashim Dhor

机构 * AAAI 2026 EGSAI Community Activity(AAAI 2026 EGSAI 社区活动)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出层级教学监督框架,通过多智能体对抗机制提升AI辅导的可靠性与效率,实验结果显示其在资源受限环境下表现优异。

Comments Accepted for presentation at the AAAI 2026 EGSAI Community Activity (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20663 2025-12-30 cs.MA cs.AI cs.SY eess.SY 57%

MTTR-A: Measuring Cognitive Recovery Latency in Multi-Agent Systems

MTTR-A:多智能体系统中认知恢复延迟的测量

Barak Or

机构 * Office of the CEO, MetaOr Artificial Intelligence(MetaOr人工智能首席执行官办公室) Google–Reichman Tech School, Reichman University(Reichman大学Google–Reichman技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出MTTR-A指标,用于测量多智能体系统中认知恢复延迟,通过理论分析和实验验证建立了运行时认知可靠性的量化基础。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏