arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15841 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15841 篇

2608.03391 2026-08-05 cs.LG 新提交 57%

TimeRLM: Recursive Language Models Enable Precise Anomaly Localization in Long-Context Time-Series

TimeRLM:递归语言模型可实现长时序数据中的精准异常定位

Nicolas Zumarraga, Lorenzo Steno, Ning Wang, Max Rosenblattl, Thomas Kaar, Maxwell A. Xu, Kevin O'Sullivan, Markus Kreft, Elgar Fleisch, Paul Schmiedmayer, Patrick Langer, Robert Jakob

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出TimeRLM(基于递归语言模型的时序异常定位框架),结合强化学习后训练后,在合成基准AnomalyXL及真实世界数据上,均优于现有时序语言模型,可实现长时序数据的精准异常定位。

Comments Open source code and datasets: https://github.com/OpenTSLM/TimeRLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02868 2026-08-05 cs.LG 新提交 57%

Adaptive Sampling for Automated Post-Disaster Rapid Damage Assessment via Level-Set Cost-Aware Bayesian Optimization

基于水平集成本感知贝叶斯优化的灾后自动化快速损伤评估自适应采样

Boyang Xu, Mostafa Reisi Gahrooei, Mohammad Ilbeigi, Hao Yan

机构 * School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院) University of Florida(佛罗里达大学) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 针对灾后损伤评估的传统方法成本高且难以适应动态条件,本研究提出结合水平集估计的成本感知贝叶斯优化框架,引导自主数据采集器流向高信息区域,经模拟和R2D数据验证可高效评估损伤以支持应急响应。

Comments 11 pages, 7 figures, 1 table. Accepted at the SIAM International Conference on Data Mining (SDM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28048 2026-08-05 cs.AI 版本更新 57%

SKILL-KD: Contrastive Skill Distillation for LLM Agents

SKILL-KD:面向大语言模型智能体的对比式技能蒸馏

Qiming Shi, Yibo Dou, Jiawen Zhu, Yulong Tao, Linbo Jin, Zhaolu Kang, Yunfan Zhou, Di Weng

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 SKILL-KD是面向LLM智能体的对比式技能蒸馏框架,通过将师生智能体的可操作差异蒸馏为技能补丁并迭代优化,结合感知漂移的技能整合,在五个智能体基准上提升了冻结学生智能体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01409 2026-08-05 cs.AI 57%

OntoLogX: Ontology-Guided Knowledge Graph Extraction from Cybersecurity Logs with Large Language Models

OntoLogX:基于大型语言模型的面向网络安全日志的知识图谱提取

Luca Cotti, Idilio Drago, Anisa Rula, Devis Bianchini, Federico Cerutti

机构 * Department of Information Engineering, University of Brescia, Italy(博洛尼亚大学信息工程系,意大利) Department of Computer Science, University of Turin, Italy(都灵大学计算机科学系,意大利) School of Computer Science and Informatics, Cardiff University, United Kingdom(卡迪夫大学计算机科学与信息学学院,英国) Department of Electronics and Computer Science, University of Southampton, United Kingdom(南安普顿大学电子与计算机科学系,英国)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 OntoLogX利用大型语言模型和知识图谱技术,从网络安全日志中提取结构化信息,通过检索增强生成和迭代校正,生成符合语义的知识图谱,并预测MITRE ATT&CK战术。

Comments 24 pages, 2 tables, 7 listings, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23690 2026-08-05 cs.CV cs.CL 版本更新 57%

HomeSafeBench: Benchmarking Embodied Vision-Language Models in Free-Exploration Home Safety Inspection

HomeSafeBench:面向自由探索式家庭安全检查的具身视觉-语言模型基准

Jiashu Yao, Haoyu Wen, Siyuan Gao, Yuhang Guo, Zeming Liu, Heyan Huang

机构 * Beijing Institute of Technology(北京理工大学) Beihang University(北京航空航天大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 研究针对家庭安全隐患检查需求构建HomeSafeBench基准,提出CueBack数据构建方法,微调4B规模VLM使分布外测试集F1值显著提升,缩小了与人类检查员的性能差距。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02505 2026-08-04 cs.AI cs.CV cs.IR 新提交 57%

Abduction Without a Body? Representational Grounding and the Abduction Loop for Scientific Hypothesis Generation

无实体的溯因推理?科学假说生成的表征奠基与溯因循环

Michael Farmer

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出无需实体的科学溯因推理,构建含弃权机制的溯因循环架构,以惯例空间解决跨领域检索难题,通过案例抽象架构并提出DAB-30基准作为评估方案。

Comments 20 pages, 4 figures. DAB-30 execution reported in companion paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02412 2026-08-04 cs.LG 新提交 57%

Why Large Language Models Fail at Tabular Prediction

为什么大型语言模型在表格预测任务中表现不佳

Marta Garnelo, Wojciech M. Czarnecki

机构 * Fundamental Technologies(基础技术) Voylab

专题命中 Agent评测 :agentic(abstract);分类 cs.LG

AI总结 该研究探究通用大型语言模型(LLM)在表格预测任务中表现不佳的原因,通过控制实验排除了数据噪声、CSV格式等因素,发现维度是关键,LLM准确率随维度增长下降,而经典基线方法不受影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02372 2026-08-04 cs.CL 新提交 57%

PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise

PredAct-Bench:可控工具噪声下的工具增强对话基准

Abdulrahman AlRabah, Xiaocheng Yang, Dilek Hakkani-Tür, Abdussalam Alawini

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 该研究推出PredAct-Bench基准,以教育为测试平台评估带噪声工具的对话智能体,扩展信任校准指标并评估13种LLMs,发现当前模型无法在工具噪声下为教师提供足够可见性,助力构建更优AI决策支持系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02287 2026-08-04 cs.AI 新提交 57%

SKT: Skill-Use Training at Scale via Verified Synthetic Data Generation

SKT:通过经过验证的合成数据生成实现规模化的技能使用训练

Zelin Tan, Yiqun Zhang, Hao Li, Zhiyao Cui, Hejia Geng, Shao Zhang, Hangfan Zhang, Yang Chen, Xiaosong Wang, Lilong Wang, Zhenfei Yin, Shuyue Hu, Chen Zhang, Lei Bai

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究提出SKT这一经过验证的规模化技能使用训练合成数据生成流程,构建SkillEval基准,实验证实其生成轨迹的监督微调可提升多模型技能使用性能,验证了方法的有效性与可扩展性。

Comments 24 pages,8 figures, Version 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01451 2026-08-04 cs.SE 新提交 57%

Doc2CI: A Multi-Service Study of CI Configuration Generation Using Large Language Models

Doc2CI:基于大语言模型的CI配置生成多服务研究

Taher A. Ghaleb

专题命中 Agent评测 :workflow(abstract);分类 cs.SE

AI总结 本文通过构建DOC2CI基准评估LLM生成CI配置的能力,发现其结构有效性不足,提出无需训练的模式引导修复方法提升有效性,为相关工具开发提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00817 2026-08-04 cs.AI cs.HC stat.AP 新提交 57%

Large language models improve physician accuracy but lead to false reliance

大型语言模型可提高医师准确率,但会导致错误依赖

Tirtha Chanda, Christoph Wies, Franziska Schramm, Carina Nogueira Garcia, Nicolas B. Merl, Martin J. Hetz, Jochen S. Utikal, Phillip Tschandl, Cristian Navarrete-Dechent, Alexander Thiem, Jakob N. Kather, Consortium, Titus J. Brinker

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本研究开发智能体式检索增强型LLM CORA,发现其可将46名医师的诊断准确率从70.8%提升至82.6%,但存在错误答案获引用支持时医师抵抗大幅下降的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00610 2026-08-04 cs.AI 新提交 57%

Slides2MindMap: Reconstructing Cognitively Efficient Knowledge Hierarchies from Lecture Slides

Slides2MindMap:从课程幻灯片重建认知高效的知识层次结构

Yuzhi Wang, Rongjun Ye, Shengyuan Chen, Huachi Zhou, Jiaqi Bai, Chuang Zhou, Zhicong Hong, Xiao Huang

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本研究提出Slides2MindMap任务,引入含12774张幻灯片的S2M-Bench基准,提出AutoMindMap智能体框架,实验证明其在基准上优于基线且鲁棒性强,具备教学应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00018 2026-08-04 cs.DB cs.AI 新提交 57%

CITBench: A Comprehensive Benchmark for Interactive Tabular Data Processing with LLMs

CITBench:面向大语言模型的交互式表格数据处理综合基准

Zihan Nan, Yang Gu, Wei Liu, Xi Yan, Zhou Liu, Hao Liang, Wentao Zhang

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本文提出 CITBench 交互式表格数据处理基准,评估发现现有 LLM 在简单表格任务表现良好,但在复杂多轮交互场景下的理解、规划与表格结构感知仍存在显著挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28894 2026-08-04 cs.AI stat.ML 版本更新 57%

Identifying Informative Environments for Cognition Parameter Inference via Bayesian Experimental Design

基于贝叶斯实验设计识别认知参数推断的有效环境

Manisha Dubey, Rimvydas Rubavicius, N. Siddharth, Subramanian Ramamoorthy

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 该研究针对认知参数推断的环境选择问题,将认知规划实验建模为贝叶斯实验设计问题,提出摊销贝叶斯实验设计框架,经Mouselab-MDP实验验证其高效性,揭示了环境选择的权衡关系。

Comments 14 pages, 16 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11439 2026-08-04 cs.LG 版本更新 57%

Multi-Level Strategic Classification: Incentivizing Improvement through Promotion and Relegation Dynamics

多层级策略分类:通过晋升与降级动态激励改进

Ziyuan Huang, Lina Alkarmi, Mingyan Liu

机构 * Electrical and Computer Engineering Department, University of Michigan, Ann Arbor, MI 48109, USA(密歇根大学电气与计算机工程系,安阿伯,MI 48109,美国)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出一种多层级晋升-降级框架,通过设计分类器阈值和难度递进来激励代理人诚实努力,并证明在温和条件下代理人可通过真实改进达到任意高水平。

Comments 9 pages, 4 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07078 2026-08-04 q-fin.TR cs.AI cs.CE 57%

Can LLM-based Financial Investing Strategies Outperform the Market in Long Run?

基于LLM的金融投资策略能否长期跑赢市场?

Weixian Waylon Li, Hyeonjun Kim, Mihai Cucuringu, Tiejun Ma

机构 * AIAI, School of Informatics The University of Edinburgh Edinburgh United Kingdom Global Finance Research Center Sungkyunkwan University Seoul Republic of Korea Dept. of Statistics \& OMI University of California, Los Angeles University of Oxford United States The University of Edinburgh Sungkyunkwan University University of California, Los Angeles University of Oxford

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI

AI总结 提出FINSABER回测框架,在更长时间和更大股票池上评估基于LLM的择时策略,发现其优势在长期和广泛截面下显著下降,且在牛熊市中表现不佳。

Comments KDD 2026, Datasets & Benchmarks Track (Oral) Corrected the FinAgent results and added FinAgent (GPT-4o-mini) in Table 2; conclusions unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23590 2026-08-04 cs.AI 版本更新 57%

Co-ReAct: Rubrics as Step-Level Collaborators for ReAct Agents

Co-ReAct:作为ReAct智能体逐步协作者的评分准则

Jiazheng Kang, Bowen Zhang, Zixin Song, Jiangwang Chen, Xiao Yang, Da Zhu, Guanjun Jiang

机构 * Qwen Applications Business Group of Alibaba(阿里巴巴文勤应用业务组) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出Co-ReAct框架,通过训练专用评分准则生成器,在推理时逐步指导ReAct智能体的行动选择,显著提升搜索密集型多步推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14322 2026-08-04 cs.AI 版本更新 57%

TeachArena: Are Language Agents Ready for Realistic Teaching Work?

代理是否准备好教学?一个多阶段基准用于现实世界教学工作流程

Zixin Chen, Peng Liu, Rui Sheng, Haobo Li, Jianhong Tu, Xiaodong Deng, Kashun Shum, Dayiheng Liu, Huamin Qu

机构 * Hong Kong University of Science and Technology(香港科技大学) Qwen Team, Alibaba Group(阿里集团通义实验室)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 本文提出EduAgentBench基准,用于评估教学代理的全面能力,发现当前模型在教学任务中的表现有限,但仍为开发未来教学代理提供了测量基础。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27269 2026-08-04 cs.AI 版本更新 57%

Unifying biomedical knowledge in a modern multimodal graph

OptimusKG:统一生物医学知识的现代多模态图

Lucas Vittor, Ayush Noori, Iñaki Arango, Joaquín Polonuer, Sam Rodriques, Andrew White, David A. Clifton, Marinka Zitnik

机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Edison Scientific Inc.(Edison科学公司) Oxford Suzhou Centre for Advanced Research, University of Oxford(牛津大学苏格兰研究中心) Broad Institute of MIT and Harvard(MIT与哈佛大学Broad研究所) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究所) Harvard Data Science Initiative(哈佛大学数据科学计划)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 OptimusKG通过整合结构化和半结构化资源,构建了多模态生物医学标记属性图,统一了分子、解剖、临床和环境领域的知识,验证了其在生物医学领域的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20487 2026-08-04 cs.AI cs.GT cs.HC econ.GN q-fin.EC 版本更新 57%

Bounded Normative Equivalence in Human-AI Cooperation: Group Behaviour, Not Partner Labels, Predicts Cooperation under Anonymous Aggregate Feedback

人机协作中的规范等价性:行为,而非身份,驱动混合代理群体中的合作

Nico Mutzner, Taha Yasseri, Heiko Rauhut

机构 * Department of Sociology, University of Zurich(苏黎世大学社会学系) Centre for Sociology of Humans and Machines (SOHAM), Trinity College Dublin & Technological University Dublin(人类与机器社会学中心(SOHAM))

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究发现,混合人机群体中的合作依赖于群体行为而非身份,规范机制在不同条件下表现一致,支持规范等价性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29626 2026-08-03 cs.AI 新提交 57%

AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers

AgentHPOBench:用于评估LLM智能体作为序列超参数优化器的基准

Tianyu Huai, Tingshuo Fan, Xinchi Chen, Yining Zheng, Yuxin Wang, Shuang Chen, Jie Zhou, Xuanjing Huang

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 AgentHPOBench是含30个任务的序列基准,用于评估LLM智能体的超参数优化能力,实验显示其在多领域有优化能力,但在迭代优化等方面存在局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29559 2026-08-03 cs.AI cs.RO 新提交 57%

LEMUR: Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback

LEMUR:基于偏好反馈的多目标强化学习对齐学习

Manith Adikari, Bei Peng, Samuele Vinanzi, Angelo Cangelosi

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本研究提出LEMUR框架,通过联合学习策略与多目标奖励模型,从人类偏好反馈中学习平衡多目标的最优策略,其在基准多目标任务上性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29218 2026-08-03 cs.AI 新提交 57%

MirrorCraft: Paired Evaluation under Hidden Rule Changes in Minecraft

MirrorCraft:Minecraft中隐藏规则变化下的配对评估

Jianxin Gao, Beini Hu, Runze Li, Wanli Peng, Ruohan Lei, Jinyuan Zhang, Linna Deng, Tianyi Yu, Zining Wang

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 MirrorCraft是用于Minecraft隐藏规则变化下评估智能体的配对基准,实验发现规则集对隐藏规则变化的影响差异显著,未提供规则描述时ReAct表现最优,提供规则可适度提升任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29090 2026-08-03 cs.LG 新提交 57%

What Is Missing in Surgical Risk Stratification and Outcome Prediction: A Scoping Review of End-to-End Machine Learning Approaches

手术风险分层与结局预测中缺失的内容:端到端机器学习方法的范围综述

Yizhi Dong, Yuhe Ke, Hairil Rizal Abdullah, Yucheng Xing, Kevan Kai Bing Teo, Ling Huang, Mengling Feng

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 本范围综述回顾190项研究,分析手术风险分层与结局预测的ML流程,发现数据、方法、评估等方面存在差距,为开发更严谨的围手术期ML工具提供参考。

Comments This work has been submitted to the IEEE JBHI for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28858 2026-08-03 cs.CV cs.AI 新提交 57%

A Unified Benchmark of Deep Learning Models for Multi-task 3D Brain Tumor Segmentation from Magnetic Resonance Imaging

用于磁共振成像多任务3D脑肿瘤分割的深度学习模型统一基准

Diego J. Torrejón, Luna Y. Hernández, Javier Sánchez

机构 * Centro de Tecnologías de la Imagen (CTIM)(图像技术中心(CTIM)) Instituto Universitario de Cibernética, Empresas y Sociedad (IUCES)(网络、企业与社会大学研究所(IUCES)) University of Las Palmas de Gran Canaria(拉斯帕尔马斯大加那利大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本研究构建统一基准,在相同条件下对比3D U-Net等5种深度学习模型在BraTS 2023、2024数据集上的脑肿瘤分割性能,明确了不同架构的准确率与效率权衡及适用场景。

Comments 27 pages, 16 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28777 2026-08-03 cs.CL 新提交 57%

Self-Supervised Skill Optimization

自监督技能优化

Siran Peng, Cuiyu Yang, Tianyu Fu, Tianshuo Zhang, Haoyuan Zhang, Weisong Zhao, Anyang Su, Minghui Wu, Huiying Li, Xiangyu Zhu, Chenxu Zhao, Zhen Lei

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 该研究提出自监督技能优化(SSO)框架,仅用未标注任务实例学习可复用技能,在封闭、开放任务上优于无真实标注的提示优化器,部分场景表现接近最强的基于真实标注的技能优化器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28651 2026-08-03 cs.HC cs.CL cs.CY 新提交 57%

Measuring Cognitive Engagement in Collaborative Discourse with an Extended ICAP Framework: Comparing Human Annotation, In-Context Learning, and Reflective LLM Agents

基于扩展ICAP框架的协作对话认知投入度测量:人类标注、上下文学习与反思型大语言模型智能体的比较

Lan Anh Do, Hanling Jiang, Shuchin Aeron, Ayanna K. Thomas

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本研究用扩展7点ICAP框架测量协作对话认知投入度,对比人类标注、ICL及反思型LLM智能体,发现人类标注信度更高,智能体方法具潜力,需强化人类标注与LLM方法的交互。

Comments Accepted as a full paper in the CogSci 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28636 2026-08-03 cs.CL cs.CY 新提交 57%

Chain-of-Models: Cross-Model Auditing for Bias-Robust LLM Judges

模型链:面向偏见鲁棒性大语言模型评判器的跨模型审计

Qian Wang, Zhanzhi Lou, Zhenheng Tang, Nuo Chen, Bingsheng He

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本研究针对LLM评判器的认知偏见问题,提出跨模型审计流程CoM,发现审计器身份的关键作用,制定偏见特异性审计器选择规则,在多模型多偏见实验中取得优于基线的准确率。

Comments WIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23332 2026-08-03 cs.LG 版本更新 57%

AllocBench: Measuring Online Tool Allocation Capability in LLM Agents

AlloBench:测量大语言模型智能体中的在线工具分配能力

Daniel Wang, Andrew Xu

机构 * Sea12 Technologies(Sea12科技公司) Yale University(耶鲁大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究测试大语言模型智能体在固定预算下的在线工具分配能力,通过配对基准测试发现前沿模型在抽象框架中表现近乎最优,但在脚本编写中失败,确定了各模型失败模式,还表明开源Qwen模型在抽象分配上有推广,在线工具分配是重要能力边界。

Comments 24 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29495 2026-08-03 cs.AI 版本更新 57%

Cognitive World Model for Progressive BDI/E Trajectory Evaluation of Conversational Agents

用于过程级社会影响力评估的认知世界模型

Minghui Ma, Bin Guo, Hao Wang, Han Wang, Mengqi Chen, Jingqi Liu, Yan Liu

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出认知世界模型(CogWM),通过联合预测BDI/E认知状态和用户话语,实现从终端判断到过程跟踪的社会影响力对话评估,在四个场景中达到77.6%情感准确率。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏