arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15841 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15841 篇

2408.15787 2026-05-27 cs.CL cs.IR 57%

Interactive Agents: Simulating Counselor-Client Psychological Counseling via Role-Playing LLM-to-LLM Interactions

交互式智能体:通过角色扮演的LLM-LLM交互模拟咨询师-来访者心理咨询

Huachuan Qiu, Zhenzhong Lan

机构 * School of Engineering, Westlake University(西lake大学工程学院)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出Interactive Agents框架,通过LLM-LLM角色扮演生成高质量心理咨询对话数据,解决隐私、成本和扩展性问题,并验证其治疗有效性和模型性能。

Comments Accepted to *SEM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26087 2026-05-26 stat.ML cs.LG 57%

DiscoverPhysics: Benchmarking LLMs for Out-of-the-Box Scientific Thinking

DiscoverPhysics: 基准测试LLMs的即用型科学思维

Matt L. Wiemann, Lindsay M. Smith, Peter Melchior, Siddharth Mishra-Sharma, Andrew Gordon Wilson, Pavel Izmailov, Carolina Cuesta-Lázaro

机构 * Princeton University(普林斯顿大学) Boston University(波士顿大学) New York University(纽约大学) Flatiron Institute(Flatiron研究所) Institute for Advanced Studies(高级研究研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出DiscoverPhysics交互式基准,通过让LLM代理探索物理定律偏离现实的模拟世界,评估其设计实验、修正假设和发现物理规律的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25998 2026-05-26 cs.LG 57%

Causal methods for LLM development and evaluation

因果方法在LLM开发与评估中的应用

Dennis Frauen, Marie Brockschmidt, Konstantin Hess, Haorui Ma, Yuchen Ma, Abdurahman Maarouf, Maresa Schröder, Jonas Schweisthal, Yuxin Wang, Athiya Deviyani, Sonali Parbhoo, Rahul G. Krishnan, Stefan Feuerriegel

机构 * Imperial College London(帝国理工学院伦敦分校) University of Toronto(多伦多大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.LG

AI总结 本文提出因果方法可解决LLM开发与评估中的关键因果问题,并系统梳理其在预训练、对齐、路由等环节的应用机会。

Comments Published in KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24728 2026-05-26 cs.AI 57%

Hylos: Operability Contracts for Model-Native Spatial Intelligence

Hylos: 面向模型原生空间智能的可操作性契约

Christopher Da Silva

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出Hylos系统架构,通过契约约束和空间事务管理,确保生成或编辑的3D内容具备可操作性,支持CAD、机器人等下游应用。

Comments 27 pages, 7 figures. Systems/position preprint with focused artifact study

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25931 2026-05-26 cs.AI 57%

Explore Before You Solve: The Speed--Depth Trade-off in Epistemic Agents for ARC-AGI-3

先探索再求解:面向ARC-AGI-3的认知主体中的速度-深度权衡

Liew Keong Han

机构 * Independent researcher(独立研究者)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 通过系统分析所有25个公开ARC-AGI-3游戏,发现它们均可通过非智能策略达到,并提出了一个三阶段认知主体AERA,在速度-深度权衡框架下形式化其性能。

Comments 22 pages, 3 figures. Code: https://github.com/farmountain/aera-arc3-paper (CC0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24999 2026-05-26 q-bio.NC cs.AI cs.MA 57%

Interpretation, Learning, and Empathy as One Constraint: A Residual-Adequacy Architecture with Accountable Abstention

解释、学习与共情作为单一约束:具有可问责弃权的残差充分性架构

Chainarong Amornbunchornvej

机构 * National Electronics and Computer Technology Center (NECTEC)(国家电子与计算机技术中心)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出一种认知架构,通过单一残差量统一处理解释、学习和共情,当情境超出表征能力时产生带类型和见证的弃权。

Comments First draft for journal submission. The code is at https://github.com/DarkEyes/RC-Arch

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24543 2026-05-26 cs.AI cs.SY eess.SY 57%

Emission-Aware Reinforcement Learning for Sustainable Electric Vehicle Charging and Carbon Dioxide Reduction Under Varying Renewable Penetration

面向可持续电动汽车充电与二氧化碳减排的排放感知强化学习:在不同可再生能源渗透率下

Ninglin Ou, Mohammad A. Razzaque, Iftekher Islam Shovon, Shafkat Khan Siam, Shafiuzzaman K Khadem, Krishnendu Guha, Mayeen U Khandaker, Md. Noor-A-Rahim

机构 * organization= nasc Research, School of Computer Science \& IT, University College Cork , country = IE organization= School of Computing, Engineering Digital Technologies, Teesside University , country= UK organization= International Energy Research Centre, Tyndall National Institute, Cork , country = IE Radiation Technologies Group, CCDCU, Faculty of Engineering Technology, Sunway University , country = Malaysia organization= Department of Physics, College of Science, Korea University , country = Republic of Korea

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出基于软演员-评论家算法的排放感知强化学习策略,通过多目标奖励函数优化电动汽车充电调度,在EV2Gym平台上实现高达87%的碳排放减少和52%的可再生能源自消纳率。

Comments Submitted the Engineering Applications of Artificial Intelligence Journal (Elsevier)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08988 2026-05-26 cs.AI 57%

SEA-Eval: A Benchmark for Evaluating Self-Evolving Agents Beyond Episodic Assessment

SEA-Eval: 超越情景评估的自进化智能体基准

Sihang Jiang, Lipeng Ma, Zhonghua Hong, Keyi Wang, Zhiyu Lu, Tengfei Wang, Shisong Chen, Jinghao Zhang, Tianjun Pan, Weijia Li, Jiaqing Liang, Yanghua Xiao

机构 * Fudan University(复旦大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出自进化智能体(SEA)的形式化定义及其最小充分架构进化飞轮,并构建首个专门评估SEA的基准SEA-Eval,通过顺序任务流设计量化进化增益、稳定性和隐式对齐收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24238 2026-05-26 cs.AI 57%

Toward Enactive Artificial Intelligence

走向生成式人工智能

Banafsheh Rafiee, Richard Sutton

机构 * Independent Researcher(独立研究者) Department of Computing Science, University of Alberta, Canada(阿尔伯塔大学计算机科学系) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔机器智能研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文主张将生成式认知方法融入人工智能,强调感知与行动不可分割、具身性和自主性,并指出强化学习在结构上与生成式原则存在共鸣但仍有差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11759 2026-05-25 cs.AI 57%

Retrieval Is Not Enough: Why Organizational AI Needs Epistemic Infrastructure

检索是不够的:为什么组织AI需要认知基础设施

Federico Bottino, Carlo Ferrero, Nicholas Dosio, Pierfrancesco Beneventano

机构 * Kakashi Ventures Accelerator (KVA)(Kakashi Ventures加速器) Massachusetts Institute of Technology(麻省理工学院)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI

AI总结 本文提出OIDA框架,通过类型化知识对象、知识重力引擎和问题原语,解决组织AI中检索系统缺乏认知结构的问题,并引入认知质量评分(EQS)进行评估。

Comments 10 pages, 2 figures, 8 tables, 6 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23311 2026-05-25 cs.AI 57%

DART: Semantic Recoverability for Structured Tool Agents

DART:结构化工具代理的语义可恢复性

Ke Yang, Panpan Li, Zonghan Wu, Kejin Xu, Huaxi Huang, Xiaoshui Huang

机构 * MOS Intelligent Connectivity Technology Co. Ltd.(MOS智能连接技术有限公司) Sichuan Vocational College of Post and Telecom(四川邮电职业技术学院) East China Normal University(华东师范大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对结构化工具代理执行失败时局部恢复可能破坏下游已提交工作的语义一致性问题,提出DART运行时系统,通过形式化语义可恢复性并实施可接受性检查,在依赖和效果约束下选择安全的恢复点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02239 2026-05-25 cs.RO cs.AI 57%

LACY: A Vision-Language Model-based Language-Action Cycle for Self-Improving Robotic Manipulation

LACY: 基于视觉-语言模型的语言-动作循环用于自我改进的机器人操作

Youngjin Hong, Houjian Yu, Mingen Li, Changhyun Choi

机构 * Department of Electrical and Computer Engineering, Univ. of Minnesota(电气与计算机工程系,明尼苏达大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出LACY框架,通过联合学习语言到动作、动作到语言和语言一致性验证三个任务,实现机器人操作的自我改进,平均任务成功率提升56.46%。

Comments Accepted to ICRA 2026. Project page: https://vla2026.github.io/LACY/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06858 2026-05-25 physics.soc-ph cs.AI nlin.AO 57%

Disentangling Interaction and Bias Effects in Opinion Dynamics of Large Language Models

大型语言模型中意见动态的交互与偏差效应的分离

Vincent C. Brockers, David A. Ehrlich, Viola Priesemann

机构 * Max-Planck-Institute for Dynamics and Self-Organization(马克斯·普朗克动态与自组织研究所) Institute for the Dynamics of Complex Systems(复杂系统动力学研究所) University of Göttingen(哥廷根大学) Campus Institute for Dynamics of Biological Networks(校园生物网络动力学研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出贝叶斯框架分离主题偏差、同意偏差和锚定偏差,分析LLM在多步对话中的意见轨迹,发现意见快速收敛至共享吸引子,且微调可改变吸引子位置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03784 2026-05-25 cs.LG 57%

Insulin Resistance Prediction From Wearables and Routine Blood Biomarkers

从可穿戴设备和常规血液生物标志物预测胰岛素抵抗

Ahmed A. Metwally, A. Ali Heydari, Daniel McDuff, Alexandru Solot, Zeinab Esmaeilpour, Anthony Z Faranesh, Menglian Zhou, David B. Savage, Conor Heneghan, Shwetak Patel, Cathy Speed, Javier L. Prieto

机构 * Google Research(谷歌研究) Institute of Metabolic Science, University of Cambridge(剑桥大学代谢科学研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本研究利用可穿戴设备时间序列数据和血液生物标志物,通过深度神经网络模型预测胰岛素抵抗,在最大规模远程招募数据集上实现了优于单一数据源的性能,并展示了模型在肥胖和久坐人群中的高灵敏度及可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22568 2026-05-22 cs.CR cs.AI 57%

Measuring Security Without Fooling Ourselves: Why Benchmarking Agents Is Hard

在不欺骗自己的情况下衡量安全:为什么基准测试智能体是困难的

Sahar Abdelnabi, Chris Hicks, Konrad Rieck, Ahmad-Reza Sadeghi

机构 * ELLIS Institute Tübingen & MPI-IS & Tübingen AI Center(图宾根ELLIS研究所及MPI-IS与图宾根人工智能中心) The Alan Turing Institute(艾伦·图灵研究所) BIFOLD & Technische Universität Berlin(BIFOLD与柏林技术大学) Technische Universität Darmstadt(达姆施塔特技术大学)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI

AI总结 本文探讨了在安全关键角色中评估AI代理的基准测试存在的核心挑战,包括基准漏洞、时间滞后的不准确性以及运行时的不确定性,并提出了构建更可靠和可信评估框架的方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22505 2026-05-22 cs.AI 57%

Towards Direct Evaluation of Harness Optimizers via Priority Ranking

通过优先级排名直接评估Harness优化器

Kai Tzu-iunn Ong, Minseok Kang, Dongwook Choi, Junhee Cho, Seungju Kim, Seungwon Lim, Geunha Jang, Minwoo Oh, Bogyung Jeong, Sunghwan Kim, Taeyoon Kwon, Jinyoung Yeo

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出通过优先级排名直接评估Harness优化器,以解决传统方法中因缺乏oracle harness而无法有效评估优化器中间步骤的问题,展示了该方法在多步骤优化中的可靠性。

Comments Preprint. Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22387 2026-05-22 cs.LG cs.CE 57%

Hybrid Kolmogorov-Arnold Network and XGBoost Framework for Week-Ahead Price Forecasting in Australia's National Electricity Market

混合 Kolmogorov-Arnold 网络与 XGBoost 框架用于澳大利亚国家电力市场的周 ahead 电价预测

Houxuan Zhou, Sriram Prasad, Chenghao Huang, Jiajie Feng, Hao Wang

机构 * Department of Data Science and AI, Faculty of IT, Monash University, Australia(数据科学与人工智能系,IT学院,墨尔本大学,澳大利亚) School of Electrical Engineering and Computer Science, University of Queensland, Australia(电气工程与计算机科学学院,昆士兰大学,澳大利亚) Monash Energy Institute, Monash University, Australia(墨尔本能源研究所,墨尔本大学,澳大利亚)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本文提出了一种混合 KAN+XGBoost 框架,用于预测澳大利亚国家电力市场的周 ahead 电价,该框架结合了 Kolmogorov-Arnold 网络的全局非线性表示能力和 XGBoost 的局部鲁棒性,以捕捉长期依赖和短期价格波动,实验表明该模型在 MAE 上比 XGBoost 和 naive 基线模型分别减少了 12% 和 50% 以上。

Comments The 24th IEEE International Conference on Industrial Informatics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22306 2026-05-22 cs.MA cs.AI 57%

ACCoRD: Actor-Critic Conflict Resolution with Deep learning for O-RAN xApps

ACCoRD:基于深度学习的O-RAN xApps中的Actor-Critic冲突解决

Cezary Adamczyk, Adrian Kliks

机构 * Institute of Radiocommunications(无线电通信研究所) Poznan University of Technology(波兹南技术大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于深度学习的Actor-Critic冲突解决方法ACCoRD,用于在O-RAN xApps中实时解决控制冲突,通过强化学习算法PPO-Clip训练人工神经网络,提高了规则方法在中高流量场景下的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22291 2026-05-22 cs.LG 57%

Long-term Fairness with Selective Labels

长期公平性与选择性标签

Giovani Valdrighi, Isabel Valera, Marcos Medeiros Raimundo

机构 * Department of Computer Science, Saarland University, Saarbrücken, Germany(萨尔布吕肯大学计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文研究了在选择性标签设置下长期公平性的问题,提出了一种新的框架,通过结合观测数据和标签预测模型来估计真实的公平性度量,并提出了一种新的强化学习算法以实现有效长期公平决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21958 2026-05-22 cs.CL 57%

Diagnosis Is Not Prescription: Linguistic Co-Adaptation Explains Patching Hazards in LLM Pipelines

诊断并非处方:语言共适应解释了LLM流水线中的修补危害

Yoon Jeonghun, Kim Dongchan

机构 * KAIST (Korea Advanced Institute of Science and Technology)(韩国科学技术院) NAVER Corp.(NAVER公司)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文研究了多模块LLM代理失败时,诊断与修补之间的矛盾,发现路由模块虽为瓶颈,但注入修正示例反而降低性能,而修正查询重写模块则更有效,提出了语言合同假说解释这种现象。

Comments Preprint. Under review at EMNLP 2026 (ARR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21800 2026-05-22 cs.LG cs.RO 57%

stable-worldmodel: A Platform for Reproducible World Modeling Research and Evaluation

stable-worldmodel: 一个用于可重复世界建模研究和评估的平台

Lucas Maes, Quentin Le Lidec, Luiz Facury, Nassim Massaudi, Ayush Chaurasia, Francesco Capuano, Richard Gao, Taj Gillin, Dan Haramati, Damien Scieur, Yann LeCun, Randall Balestriero

机构 * Mila & Université de Montréal(Mila与蒙特利尔大学) New York University(纽约大学) Universidade Federal de Minas Gerais(巴西联邦大学矿务学院) Independent Researcher(独立研究者) LanceDB University of Oxford(牛津大学) Brown University(布朗大学)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本文提出stable-worldmodel平台,旨在解决世界建模研究中代码库、数据管道和评估协议碎片化的问题,通过提供高性能的数据层、现代世界模型基线和规划求解器的实现,以及扩展的环境和任务,实现标准化和可重复的世界建模研究和评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21694 2026-05-22 cs.CR cs.AI 57%

PocketAgents: A Manifest-Driven Library of Autonomous Defense Agents

PocketAgents: 一种基于manifest的自主防御代理库

Sidnei Barbieri, Ágney Lopes Roth Ferraz, Lourenço Alves Pereira Júnior

机构 * Aeronautics Institute of Technology(航空技术研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出PocketAgents,一种基于manifest的自主防御代理库,通过定义代理的manifest、prompt和运行时上下文,实现了对大型语言模型驱动的防御系统进行可测量、可扩展和可追溯的防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21482 2026-05-21 cs.AI 57%

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation

DeepWeb-Bench: 一个要求大规模跨源证据和长周期推导的深度研究基准

Sixiong Xie, Zhuofan Shi, Haiyang Shen, Jiuzheng Wang, Siqi Zhong, Mugeng Liu, Chongyang Pan, Peilun Jia, Baoqing Sun, Xiang Jing, Yun Ma

机构 * Peking University(北京大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出DeepWeb-Bench基准,通过要求大规模证据收集、跨源验证和长周期推导,评估前沿语言模型在深度研究任务中的能力,揭示检索并非瓶颈,强弱模型失败方式不同,且模型在不同领域表现出专业性。

Comments Work in Progress. 27 pages, 10 figures, 4 tables. Project page: https://sixiongxie1001-dot.github.io/deep-research-benchmark2.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20609 2026-05-21 cs.LG 57%

Compositional Transduction with Latent Analogies for Offline Goal-Conditioned Reinforcement Learning

基于潜在类比的组合转导用于离线目标条件强化学习

Junseok Kim, Dohyeong Kim, Mineui Hong, Songhwai Oh

机构 * Department of Electrical and Computer Engineering and ASRI, Seoul National University(电气与计算机工程系和首尔国立大学ASRI) Independent researcher(独立研究者) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种基于潜在类比的组合转导方法,用于解决离线目标条件强化学习中面对新情境时的目标泛化问题,通过引入新的类比表示方法,提升了在不同情境下的目标达到能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24697 2026-05-21 cs.AI 57%

Can Current Agents Close the Discovery-to-Application Gap? A Case Study in Minecraft

当前智能体能否缩小发现到应用的差距?Minecraft中的一个案例研究

Zhou Ziheng, Huacong Tang, Jinyuan Zhang, Haowei Lin, Bangcheng Yang, Qian Long, Fang Sun, Yizhou Sun, Yitao Liang, Ying Nian Wu, Demetri Terzopoulos, Xiaofeng Gao

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Peking University(北京大学) Amazon(亚马逊)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文通过Minecraft中的SciCrafter基准测试,探讨了智能体在发现因果规律并将其应用于构建功能系统(发现-应用循环)方面的能力,发现前沿模型在该任务中的成功率约为26%,揭示了知识识别和问题提出能力成为当前AI的瓶颈。

Comments Preprint, under review. 41 pages. Project page: https://scicrafter-bench.github.io/. Code: https://github.com/scicrafter-bench/scicraft-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27747 2026-05-21 cs.CV cs.AI 57%

AI-Powered Facial Mask Removal Is Not Suitable For Identification

基于AI的面部遮挡去除并不适合识别

Emily A Cooper, Hany Farid

机构 * Herbert Wertheim School of Optometry & Vision Science University of California, Berkeley(赫伯特·韦瑟姆视觉科学学院,加州大学伯克利分校) School of Information University of California, Berkeley(信息学院,加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文研究了基于AI的面部遮挡去除技术的有效性和风险,探讨其在真实身份匹配中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20510 2026-05-21 cs.CV cs.AI cs.CY 57%

ShadeBench: A Benchmark Dataset for Building Shade Simulation in Sustainable Society

ShadeBench: 一个用于可持续社会建筑阴影模拟的基准数据集

Longchao Da, Mithun Shivakoti, Xiangrui Liu, T Pranav Kutralingam, Yezhou Yang, Hua Wei

机构 * School of Computing and Augmented Intelligence, Arizona State University(计算与增强智能学院,亚利桑那州立大学) Global Futures Laboratory, Arizona State University(全球未来实验室,亚利桑那州立大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本文提出ShadeBench,一个用于城市阴影理解的综合数据集和基准,通过多模态数据支持阴影生成、分割和3D建筑重建,并提供标准化评估协议和基线方法,为数据驱动的城市气候研究和热适应城市规划提供基础。

Comments 12 pages, 13 figures, 2 tables. Accepted by KDD 2026 AI for Sciences Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20423 2026-05-21 cs.AI 57%

OSCToM: RL-Guided Adversarial Generation for High-Order Theory of Mind

OSCToM: 用于高阶理论之心的强化学习引导对抗生成

Sharmin Sultana Srishty, Kazi Mahathir Rahman, Malaika Parizat Sakkhi, Samia Shahid Prianna, Shaikhul Islam Sinat

机构 * Department of Computer Science(计算机科学系) BRAC University(布拉克大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出OSCToM,一种结合强化学习、领域特定语言和组合替代模型的方法,用于建模LLM中的嵌套信念冲突,通过生成观察者-自我冲突来提升复杂社会场景下的理论之心推理能力。

Comments 15 pages, 12 figures containing 15 images, 3 tables. Code available at https://github.com/sharminsrishty/osct

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20200 2026-05-21 cs.HC cs.AI 57%

Evaluating multimodal emotion recognition in proactive conversational agents: A user study

评估主动对话代理中的多模态情绪识别:一项用户研究

Adnana Dragut, Raquel Lacuesta, F. Xavier Gaya-Morey, Jose M. Buades-Rubio

机构 * I3A (Institute of Engineering Research of Aragon)(阿拉贡工程研究院) Universidad de Zaragoza(萨拉戈塔大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文研究了多模态情绪识别在主动对话代理中的应用,通过用户研究验证了视觉和语言分析模块的有效性,发现语言分析比视觉线索更可靠,并探讨了SIAs在情绪引导中的潜力与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16359 2026-05-21 cs.SE 57%

LLM4Log: A Systematic Review of Large Language Model-based Log Analysis

LLM4Log: 大型语言模型基于日志分析的系统综述

Zeyang Ma, Jinqiu Yang, Tse-Hsun Chen

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 本文系统综述了基于大型语言模型的日志分析,涵盖从日志生成维护到解析结构化及下游任务如异常检测、故障预测、根本原因分析和日志摘要的全流程,总结了常见设计模式和评估实践,并指出可靠实际应用中的关键挑战和开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏