arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2606.05168 2026-06-05 cs.CL cs.AI cs.LG 67%

Epidemiology of Model Collapse: Modeling Synthetic Data Contamination via Bilayer SIR Dynamics

模型崩溃的流行病学:通过双层SIR动力学建模合成数据污染

Xiangyu Wang

机构 * Xiangyu Wang(王翔宇)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出双层耦合SIR/SIRS框架,将数据语料库和AI模型视为两个相互作用的群体,通过交叉层传播模拟合成数据污染导致的模型崩溃,并推导基本再生数R0,实验验证了阈值动力学和干预策略的有效性。

Comments 24 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04261 2026-06-04 cs.AI cs.CL cs.CV cs.ET cs.LG 67%

Can Generalist Agents Automate Data Curation?

通用智能体能否自动化数据筛选?

Feiyang Kang, Hanze Li, Adam Nguyen, Mahavir Dabas, Jiaqi W. Ma, Frederic Sala, Dawn Song, Ruoxi Jia

机构 * Virginia Tech(弗吉尼亚理工大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出Curation-Bench基准,通过通用编码智能体自动化数据筛选循环,实验表明现成智能体可达到强基线,但存在执行-研究差距,而结构化方法引导的智能体能在十分之一数据预算下自主组合出优于强基线的数据选择策略。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09464 2026-06-04 cs.SE cs.AI cs.CL 67%

AlgoVeri: An Aligned Benchmark for Verified Code Generation on Classical Algorithms

AlgoVeri:面向经典算法的验证代码生成对齐基准

Haoyu Zhao, Ziran Yang, Jiawei Li, Deyuan He, Zenan Li, Chi Jin, Venugopal V. Veeravalli, Aarti Gupta, Sanjeev Arora

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 为解决跨范式验证代码生成评估缺乏统一方法的问题,提出AlgoVeri基准,在Dafny、Verus和Lean三种语言上评估77个经典算法的验证代码生成,揭示不同验证系统的能力差距。

Comments Accepted to ICML 2026, 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.04968 2026-06-04 cs.RO cs.SY eess.SY math.OC 67%

Asymptotic Optimality of a Time Optimal Path Parametrization Algorithm

时间最优路径参数化算法的渐近最优性

Igor Spasojevic, Varun Murali, Sertac Karaman

专题命中 Agent评测 :agent(abstract,abstract_cn)

AI总结 本文研究了时间最优路径参数化问题,证明了线性时间算法在所有由凸优化方法最优解决的问题中都是渐近最优的,并且刻画了该问题的最优解。

详情

展开后加载摘要…

URL PDF HTML 收藏
1701.06811 2026-06-04 eess.SY cs.SY 67%

Socio-technical Smart Grid Optimization via Decentralized Charge Control of Electric Vehicles

通过电动汽车去中心化充电控制实现社会技术智能电网优化

Evangelos Pournaras, Seoho Jung, Srivatsan Yadhunathan, Huiting Zhang, Xingliang Fang

专题命中 Agent评测 :agent(abstract);planning(abstract)

AI总结 本文从社会技术角度研究电动汽车充电管理问题,提出一种去中心化参与式学习机制,以提升智能电网的可靠性、舒适度和公平性,通过本地知识生成能量需求计划,减少电力峰值和能源成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.11380 2026-06-04 eess.SY cs.SY 67%

YatSim: an Open-Source Simulator For Testing Consensus-based Control Strategies in Urban Traffic Networks

YatSim:用于测试基于共识的控制策略的城市交通网络仿真器

Alexander Martin Dethof, Fabio Molinari

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文提出YatSim,一个开源程序,用于模拟城市交通网络中的基于共识的控制策略。该程序通过执行改进的共识拍卖算法来实现车辆在交叉口的优先通行协议,并利用车载模型预测控制器避免碰撞。

Comments Open-source program documentation

详情

展开后加载摘要…

URL PDF HTML 收藏
1808.04161 2026-06-04 eess.SY cs.SY 67%

Quantization effects and convergence properties of rigid formation control systems with quantized distance measurements

量化效应与刚性编队控制系统的收敛性质

Zhiyong Sun, Hector Garcia de Marina, Brian D. O. Anderson, Ming Cao

专题命中 Agent评测 :agent(abstract,abstract_cn)

AI总结 本文研究了在量化距离测量下刚性编队控制系统的量化效应与收敛性质,分析了均匀量化和对数量化对距离误差收敛的影响,并探讨了非对称均匀量化的作用。

Comments 29 pages, International Journal of Robust and Nonlinear Control 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.03823 2026-06-04 eess.SY cs.SY 67%

Verification of Uncertain POMDPs Using Barrier Certificates

使用屏障证书验证不确定POMDPs

Mohamadreza Ahmadi, Murat Cubuktepe, Nils Jansen, Ufuk Topcu

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract)

AI总结 本文研究不确定POMDPs的验证问题,通过将POMDP转化为切换系统并利用屏障证书方法,结合求和平方编程实现最优性和安全性的验证,以火星探测器为例验证方法有效性。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1709.10237 2026-06-04 eess.SY cs.RO cs.SY 67%

Beacon-referenced Mutual Pursuit in Three Dimensions

三维环境中基于信标的目标互追策略

Kevin S. Galloway, Biswadip Dey

专题命中 Agent评测 :agent(abstract,abstract_cn)

AI总结 本文提出一种三维环境中基于信标的互追控制律,通过引入额外项关注信标,分析了双体互追系统的闭环动态行为,证明在特定参数条件下,系统可形成具有共同半径的圆轨道稳定状态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22480 2026-06-03 cs.AI cs.CL cs.LG 67%

VeRO: A Harness for Agents to Optimize Agents

VeRO: 用于优化智能体的智能体框架

Varun Ursekar, Apaar Shanker, Veronica Chatrath, Yuan Xue, Samuel Marc Denton

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出 VeRO 框架和 VeRO-Bench 基准,通过版本化快照、预算控制评估和结构化执行轨迹来优化智能体代码,并实验比较不同优化器对目标智能体的改进效果。

Comments Accepted to the Forty-Third International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14279 2026-06-03 cs.LG cs.AI cs.CL cs.SI 67%

Whom to Query for What: Adaptive Group Elicitation via Multi-Turn LLM Interactions

为谁查询什么:通过多轮LLM交互的自适应群体征询

Ruomeng Ding, Tianwei Gao, Thomas P. Zollo, Eitan Bachmat, Richard Zemel, Zhun Deng

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Columbia University(哥伦比亚大学) Ben-Gurion University of the Negev(贝内-约尔大学内盖夫分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 针对有限预算下群体属性不确定性降低问题,提出结合LLM期望信息增益与异构图神经网络传播的自适应群体征询框架,实现问题与受访者联合选择,在三个真实数据集上显著提升群体响应预测。

Comments Published as a conference paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02314 2026-06-02 cs.NI 67%

Discovering Agents for Discovery: The Case for DNS

发现智能体:DNS 的案例

Ramachandra Rao Seethiraju, Sameer Thakar, Karthik Shyamsunder, Eric Osterweil

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 本文提出利用 DNS 作为 AI 智能体发现的基础设施,通过评估导航完整性、查找复杂性和事务性能,证明 DNS 能够以低延迟和低数据量支持大规模智能体发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01311 2026-06-02 cs.CL cs.AI cs.LG cs.MA 67%

SkillAdaptor: Self-Adapting Skills for LLM Agents from Trajectories

SkillAdaptor:基于轨迹的LLM智能体自适应技能

Zhuoyun Yu, Xin Xie, Wuguannan Yao, Chenxi Wang, Lei Liang, Xiang Qi, Shumin Deng

机构 * Zhejiang University(浙江大学) Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出SkillAdaptor,一种无训练的步骤级技能自适应框架,通过显式故障归因和针对性更新,提升LLM智能体在长程交互任务中的表现。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00198 2026-06-02 cs.LG cs.AI cs.CL 67%

BAGEN: Are LLM Agents Budget-Aware?

BAGEN:LLM 智能体是否具有预算意识?

Yuxiang Lin, Zihan Wang, Mengyang Liu, Yuxuan Shan, Longju Bai, Junyao Zhang, Xing Jin, Boshan Chen, Jinyan Su, Xingyao Wang, Jiaxin Pei, Manling Li

机构 * Northwestern University(西北大学) O2 Lab(O2实验室) Independent(独立) University of Michigan(密歇根大学) Cornell(康奈尔大学) All Hands AI Stanford(斯坦福大学) UT Austin(德克萨斯大学奥斯汀分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出预算感知智能体(BAGEN)概念,将预算作为主动控制信号而非被动成本指标,通过渐进区间估计方法预测剩余预算上下界,并在四个环境和五个前沿模型上发现强模型不一定具有强预算意识、模型过度乐观等失败模式,早期停止可节省 28-64% 令牌,但精确区间校准仍具挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03554 2026-06-02 cs.LG cs.AI cs.CE cs.CL 67%

When Single Answer Is Not Enough: Rethinking Single-Step Retrosynthesis Benchmarks for LLMs

当单一答案不够时:重新思考面向大语言模型的单步逆合成基准

Bogdan Zagribelnyy, Ivan Ilin, Maksim Kuznetsov, Nikita Bondarev, Mathieu Reymond, Roman Schutski, Thomas MacDougall, Rim Shayakhmetov, Zulfat Miftakhutdinov, Mikolaj Mizera, Vladimir Aladinskiy, Alex Aliper, Alex Zhavoronkov

机构 * DeepMind, London, UK(伦敦英国深度思维公司)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 针对现有逆合成基准依赖单一真实答案的局限,提出基于化学合理性度量ChemCensor的新评估框架,并构建数据集CREED训练模型以提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31572 2026-06-01 cs.CV 67%

nuReasoning: A Reasoning-Centric Dataset and Benchmark for Long-Tail Autonomous Driving

nuReasoning:面向长尾自动驾驶的推理中心数据集与基准

Zhiyu Huang, Johnson Liu, Rui Song, Zewei Zhou, Ruining Yang, Yun Zhang, Tianhui Cai, Hanyin Zhang, Mingxuan Gao, Valeria Xu, Jiali Chen, Yishan Shen, Yiluan Guo, Tony, Qi, Jiaqi Ma

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Motional

专题命中 Agent评测 :agent(abstract);planning(abstract)

AI总结 提出nuReasoning数据集,包含2万段20秒长尾驾驶场景的推理标注,支持空间、决策和反事实推理评估,并证明推理监督可提升VLM和VLA的驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13841 2026-05-29 cs.SD cs.AI cs.CL cs.LG 67%

EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents

EVA-Bench:一种用于评估语音代理的新型端到端框架

Tara Bogavelli, Gabrielle Gauthier Melançon, Katrina Stankiewicz, Oluwanifemi Bamgbose, Fanny Riols, Hoang H. Nguyen, Raghav Mehndiratta, Lindsay Devon Brin, Joseph Marinier, Hari Subramani, Anil Madamala, Sridhar Krishna Nemala, Srinivas Sunkara

机构 * ServiceNow

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出EVA-Bench框架,通过机器人间音频对话模拟和复合指标(EVA-A和EVA-X)全面评估语音代理的准确性和体验质量。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09580 2026-05-28 cs.CR 67%

AICrypto: Evaluating Cryptography Capabilities of Large Language Models

AICrypto:评估大型语言模型的密码学能力

Yu Wang, Yijian Liu, Liheng Ji, Han Luo, Wenjie Li, Xiaofei Zhou, Chiyun Feng, Puji Wang, Yuhan Cao, Geyuan Zhang, Xiaojian Li, Rongwu Xu, Yilei Chen, Tianxing He

专题命中 Agent评测 :agent(abstract,abstract_cn)

AI总结 构建AICrypto基准测试,通过多项选择题、夺旗挑战和证明题评估LLM在密码学知识记忆、漏洞利用和形式推理方面的能力,发现最先进模型在常规任务上匹配或超越人类专家,但在抽象概念理解和多步推理上仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26448 2026-05-27 cs.MA cs.GT cs.NE 67%

Constitutional Arms Races in the Public Goods Game: Co-Evolving LLM Constitutions Under Cooperation-Defection Pressure

公共物品博弈中的宪法军备竞赛:合作-背叛压力下共进化的大语言模型宪法

Ujwal Kumar, Arth Singh, Hershraj Niranjani, Machiko Hirota, Takehiro Takayanagi, Alice Saito, Eiji Kamioka, Phan Xuan Tan

专题命中 Agent评测 :agent(abstract);agentic(abstract)

AI总结 研究在公共物品博弈中,通过LLM引导的进化搜索,发现对抗性宪法共进化在耦合适应度和足够评估预算下可行,并产生可解释的红队测试工件。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24213 2026-05-26 cs.SE cs.AI cs.LG 67%

Towards Evaluation Engineering: An Empirical Study of ML Evaluation Harnesses in the Wild

迈向评估工程:机器学习评估工具在野外的实证研究

Zhimin Zhao, Zehao Wang, Abdul Ali Bangash, Bram Adams, Ahmed E. Hassan

机构 * Software Analysis and Intelligence Lab (SAIL), School of Computing, Queen's University(软件分析与智能实验室(SAIL),计算学院,女王大学) Concordia University(Concordia大学) Lahore University of Management Sciences (LUMS)(拉合尔管理科学大学(LUMS))

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 通过对57个评估工具的实证研究,提出五阶段工具模型,并分类16560个问题,发现规范阶段问题最多(41.4%),主要根因是未实现功能(24.3%)、文档缺失(20.3%)和输入验证缺失(17.2%),为将评估工程作为独立软件工程关注点奠定实证基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19052 2026-05-26 math.AG 67%

The Simplicity of the Hodge Bundle

Hodge 丛的简单性

Anand Patel

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 本文证明了亏格 $g \geq 2$ 的曲线模空间上的 Hodge 丛不包含任何非平凡子丛。

Comments The human had dropped the 4 in Lemma 2.7 during re-write -- now it's been fixed. See Human Comment 2.8

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23215 2026-05-25 cs.LG cs.AI cs.CL 67%

FastKernels: Benchmarking GPU Kernel Generation in Production

FastKernels:生产中GPU内核生成的基准测试

Gabriele Oliaro, Yichao Fu, May Jiang, Owen Lu, Junli Wang, Zhihao Jia, Hao Zhang, Samyam Rajbhandari

机构 * Snowflake AI Research(Snowflake AI研究院) CMU(卡内基梅隆大学) UCSD(加州大学圣地亚哥分校) Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 针对现有基准与生产推理框架脱节的问题,提出FastKernels基准,包含46个代表性架构,覆盖96.2%的HuggingFace Transformers架构,并作为生产级推理框架,评估显示最强代理仅实现0.94倍加速,揭示基准-生产错位是关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23170 2026-05-25 cs.CL cs.AI cs.LG 67%

Positional Failures in Long-Context LLMs: A Blind Spot in Reasoning Benchmarks

长上下文LLM中的位置失败:推理基准测试中的盲点

Chuyifei Zhang, Hongyu Cui, Xiaowen Huang, Jitao Sang

机构 * Beijing Jiaotong University(北京交通大学) Central South University of Forestry and Technology(中央林业科技大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 通过提出上下文旋转评估(CRE)框架,系统控制任务位置、填充内容和上下文长度,揭示了长上下文推理基准测试中因任务位置变化导致的模型性能显著下降,并发现填充-答案干扰是主要错误模式。

Comments 20 pages, 1 figure, 23 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22855 2026-05-25 cs.GT cs.AI cs.CL cs.LG 67%

PrefBench: Evaluating Zero-Shot LLM Agents in Hidden-Preference Personalized Pricing Negotiations

PrefBench:评估隐藏偏好个性化定价谈判中的零样本LLM智能体

Yingjie Lei

机构 * University of Aberdeen(阿伯丁大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出PrefBench基准,通过隐藏偏好模拟评估零样本LLM智能体在个性化定价谈判中的利润表现,发现LLM虽能达成高交易率但利润远低于简单启发式方法。

Comments 24 pages, 3 figures, 5 tables. Code is available at https://github.com/ChaosTheProducer/PrefBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22366 2026-05-22 cs.CV 67%

AgroTools: A Benchmark for Tool-Augmented Multimodal Agents in Agriculture

AgroTools: 一个用于农业中增强工具的多模态代理基准

Zi Ye, Yibin Wen, Xiaoya Fan, Xinyu Zhang, Jing Wu, Kun Zeng, Zurong Mai, Jiarui Zhang, Bohan Shi, Juepeng Zheng, Jianxi Huang, Yutong Lu, Haohuan Fu

机构 * Sun Yat-Sen University(中山大学) Southwest University(西南大学) Northeastern University(东北大学) National Supercomputing Center in Shenzhen(深圳国家超算中心) Southwest Jiaotong University(西南交通大学) China Agricultural University(中国农业大学) Tsinghua University(清华大学)

专题命中 Agent评测 :tool-use(abstract);planning(abstract)

AI总结 本文提出AgroTools基准,用于评估农业中增强工具的多模态代理,通过539个问题-答案实例和1097张异构农业图像,评估模型在工具使用中的执行质量和任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22355 2026-05-22 cs.CL cs.AI cs.LG 67%

TransitLM: A Large-Scale Dataset and Benchmark for Map-Free Transit Route Generation

TransitLM: 一个大规模数据集和基准,用于无地图的公共交通路线生成

Hanyu Guo, Jiedong Yang, Chao Chen, Longfei Xu, Kaikui Liu, Xiangxiang Chu

机构 * Alibaba Group(阿里巴巴集团) AMAP

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出TransitLM,一个包含1300万条公共交通路线规划记录的数据集,用于无地图的公共交通路线生成,展示了通过数据训练模型生成有效路线的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27355 2026-05-22 cs.AI cs.CL cs.SE 67%

LLM Readiness Harness: Evaluation, Observability, and CI Gates for LLM/RAG Applications

LLM Readiness Harness: 评估、可观测性和持续集成门禁用于LLM/RAG应用

Alexandre Cristovão Maiorano

机构 * Lumytics

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 本文提出了一种LLM和RAG应用的准备性框架,通过自动化基准测试、OpenTelemetry可观测性和持续集成质量门禁,将评估转化为部署决策流程,并通过帕累托前沿计算场景加权的准备度分数,展示了在票务路由工作流和BEIR接地任务上的评估结果。

Comments 19 pages, 4 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06743 2026-05-22 cs.DB 67%

OSM+: Billion-Level OpenStreetMap Dataset for City-wide Experiments

OSM+: 亿级开放街图数据集用于城市级实验

Guanjie Zheng, Ziyang Su, Yiheng Wang, Yuhang Luo, Hongwei Zhang, Xuanhe Zhou, Linghe Kong, Fan Wu, Wen Ling

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文提出OSM+数据集,通过分布式云计算处理5000个核心,释放了一个包含10亿个顶点的全球道路网络图数据集,用于高可访问性和可操作性,展示了其在城市边界检测、交通预测和交通政策控制中的应用,同时提供了数据处理工具以加速地理基础模型的训练。

Comments to be published in ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21956 2026-05-22 cs.CY 67%

Detecting Offensive Cyber Agents: A Detection-in-Depth Approach

检测攻击性网络代理:一种深入检测方法

Matt Mittelsteadt, Jam Kraprayoon, Robin Staes-Polet, Oskar Galeev, Jan Wehner, Christopher Covino, Shaun Ee

专题命中 Agent评测 :agent(abstract);agentic(abstract)

AI总结 本文提出了一种深入检测方法,用于检测攻击性网络代理,通过介绍检测-深入战略框架和五个可行的检测机制,以应对新兴威胁。

Comments 95 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21818 2026-05-22 cs.HC 67%

Co-Ontogeny by Archetypal Scaffolding: The Humorphic Partnership

通过原型支架的共发育:人形伙伴关系

Hector Ouilhet Olmos

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 本文提出并操作化了人形伙伴关系的概念,探讨了人与AI伙伴在共享介质中维持外部化、发展中的自我模型,并将伙伴关系本身作为第三分析对象,扩展了人形主义理论,并通过一个开源个人AI代理和其作者的四个月纵向追踪研究,展示了伙伴关系作为成长见证者而非任务助手的特性。

Comments 18 pages, 5 figures, 1 appendix. Open-source artifact at github.com/mrdaemoni/myalicia (MIT). Preregistered multi-participant replication study planned on OSF. Companion essay "The Humorphic Partnership" at myalicia.com. Design philosophy at humorphism.com

详情

展开后加载摘要…

URL PDF HTML 收藏