arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-02 至 2026-02-02 共收录 107 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 11 篇

2509.08312 2026-02-02 cs.AI 79%

Leveraging AI Agents for Autonomous Networks: A Reference Architecture and Empirical Studies

利用AI代理实现自主网络:一种参考架构与实证研究

Binghan Wu, Shoufeng Wang, Yunxin Liu, Ya-Qin Zhang, Joseph Sifakis, Ye Ouyang

机构 * AsiaInfo Technologies Limited(亚洲信息科技有限公司) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学)

专题命中 工作流自动化 :AI agent(title);agent(abstract);分类 cs.AI

AI总结 本文提出利用AI代理实现自主网络的参考架构,并通过实证研究验证了其在提升网络自主性和性能方面的有效性。

Comments 7 pages, 5 figures. This manuscript has been accepted by IEEE Communication Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01228 2026-02-02 cs.DL 78%

The hunt for research data: Development of an open-source workflow for tracking institutionally-affiliated research data publications

寻找研究数据:开发一个开源工作流用于跟踪机构关联的研究数据出版物

Bryan M. Gee

专题命中 工作流自动化 :workflow(title,abstract)

AI总结 本文提出一个开源工作流,用于跟踪机构关联的研究数据出版物,解决数据发现中的元数据标准化和机构识别问题。

Comments 66 pages, 12 figures, 10 tables

Journal ref Journal of eScience Librarianship 15 (2026) e1170

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19378 2026-02-02 cs.CV 78%

Establishing dermatopathology encyclopedia DermpathNet with Artificial Intelligence-Based Workflow

建立基于人工智能的工作流的皮肤病病理学百科全书DermpathNet

Ziyang Xu, Mingquan Lin, Yiliang Zhou, Zihan Xu, Seth J. Orlow, Shane A. Meehan, Alexandra Flamm, Ata S. Moshiri, Yifan Peng

机构 * Perelman Department of Dermatology, NYU Grossman School of Medicine(NYU Grossman医学院皮质病理科系) Weill Cornell Medicine(韦尔医学院) Mount Sinai Health(辛格医院) Department of Population Health Sciences(人群健康科学系)

专题命中 工作流自动化 :workflow(title,abstract)

AI总结 本文提出了一种基于人工智能的混合工作流,用于建立一个全面的开放获取皮肤病病理学图像数据集DermpathNet,通过深度学习和关键词检索相结合的方法,实现了高质量的图像分类和标注。

Comments Accepted by Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22702 2026-02-02 cs.LG 74%

Metric Hub: A metric library and practical selection workflow for use-case-driven data quality assessment in medical AI

Metric Hub: 一个用于医疗AI中以用例为导向的数据质量评估的度量库和实用选择流程

Katinka Becker, Maximilian P. Oppelt, Tobias S. Zech, Martin Seyferth, Sandie Cabon, Vanja Miskovic, Ivan Cimrak, Michal Kozubek, Giuseppe D'Avenio, Ilaria Campioni, Jana Fehr, Kanjar De, Ismail Mahmoudi, Emilio Dolgener Cantu, Laurenz Ottmann, Andreas Klaß, Galaad Altares, Jackie Ma, Alireza Salehi M., Nadine R. Lang-Richter, Tobias Schaeffter, Daniel Schwabe

专题命中 工作流自动化 :workflow(title);分类 cs.LG

AI总结 Metric Hub提出一个医疗AI中以用例为导向的数据质量评估度量库和选择流程,通过度量卡片和决策树提升数据质量评估的实用性与可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23215 2026-02-02 cs.LG 57%

Tackling air quality with SAPIENS

用SAPIENS应对空气质量

Marcella Bona, Nathan Heatley, Jia-Chen Hua, Adriana Lara, Valeria Legaria-Santiago, Alberto Luviano Juarez, Fernando Moreno-Gomez, Jocelyn Richardson, Natan Vilchis, Xiwen Shirley Zheng

机构 * Department of Physics and Astronomy, Queen Mary University of London(量子力学与天文学系,伦敦女王学院) ESFM, Instituto Politécnico Nacional(电子系统与机械工程系,国立理工学院) CIC, Instituto Politécnico Nacional(研究中心,国立理工学院) UPIITA, Instituto Politécnico Nacional(电子工程系,国立理工学院)

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG

AI总结 本文提出SAPIENS方法,结合污染传感器与交通数据,通过改进的交通描述和偏最小二乘回归,实现超本地动态空气质量预测。

Comments 24 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17502 2026-02-02 cs.IR 50%

Pipeline Inspection, Visualization, and Interoperability in PyTerrier

管道检查、可视化与互操作性在PyTerrier中

Emmanouil Georgios Lionis, Craig Macdonald, Sean MacAvaney

专题命中 工作流自动化 :AI agent(abstract)

AI总结 PyTerrier通过提供可编程检查、可视化和互操作性功能,增强了信息检索管道的使用和理解能力。

Comments This preprint has not undergone peer review (when applicable) or any post-submission improvements or corrections. The Version of Record of this contribution is published in ECIR2026 (Part IV) Advances in Information Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20894 2026-02-02 cond-mat.stat-mech cond-mat.mes-hall cond-mat.soft 50%

Fluctuation theorems with optical tweezers: theory and practice

光镊中的涨落定理:理论与实践

Thalyta T. Martins, André H. A. Malavazi, Lucas P. Kamizaki, Artyom Petrosyan, Benjamin Besga, Sergio Ciliberto, Sérgio R. Muniz

专题命中 工作流自动化 :workflow(abstract)

AI总结 本研究通过光镊实验提供涨落定理的理论与实践指南,展示如何测量验证并应用这些定理,同时提供数据集和代码以促进教育和研究应用。

Comments 17 pages, 18 figures; to be published as a Tutorial in the European Physical Journal Plus (EPJ-Plus)

Journal ref Eur. Phys. J. Plus (2026) 141:71

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22654 2026-02-02 cs.CE 50%

Parameter conditioned interpretable U-Net surrogate model for data-driven predictions of convection-diffusion-reaction processes

参数条件可解释U-Net替代模型用于数据驱动的对流-扩散-反应过程预测

Michael Urs Lars Kastor, Jan Rottmayer, Anna Hundertmark, Nicolas Ralph Gauger

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出一种参数条件U-Net模型,用于高效预测对流-扩散-反应过程,通过结合数值方法与数据驱动方法,实现高精度和快速的预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22407 2026-02-02 cond-mat.mtrl-sci 50%

Nanoscale mapping of phase-transformation pathways in medium-Mn TRIP steel by multimodal STEM

中等锰TRIP钢中相变路径的纳米级映射:多模态STEM

Marc Raventós-Tato, S. Leila Panahi, Núria Bagués, David Frómeta, Oleg Usoltsev, Núria Cuadrado, Joaquín Otón

专题命中 工作流自动化 :workflow(abstract)

AI总结 本研究通过多模态STEM技术,实现了中等锰TRIP钢中相变路径的纳米级映射,结合电子衍射与能谱分析,实现了铁、奥氏体和马氏体的相分离与晶格参数细化。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17356 2026-02-02 cs.CR cs.PF 50%

Obfuscation as an Effective Signal for Prioritizing Cross-Chain Smart Contract Audits: Large-Scale Measurement and Risk Profiling

混淆作为优先处理跨链智能合约审计的有效信号:大规模测量与风险画像

Yao Zhao, Zhang Sheng, Shengchen Duan, Shen Wang, Daoyuan Wu, Zhiyuan Wan

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出HOBFNET模型,通过大规模测量和风险画像,实现跨链智能合约审计的高效优先级排序,提升审计效率并支持实际安全操作。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 4 篇

2510.26852 2026-02-02 cs.AI cs.CL 62%

CATArena: Evaluating Evolutionary Capabilities of Code Agents via Iterative Tournaments

CATArena: 通过迭代竞技场评估代码代理的进化能力

Lingyue Fu, Xin Ding, Linyue Pan, Yaoming Zhu, Shao Zhang, Lin Qiu, Weiwen Liu, Weinan Zhang, Xuezhi Cao, Xunliang Cai, Jiaxin Ding, Yong Yu

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际 Graduate School)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 CATArena通过迭代竞技场评估代码代理的进化能力,揭示了代理在连续优化和多轮迭代开发中的潜力及改进机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19494 2026-02-02 cs.SE cs.AI 62%

AACR-Bench: Evaluating Automatic Code Review with Holistic Repository-Level Context

AACR-Bench: 评估自动代码审查的综合仓库级上下文

Lei Zhang, Yongda Yu, Minghui Yu, Xinxin Guo, Zhengqi Zhuang, Guoping Rong, Dong Shao, Haifeng Shen, Hongyu Kuang, Zhengfeng Li, Boge Wang, Guoan Zhang, Bangyu Xiang, Xiaobin Xu

机构 * Southern Cross University, Gold Coast, Australia(南方十字大学) TRE, Alibaba Inc., Hangzhou, China(阿里云)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 AACR-Bench通过综合仓库级上下文和专家验证流程,提升自动代码审查评估的准确性与全面性,揭示上下文粒度和检索方法对性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08341 2026-02-02 cs.LG cs.AI 62%

Post-Norm can Resharpen Attention

Post-Norm 可增强注意力

Pál Zsámboki, Benjamin Levi, David Ansel Josef Smith, Mitansh Kagalwala, Arlington Kell, Samuel Liechty, Cong Wang

机构 * HUN-REN Alfréd Rényi Institute of Mathematics, Budapest, Hungary(匈牙利REN阿弗雷德·雷尼数学研究所) University of Rochester, Rochester, NY, USA(罗切斯特大学) The University of Alabama, Tuscaloosa, AL, USA(阿拉巴马大学) University of Virginia, Charlottesville, VA, USA(弗吉尼亚大学) Georgia Institute of Technology, Atlanta, GA, USA(佐治亚理工学院) Brigham Young University, Provo, UT, USA(Brigham Young大学) Carleton College, Northfield, MN, USA(卡洛尔顿学院)

专题命中 软件智能体 :autonomous agent(abstract);分类 cs.AI、cs.LG

AI总结 Post-Norm通过增强注意力机制,解决Transformer在长度泛化任务中因注意力分散导致的性能下降问题。

Comments 17 pages, 7 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21612 2026-02-02 cs.GT 50%

Incentives in Federated Learning with Heterogeneous Agents

在异质智能体中的联邦学习激励

Ariel D. Procaccia, Han Shao, Itai Shapira

专题命中 软件智能体 :agent(abstract)

AI总结 本文提出了一种基于博弈论的联邦学习激励机制,通过线性规划和 pay what you contribute 规则,实现策略证明和最小化合作成本。

Comments ICLR 2026

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与网页智能体 2 篇

2601.22781 2026-02-02 cs.AI 83%

Learning with Challenges: Adaptive Difficulty-Aware Data Generation for Mobile GUI Agent Training

面对挑战的学习:面向移动GUI代理训练的自适应难度数据生成

Linjia Kang, Zhimin Wang, Yongkang Zhang, Duo Wu, Jinghe Wang, Ming Ma, Haopeng Yan, Zhi Wang

机构 * Tsinghua University(清华大学) Huazhong Agricultural University(华中农业大学)

专题命中 GUI与网页智能体 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 MobileGen通过自适应调整训练难度与代理能力匹配,提升移动GUI代理的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22528 2026-02-02 cs.AI 79%

Darwinian Memory: A Training-Free Self-Regulating Memory System for GUI Agent Evolution

达尔文记忆:一种无训练的自调节记忆系统用于GUI代理进化

Hongze Mi, Yibo Feng, WenJie Lu, Song Cao, Jinyuan Li, Yanming Li, Xuelin Zhang, Haotian Luo, Songyang Peng, He Cui, Tengfei Tian, Jun Fang, Hua Chai, Naiqiang Tan

机构 * Didichuxing Co. Ltd(滴滴出行有限公司) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tianjin University(天津大学) Sun Yat-sen University(中山大学) Fudan University(复旦大学)

专题命中 GUI与网页智能体 :agent(title,abstract);分类 cs.AI

AI总结 达尔文记忆系统通过自进化架构提升GUI代理的执行稳定性与成功率,无需额外训练或架构开销。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 记忆与上下文管理 8 篇

2601.22997 2026-02-02 cs.AI cs.SE 84%

TriCEGAR: A Trace-Driven Abstraction Mechanism for Agentic AI

TriCEGAR:一种基于跟踪的抽象机制用于代理AI

Roham Koohestani, Ateş Görpelioğlu, Egor Klimov, Burcu Kulahcioglu Ozkan, Maliheh Izadi

机构 * JetBrains Research(JetBrains研究)

专题命中 记忆与上下文管理 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 TriCEGAR是一种基于跟踪的自动抽象机制,用于代理AI中在线构建MDP并进行概率模型检查,以提高验证效率和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23487 2026-02-02 cs.AI cs.FL 83%

Are Agents Probabilistic Automata? A Trace-Based, Memory-Constrained Theory of Agentic AI

智能体是概率自动机吗?基于轨迹的、内存受限的智能体AI理论

Roham Koohestani, Ziyou Li, Anton Podkopaev, Maliheh Izadi

机构 * JetBrains Research, Amsterdam, the Netherlands(JetBrains研究院,荷兰阿姆斯特丹) Delft University of Technology, Delft, the Netherlands(代尔夫特理工大学,荷兰代尔夫特) Constructor University, Bremen, Germany(Constructor大学,德国不来梅)

专题命中 记忆与上下文管理 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于轨迹的、内存受限的智能体AI理论,通过自动机理论模型分析智能体与环境交互行为的概率分布,并探讨了不同内存限制下轨迹语言的可判定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22705 2026-02-02 cs.DC 82%

CONCUR: High-Throughput Agentic Batch Inference of LLM via Congestion-Based Concurrency Control

CONCUR: 通过基于拥堵的并发控制实现LLM的高吞吐量代理批推断

Qiaoling Chen, Zhisheng Ye, Tian Tang, Peng Sun, Boyu Tian, Guoteng Wang, Shenggui Li, Yonggang Wen, Zhenhua Han, Tianwei Zhang

专题命中 记忆与上下文管理 :agentic(title,abstract);agent(abstract)

AI总结 CONCUR通过基于拥堵的并发控制,有效缓解LLM批推断中的中间阶段抖动问题,提升吞吐量达4.09倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11914 2026-02-02 cs.AI 79%

EgoMem: Lifelong Memory Agent for Full-duplex Omnimodal Models

EgoMem:全双工多模态模型的终身记忆代理

Yiqun Yao, Naitong Yu, Xiang Li, Xin Jiang, Xuezhi Fang, Wenjia Ma, Xuying Meng, Jing Li, Aixin Sun, Yequan Wang

机构 * Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院) Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院计算技术研究所) Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳学院) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI

AI总结 EgoMem是一种专为全双工多模态模型设计的终身记忆代理,通过异步过程实现用户识别、个性化响应和长期记忆管理,实验显示其在准确性和一致性方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22619 2026-02-02 q-bio.PE 78%

Epigenetic state inheritance drivers drug-tolerant persister-induced resistance in solid tumors: A stochastic agent-based model

表观遗传状态继承驱动药物耐受休眠者诱导固有肿瘤抗性:一种随机群体基于模型

Xiyin Liang, Jinzhi Lei

专题命中 记忆与上下文管理 :agent(title,abstract)

AI总结 本研究通过随机群体基于模型揭示表观遗传状态继承如何驱动药物耐受休眠者诱导固有肿瘤抗性,并展示优化治疗策略可有效延迟肿瘤复发。

Comments 38 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22948 2026-02-02 cs.AI 57%

Alignment among Language, Vision and Action Representations

语言、视觉和动作表征的一致性

Nicola Milano, Stefano Nolfi

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 研究通过训练Transformer智能体执行自然语言指令,发现语言、视觉和动作表征在跨模态中呈现部分共享的语义结构,支持模态无关的语义组织。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22539 2026-02-02 cs.LG stat.CO stat.ML 57%

Neural-Inspired Posterior Approximation (NIPA)

神经启发式后验近似(NIPA)

Babak Shahbaba, Zahra Moslemi

机构 * Department of Statistics UC Irvine(统计学系 乌兹拉大学)

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.LG

AI总结 神经启发式后验近似(NIPA)通过结合基于模型、基于模型和事件控制模块,提出了一种高效的贝叶斯推断采样算法,用于大规模统计机器学习中的不确定性量化。

Comments 13 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22613 2026-02-02 q-bio.CB 50%

Effects of multi-phase control mechanism on fibroblast dynamics: A segmented mathematical modeling approach

多相控制机制对成纤维细胞动态的影响:一种分段数学建模方法

Shuqi Fan, Yuhang Zhang, Jinzhi Lei

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本研究通过分段数学建模方法,探讨多相控制机制对成纤维细胞动态的影响,揭示了细胞大小分布的稳态调控机制及生长反馈的权衡关系。

Comments 30 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. Agent评测 21 篇

2511.09139 2026-02-02 cs.CV 88%

MACEval: A Multi-Agent Continual Evaluation Network for Large Models

MACEval: 一种用于大型模型的多智能体持续评估网络

Zijian Chen, Yuze Sun, Yuan Tian, Wenjun Zhang, Guangtao Zhai

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Shanghai AI Laboratory, Shanghai, China(上海人工智能实验室)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract)

AI总结 MACEval通过多智能体持续评估网络,提出新的度量标准以动态评估大型模型,减少评估开销并提升评估效率。

Comments 32 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20613 2026-02-02 cs.CL 87%

AgentIF-OneDay: A Task-level Instruction-Following Benchmark for General AI Agents in Daily Scenarios

AgentIF-OneDay: 一个面向日常场景的通用AI代理任务级指令遵循基准测试

Kaiyuan Chen, Qimin Wu, Taiyu Hou, Tianhao Tang, Xueyu Hu, Yuchen Hou, Bikun Li, Chengming Qian, Guoyin Wang, Haolin Chen, Haotong Tian, Haoye Zhang, Haoyu Bian, Hongbing Pan, Hongkang Zhang, Hongyi Zhou, Jiaqi Cai, Jiewu Rao, Jiyuan Ren, Keduan Huang, Lucia Zhu Huang, Mingyu Yuan, Naixu Guo, Qicheng Tang, Qinyan Zhang, Shuai Chen, Siheng Chen, Ting Ting Li, Xiaoxing Guo, Yaocheng Zuo, Yaoqi Guo, Yinan Wang, Yinzhou Yu, Yize Wang, Yuan Jiang, Yuan Tian, Yuanshuo Zhang, Yuxuan Liu, Yvette Yan Zeng, Zenyu Shan, Zihan Yin, Xiaobo Hu, Yang Liu, Yixin Ren, Yuan Gong

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);workflow(abstract);agentic(abstract)

AI总结 AgentIF-OneDay是一个面向日常场景的通用AI代理任务级指令遵循基准测试,旨在评估一般用户能否利用自然语言指令和AI代理完成多样化日常任务。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10909 2026-02-02 cs.AI 85%

PaperArena: An Evaluation Benchmark for Tool-Augmented Agentic Reasoning on Scientific Literature

PaperArena: 一个用于科学文献上工具增强代理推理的评估基准

Daoyu Wang, Mingyue Cheng, Shuo Yu, Zirui Liu, Ze Guo, Xin Li, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) Artificial Intelligence Research Institute, iFLYTEK Co., Ltd(人工智能研究院,iFLYTEK有限公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.AI

AI总结 PaperArena提出一个评估基准,用于评估基于LLM的代理在跨多篇论文整合信息并使用外部工具进行推理的能力,实验显示现有代理在复杂任务上的表现有限。

Comments 19 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22269 2026-02-02 cs.AI cs.CL cs.LG 85%

JAF: Judge Agent Forest

JAF:裁判代理森林

Sahil Garg, Brad Cheezum, Sridhar Dutta, Vishal Agarwal

机构 * Averlon

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 JAF通过裁判代理森林框架,利用联合推理和集合学习原理,提升主代理的自我改进能力,通过高效的哈希算法优化多样示例选择,改进推理路径探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22288 2026-02-02 cs.HC cs.AI eess.AS eess.IV 83%

PersonaCite: VoC-Grounded Interviewable Agentic Synthetic AI Personas for Verifiable User and Design Research

PersonaCite: 基于VoC的可访谈代理合成AI人设用于可验证的用户与设计研究

Mario Truss

机构 * Adobe

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 PersonaCite通过检索增强的交互,将AI人设作为证据受限的研究工具,提升用户与设计研究中的可验证性与透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11854 2026-02-02 cs.CL cs.AI cs.MA 81%

ATOD: An Evaluation Framework and Benchmark for Agentic Task-Oriented Dialogue Systems

ATOD: 一种用于代理任务导向对话系统的评估框架和基准

Yifei Zhang, Hooshang Nayyeri, Rinat Khaziev, Emine Yilmaz, Gokhan Tur, Dilek Hakkani-Tür, Hari Thadakamalla

机构 * Amazon(亚马逊)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 ATOD提出了一种评估框架和基准,用于评估代理任务导向对话系统的多目标协调、依赖管理、记忆、适应性和主动性等能力,并通过ATOD-Eval实现了细粒度指标评估。

详情

展开后加载摘要…

URL PDF HTML 收藏