arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15801 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15801 篇

2607.17751 2026-07-31 cs.IR cs.AI cs.CL 交叉投稿 76%

MagicSelector: Joint Optimization for Agent Tool Selection via Counterfactual Decomposition and Progressive Reranking

MagicSelector:通过反事实分解和渐进重排实现智能体工具选择的联合优化

HONOR Agentic Search Team, Zhengzong Chen, Lei Tang, Lijun Liu, Chuandi Jiang, Fan Yang, Keyun Chu, Chu Zhao, Shihao Liu, Minghang Li, Bo Liang, Can Wen, Hailong Wu, Jingnan Ju, Mian Liu, Nengbin Zhang, Peiqiang Wang, Penghe Nie, Qinhui Gu, Sijia Lv, Siqi Chen, Wei Zhang, Yang Xu, Yuhao Qian, Yuxiang Zhang, Zeng Cheng, Zhen Wang, Zuan Chen, Yuanyuan Zhao, Fei Huang

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL

AI总结 研究智能体工具检索问题,提出MagicSelector联合优化框架,含反事实任务分解、渐进重排和动态Top-K策略,经实验验证,该框架在工具检索准确性、OOD泛化能力和整体令牌效率方面显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18063 2026-07-21 cs.CR cs.AI cs.LG 新提交 76%

Adaptive Adversaries: A Multi-Turn, Multi-LLM Benchmark for LLM Agent Security

自适应对手:用于大语言模型智能体安全的多轮、多大语言模型基准测试

Devina Jain, David Hartmann, Chuan Li

机构 * Lambda

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

AI总结 该研究提出针对无记忆大语言模型防御者的自适应多轮攻击的21场景基准测试,通过观察防御者响应灵活调整攻击。介绍了不同攻击轮次成功率,汇集多个前沿攻击者大语言模型的情况,还指出不同防御者弱点差异及场景排名不一致性,并发布了相关基准测试及数据集。

Comments Second Workshop on Agents in the Wild: Safety, Security, and Beyond

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07859 2026-07-10 cs.AI cs.HC cs.LG 新提交 76%

Feedback Manipulation Regularization: Enabling Offline Agent Alignment for Imitation Learning

反馈操纵正则化:实现用于模仿学习的离线智能体对齐

Benjamin Poole, Minwoo Lee

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

AI总结 研究聚焦强化学习智能体行为与人类价值观对齐。提出反馈操纵正则化算法,利用评估反馈校正模仿学习策略。通过改编安全体育馆环境测试,该方法能提升适应性、减少对齐错误,在有限数据下也保持稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02615 2026-07-10 cs.CR cs.AI cs.SE 新提交 76%

TAG: A Lightweight Framework for Test-Driven Agentic Artifact Generation

代理创建,我们验证:用于代理工件生成的轻量级框架

Yaniv Melamed, Yoni Zukerman, Michal Shechter, Miri Weissler, Ashwin Patil, Hani Neuvirth-Telem

机构 * Microsoft(微软)

专题命中 Agent评测 :agentic(title);分类 cs.AI、cs.SE

AI总结 研究如何用大语言模型生成结构化工件并使其可靠用于生产部署。核心方法是基于“LLMs生成,我们验证”原则构建轻量级框架,贡献是提出含三关键属性的框架并在安全领域验证,还可用于其他工件生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05458 2026-07-08 cs.LG cs.AI 新提交 76%

Learning to Control LLM Agent Harnesses with Offline Reinforcement Learning

利用离线强化学习学习控制大语言模型智能体的执行框架

Haiwen Yi, Xinyuan Song

机构 * University of Toronto(多伦多大学) Emory University(埃默里大学)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

AI总结 研究提出将大语言模型智能体的执行框架视为可学习控制层,通过有限 horizon 的框架马尔可夫决策过程,利用离线强化学习训练轻量级控制器,在多领域实验中改进验证行为、提高任务质量,证明框架控制可学习且离线支持有局限。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10687 2026-07-03 cs.MA cs.AI cs.CL cs.GT 版本更新 76%

Who Gets the Reward & Who Gets the Blame? Evaluation-Aligned Training Signals for Multi-LLM Agents

谁获得奖励 & 谁受到责备?面向多LLM智能体的评估对齐训练信号

Chih-Hsuan, Yang, Tanwi Mallick, Le Chen, Krishnan Raghavan, Amal Gueroudji, Ian T. Foster, Rajeev Thakur

机构 * Argonne National Laboratory(阿贡国家实验室) University of Chicago(芝加哥大学)

专题命中 Agent评测 :agent(abstract,comments);multi-agent(abstract);分类 cs.AI、cs.CL;planning(comments)

AI总结 提出一个理论框架,结合合作博弈归因与过程奖励建模,将系统级评估转化为智能体信用和消息级信号,用于多LLM智能体训练。

Comments Accepted at the NeurIPS 2025 Workshop on Bridging Language, Agent, and World Models for Reasoning and Planning (LAW 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26294 2026-06-26 cs.LG cs.AI cs.MA cs.NE 新提交 76%

The Red Queen Gödel Machine: Co-Evolving Agents and Their Evaluators

红皇后哥德尔机:共同进化的智能体及其评估者

Alex Iacob, Andrej Jovanović, William F. Shen, Daniel Burkhardt, Meghdad Kurmanji, Nurbek Tastan, Lorenzo Sani, Niccolò Alberto Elia Venanzi, Ambroise Odonnat, Zeyu Cao, Bill Marino, Xinchi Qiu, Nicholas D. Lane

专题命中 Agent评测 :agent(abstract,comments);agentic(abstract);分类 cs.AI、cs.LG;multi-agent(comments)

AI总结 提出红皇后哥德尔机(RQGM),一种在非平稳效用下实现递归自我改进的进化框架,通过受控效用演化在编码、论文写作和证明任务上超越现有自我改进智能体。

Comments 13 pages main text + 21 pages appendix (38 pages total, incl. references); 11 figures (7 main text + 4 appendix); 10 tables (2 main text + 8 appendix). Preliminary preprint; work in progress. Keywords: self-improving agents, learned evaluation, multi-agent systems, auto-mated scientific discovery, controlled utility evolution, co-evolutionary search, autoresearch

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10580 2026-06-23 cs.CL cs.AI cs.CY cs.HC 76%

An Offline Mobile Conversational Agent for Mental Health Support: Learning from Emotional Dialogues and Psychological Texts with Student-Centered Evaluation

面向心理健康支持的离线移动对话代理:通过情感对话和心理文本学习并以学生为中心评估

Vimaleswar A, Prabhu Nandan Sahu, Nilesh Kumar Sahu, Haroon R. Lone

机构 * Department of Electrical Engineering and Computer Science, Indian Institute of Science Education and Research Bhopal(电子工程与计算机科学系,比哈尔印度科学教育与研究中心)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL

AI总结 本文提出EmoSApp,一个离线智能手机应用,利用定制知识数据集训练的语言模型,提供心理健康支持,并通过学生和专业人员的定性评估及多项基准测试验证其在低资源环境下的有效性。

Journal ref https://aclanthology.org/2025.ijcnlp-long.191/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04111 2026-05-22 cs.SE cs.AI cs.HC 76%

CentaurEval: Benchmarking Human-in-the-Loop Value in Agentic Coding

CentaurEval: 评估人机协同在编程中的价值

Hanjun Luo, Chiming Ni, Jiaheng Wen, Zhimu Huang, Yiran Wang, Bingduo Liao, Sylvia Chung, Yingbin Jin, Xinfeng Li, Wenyuan Xu, XiaoFeng Wang, Hanan Salam

机构 * New York University Abu Dhabi(纽约大学阿布扎克校区) Nanyang Technological University(南洋理工大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Harvard University(哈佛大学) Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学) Beijing University of Technology(北京理工大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 Agent评测 :agentic(title);分类 cs.AI、cs.SE

AI总结 本文提出CentaurEval基准测试,用于评估人机协同在编程中的价值。该基准测试通过协作必要问题模板,结合人类推理和AI效率,展示了人机协作在编程任务中的显著优势。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10990 2026-05-13 cs.SE cs.AI 76%

Skill Drift Is Contract Violation: Proactive Maintenance for LLM Agent Skill Libraries

技能漂移是合同违约:为LLM代理技能库的主动维护

Linfeng Fan, Yuan Tian, Ziwei Li, Zhiwu Lu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院 Gallagher 学院) King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.SE

AI总结 本文提出通过提取可执行环境合同来检测LLM代理技能库中的技能漂移,通过区分噪声监控与精准维护信号,提升检测精度和修复效果,同时发布了一个技能退化基准数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08618 2026-04-30 cs.IR cs.AI cs.SE 76%

SkillForge: Forging Domain-Specific, Self-Evolving Agent Skills in Cloud Technical Support

SkillForge: 在云技术支持中锻造领域特定的自我进化代理技能

Xingyan Liu, Xiyue Luo, Linyu Li, Ganghong Huang, Jianfeng Liu, Honglin Qiao

机构 * Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.SE

AI总结 SkillForge通过闭环创建-评估-改进机制,解决云技术支持中领域特定技能缺乏和持续优化的问题,实验表明其能显著提升技能质量。

Comments Accepted at ACM SIGIR 2026 Industry Track. 18 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22934 2026-04-28 cs.AI cs.CL 76%

PExA: Parallel Exploration Agent for Complex Text-to-SQL

PExA:复杂文本到SQL的并行探索代理

Tanmay Parekh, Ella Hofmann-Coyle, Shuyi Wang, Sachith Sri Ram Kothur, Srivas Prasad, Yunmo Chen

机构 * University of California Los Angeles(加州大学洛杉矶分校) Bloomberg(彭博)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL

AI总结 本文提出PExA,通过软件测试覆盖视角解决文本到SQL的延迟与性能权衡问题,通过并行执行测试用例确保语义覆盖,最终生成准确的SQL。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12261 2026-04-21 cs.CL cs.AI 76%

Infherno: End-to-end Agent-based FHIR Resource Synthesis from Free-form Clinical Notes

Infherno:从非结构化临床笔记到端到端的FHIR资源合成

Johann Frei, Nils Feldhus, Lisa Raithel, Roland Roller, Alexander Meyer, Frank Kramer

机构 * IT-Infrastructure for Translational Medical Research(转化医学研究信息基础设施) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所) Technische Universität Berlin(柏林技术大学) German Research Center for Artificial Intelligence (DFKI), Berlin(德国人工智能研究中心(DFKI),柏林) IKIM, Charité - Universitätsmedizin Berlin(IKIM,柏林夏里特大学医学中心)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL

AI总结 本文提出Infherno框架,利用LLM代理、代码执行和医疗术语数据库工具,解决从非结构化临床笔记到FHIR资源的端到端合成问题,实现与人类基线的竞争力。

Comments EACL 2026 System Demonstrations | Code: https://github.com/j-frei/Infherno | Demo: https://infherno.misit-augsburg.de

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01508 2026-04-03 cs.SE cs.AI 76%

ToolMisuseBench: An Offline Deterministic Benchmark for Tool Misuse and Recovery in Agentic Systems

ToolMisuseBench: 一个用于代理系统中工具误用和恢复的离线确定性基准

Akshey Sigdel, Rista Baral

机构 * Independent Researcher(独立研究员)

专题命中 Agent评测 :agentic(title);分类 cs.AI、cs.SE

AI总结 本文提出ToolMisuseBench,用于评估代理系统中工具误用和恢复的性能,包含6800个任务和可复现的评估流程,展示了基于模式意识方法的故障恢复优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23937 2026-03-26 cs.CL cs.LG 76%

Dialogue to Question Generation for Evidence-based Medical Guideline Agent Development

对话到问题生成用于基于证据的医疗指南代理开发

Zongliang Ji, Ziyang Zhang, Xincheng Tan, Matthew Thompson, Anna Goldenberg, Carl Yang, Rahul G. Krishnan, Fan Zhang

机构 * Google Research(谷歌研究) University of Toronto(多伦多大学) Vector Institute Canada(加拿大向量研究所) Emory University(埃默里大学)

专题命中 Agent评测 :agent(title);分类 cs.CL、cs.LG

AI总结 本文探讨利用大语言模型生成基于证据的问题,以辅助医生在短时间内进行诊疗决策,通过两种提示策略评估模型效果,结果显示LLM能生成具有临床意义的问题,有助于减轻医生认知负担。

Comments 9 pages. To appear in Proceedings of Machine Learning Research (PMLR), Machine Learning for Health (ML4H) Symposium 2025

Journal ref Proceedings of Machine Learning Research 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13399 2026-03-19 cs.CV cs.AI cs.LG 76%

EdiVal-Agent: An Object-Centric Framework for Automated, Fine-Grained Evaluation of Multi-Turn Editing

EdiVal-Agent:一个面向多轮编辑自动细粒度评估的对象中心框架

Tianyu Chen, Yasi Zhang, Zhi Zhang, Peiyu Yu, Shu Wang, Zhendong Wang, Kevin Lin, Xiaofei Wang, Zhengyuan Yang, Linjie Li, Chung-Ching Lin, Jianwen Xie, Oscar Leong, Lijuan Wang, Ying Nian Wu, Mingyuan Zhou

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of California, Los Angeles(加州大学洛杉矶分校) Microsoft AI Superintelligence(微软人工智能超智实验室) Lambda, Inc(Lambda公司)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

AI总结 本文提出EdiVal框架,通过对象中心视角实现多轮编辑的细粒度评估,引入EdiVal-IF、EdiVal-CC和EdiVal-VQ三个指标,构建多轮编辑基准测试平台,用于识别现有编辑模型的失败模式。

Comments Tianyu Chen and Yasi Zhang contributed equally; Oscar Leong, Lijuan Wang, Ying Nian Wu, and Mingyuan Zhou advised equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03142 2026-03-04 cs.CL cs.AI 76%

APRES: An Agentic Paper Revision and Evaluation System

APRES:一种代理论文修订与评估系统

Bingchen Zhao, Jenny Zhang, Chenxi Whitehouse, Minqi Jiang, Michael Shvartsman, Abhishek Charnalia, Despoina Magka, Tatiana Shavrina, Derek Dunfield, Oisin Mac Aodha, Yoram Bachrach

机构 * Meta Superintelligence Labs(Meta 超智能实验室) University of Edinburgh(爱丁堡大学)

专题命中 Agent评测 :agentic(title);分类 cs.AI、cs.CL

AI总结 APRES利用大型语言模型改进论文质量,通过评估标准提升引用预测,79%的专家更喜欢修订后的论文。

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.00377 2026-01-15 cs.HC cs.AI cs.CV cs.LG 76%

Beyond One-Size-Fits-All: A Survey of Personalized Affective Computing in Human-Agent Interaction

超越通用方案:人机交互中个性化情感计算的综述

Jialin Li, Maha Elgarf, Alia Waleed, Hanan Salam

机构 * Social Machines & Robotics (SMART) Lab, and the Center of AI & Robotics (CAIR), New York University, Abu Dhabi(社会机器与机器人(SMART)实验室,以及人工智能与机器人中心(CAIR),纽约大学阿布扎克分校) SMART Lab, New York University, Abu Dhabi(社会机器与机器人实验室,纽约大学阿布扎克分校)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

AI总结 本文综述了人机交互中个性化情感计算的方法与挑战,提出分类体系并分析了不同交互模式和情境下的个性化技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00316 2025-11-05 cs.LG cs.AI q-bio.QM 76%

Surrogate modeling of Cellular-Potts Agent-Based Models as a segmentation task using the U-Net neural network architecture

Tien Comlekoglu, J. Quetzalcóatl Toledo-Marín, Tina Comlekoglu, Douglas W. DeSimone, Shayn M. Peirce, Geoffrey Fox, James A. Glazier

机构 * Department of Biomedical Engineering, University of Virginia(生物医学工程系,弗吉尼亚大学) Department of Cell Biology, University of Virginia(细胞生物学系,弗吉尼亚大学) TRIUMF, Vancouver, BC, Canada(TRIUMF,加拿大温哥华,不列颠哥伦比亚省) Perimeter Institute for Theoretical Physics, Waterloo, ON, Canada(理论物理研究所,加拿大水疗,安大略省) Beirne B. Carter Center for Immunology Research, University of Virginia(免疫学研究中心,弗吉尼亚大学) Biocomplexity Institute and the Department of Computer Science, University of Virginia(生物复杂性研究所和计算机科学系,弗吉尼亚大学) Department of Intelligent Systems Engineering, Indiana University(智能系统工程系,印第安纳大学)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03665 2025-11-04 cs.LG cs.AI 76%

A DbC Inspired Neurosymbolic Layer for Trustworthy Agent Design

Claudiu Leoveanu-Condrei

机构 * ExtensityAI

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

Comments 4 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26298 2025-10-31 cs.CL cs.AI 76%

Can Agent Conquer Web? Exploring the Frontiers of ChatGPT Atlas Agent in Web Games

Jingran Zhang, Ning Li, Justin Cui

机构 * UC San Deigo(圣德戈大学) UCLA(加州大学洛杉矶分校)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16275 2025-09-23 cs.CR cs.AI cs.SE 76%

SecureFixAgent: A Hybrid LLM Agent for Automated Python Static Vulnerability Repair

Jugal Gajjar, Kamalasankari Subramaniakuppusamy, Relsy Puthal, Kaustik Ranaware

机构 * Computer Science Department(计算机科学系) Applied Economics Department(应用经济学系)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.SE

Comments 6 pages, 3 figures, 4 tables, 1 algorithm, accepted in the Robustness and Security of Large Language Models (ROSE-LLM) special session at ICMLA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11415 2025-07-15 cs.CL cs.AI 76%

Political Bias in LLMs: Unaligned Moral Values in Agent-centric Simulations

Simon Münker

机构 * Journal for Language Technology and Computational Linguistics(语言技术与计算语言学期刊)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL

Comments 14 pages, 2 tables

Journal ref JLCL 2025, Band 38(2)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05284 2025-06-17 cs.AI cs.LG 76%

Can a Bayesian Oracle Prevent Harm from an Agent?

Yoshua Bengio, Michael K. Cohen, Nikolay Malkin, Matt MacDermott, Damiano Fornasiere, Pietro Greiner, Younesse Kaddar

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

Comments Accepted at UAI 2025 (Uncertainty in Artificial Intelligence). 20 pages, 2 figures. Code available at: https://github.com/saifh-github/conservative-bayesian-public

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21138 2025-05-19 cs.AI cs.LG math.ST stat.ML stat.TH 76%

A Computational Theory for Efficient Mini Agent Evaluation with Causal Guarantees

Hedong Yan

机构 * Institute of Computing Technology Chinese Academy of Sciences(计算技术研究所中国科学院)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00049 2025-05-02 cs.CY cs.CL cs.HC cs.LG 76%

Humanizing LLMs: A Survey of Psychological Measurements with Tools, Datasets, and Human-Agent Applications

Wenhan Dong, Yuemeng Zhao, Zhen Sun, Yule Liu, Zifan Peng, Jingyi Zheng, Zongmin Zhang, Ziyi Zhang, Jun Wu, Ruiming Wang, Shengmin Xu, Xinyi Huang, Xinlei He

机构 * Information Hub, Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)信息中心) School of Psychology, South China Normal University(华南师范大学心理学学院) College of Computer and Cyber Security, Fujian Normal University(福建师范大学计算机与网络安全学院) College of Cyber Security, Jinan University(济南大学网络安全学院)

专题命中 Agent评测 :agent(title);分类 cs.CL、cs.LG

Comments 26 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05295 2025-04-23 cs.CR cs.AI cs.LG 76%

AutoDAN-Turbo: A Lifelong Agent for Strategy Self-Exploration to Jailbreak LLMs

Xiaogeng Liu, Peiran Li, Edward Suh, Yevgeniy Vorobeychik, Zhuoqing Mao, Somesh Jha, Patrick McDaniel, Huan Sun, Bo Li, Chaowei Xiao

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) NVIDIA(NVIDIA公司) Cornell University(康奈尔大学) Washington University, St. Louis(圣路易斯华盛顿大学) University of Michigan, Ann Arbor(安娜堡大学) The Ohio State University(俄亥俄州立大学) UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

Comments ICLR 2025 Spotlight. Project Page: https://autodans.github.io/AutoDAN-Turbo Code: https://github.com/SaFoLab-WISC/AutoDAN-Turbo

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20513 2025-03-03 cs.HC cs.AI cs.LG 76%

Personas Evolved: Designing Ethical LLM-Based Conversational Agent Personalities

Smit Desai, Mateusz Dubiel, Nima Zargham, Thomas Mildner, Laura Spillner

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12633 2025-02-20 cs.CL cs.AI 76%

One Size doesn't Fit All: A Personalized Conversational Tutoring Agent for Mathematics Instruction

Ben Liu, Jihan Zhang, Fangquan Lin, Xu Jia, Min Peng

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14735 2025-02-18 cs.CL cs.AI cs.NE 76%

Agent Skill Acquisition for Large Language Models via CycleQD

So Kuroki, Taishi Nakamura, Takuya Akiba, Yujin Tang

专题命中 Agent评测 :agent(title);分类 cs.AI、cs.CL

Comments To appear at the 13th International Conference on Learning Representations (ICLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏