arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15756 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15756 篇

2604.13552 2026-04-16 cs.CL cs.AI 73%

Training-Free Test-Time Contrastive Learning for Large Language Models

无需训练的测试时对比学习用于大语言模型

Kaiwen Zheng, Kai Zhou, Jinwu Hu, Te Gu, Mingkai Peng, Fei Liu

机构 * South China University of Technology(南方科技大学) Pazhou Laboratory(琶洲实验室)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出无需训练的测试时对比学习(TF-TTCL),通过动态'探索-反思-引导'循环提升冻结大语言模型的在线推理能力,优于零样本基线和代表性测试时适应方法。

Comments Accepted by Findings ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23514 2026-04-14 cs.CL cs.AI 73%

If an LLM Were a Character, Would It Know Its Own Story? Evaluating Lifelong Learning in LLMs

如果一个大语言模型是一个角色,它会知道自己故事吗?评估大语言模型的终身学习

Siqi Fan, Xiusheng Huang, Yiqun Yao, Xuezhi Fang, Kang Liu, Peng Han, Shuo Shang, Aixin Sun, Yequan Wang

机构 * University of Electronic Science and Technology of China(电子科技大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) Nanyang Technological University(南洋理工大学) Peking University(北京大学) Spin Matrix, China(中国Spin Matrix公司)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出LIFESTATE-BENCH基准,评估LLM的终身学习能力,通过Hamlet和合成剧本数据集,发现非参数方法在管理状态学习上表现更优,但所有模型在交互延长时均面临灾难性遗忘问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07070 2026-04-14 cs.AI cs.LG 73%

EVGeoQA: Benchmarking LLMs on Dynamic, Multi-Objective Geo-Spatial Exploration

EVGeoQA:基于动态多目标地理空间探索的LLM基准测试

Jianfei Wu, Zhichun Wang, Zhensheng Wang, Zhiyu He

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Beijing Key Laboratory of Artificial Intelligence for Education(北京市教育人工智能重点实验室) Engineering Research Center of Intelligent Technology and Educational Application, Ministry of Education(教育部智能技术与教育应用工程研究中心) College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机学院)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 EVGeoQA针对动态地理空间探索提出多目标基准,通过电动汽车充电场景设计,评估LLM在动态环境中的探索能力,发现其在长距离空间探索上存在不足,但能通过历史轨迹总结提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09564 2026-04-14 cs.DC cs.AI cs.SE 73%

ACE-Bench: A Lightweight Benchmark for Evaluating Azure SDK Usage Correctness

ACE-Bench:一个轻量级的评估 Azure SDK 使用正确性的基准测试

Wenxing Zhu, Simeng Qi, Junkui Chen, Yan Xie, Min Huang, Jingkan He, Xiao Wang, Cheng Chen, Sijing Meng, Tianqi Zhang

机构 * Microsoft(微软)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 ACE-Bench通过将官方文档示例转化为自包含编码任务,提供快速可重复的通过或失败信号,评估基于LLM的编码代理是否正确使用Azure SDK,同时减少评估成本并提高可重复性。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02781 2026-04-10 cs.LG cs.AI 73%

An Automated Survey of Generative Artificial Intelligence: Large Language Models, Architectures, Protocols, and Applications

生成人工智能的自动化调查:大型语言模型、架构、协议和应用

Eduardo C. Garrido-Merchán, Álvaro López López

专题命中 Agent评测 :agent(abstract);function calling(abstract);分类 cs.AI、cs.LG

AI总结 本文调查了生成人工智能领域,重点分析了前沿大型语言模型的架构、训练方法和性能,涵盖多个模型家族及部署协议,总结了各行业应用案例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05848 2026-04-08 cs.CL cs.AI 73%

Evaluating Learner Representations for Differentiation Prior to Instructional Outcomes

评估学习者表示以区分优先于教学结果

Junsoo Park, Youssef Medhat, Htet Phyo Wai, Ploy Thajchayapong, Ashok K. Goel

机构 * Georgia Institute of Technology, Atlanta, GA, USA(佐治亚理工学院,亚特兰大,佐治亚州,美国)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 本文通过比较学习者与交互层面的表示,探讨如何在无教学结果情况下评估学习者表示的区分能力,发现学习者层面的表示在分离度、聚类结构和判别可靠性上更优。

Comments Accepted to AIED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02648 2026-04-06 cs.SE cs.AI 73%

GBQA: A Game Benchmark for Evaluating LLMs as Quality Assurance Engineers

GBQA:用于评估LLM作为质量保证工程师的博弈基准

Shufan Jiang, Chios Chen, Zhiyang Chen

机构 * The University of Hong Kong(香港大学) Independent Researcher(独立研究者) Westlake University(西湖大学) Datawhale Org(Datawhale组织)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出GBQA基准,通过30款游戏和124个经人类验证的bug测试LLM自主发现软件缺陷的能力,实验表明最佳模型仅能识别48.39%的bug。

Comments Accepted as a workshop paper at the Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00076 2026-04-03 cs.LG cs.AI 73%

Learning to Play Blackjack: A Curriculum Learning Perspective

学习玩21点:从课程学习视角出发

Amirreza Alasti, Efe Erdal, Yücel Celik, Theresa Eimer

机构 * Leibniz University Hannover(莱布尼茨汉诺威大学) Leibniz AI Academy(莱布尼茨人工智能学院)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用大语言模型动态生成课程,提升强化学习在复杂环境中的效率和性能,应用于21点游戏,通过分阶段训练提升Q学习和DQN代理的表现。

Comments Accepted as an oral presentation at the International Conference on Distributed Artificial Intelligence (DAI 2025). 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00022 2026-04-02 cs.CL cs.AI 73%

Criterion Validity of LLM-as-Judge for Business Outcomes in Conversational Commerce

对话商业结果中LLM作为评判者的标准效度准则

Liang Chen, Qi Liu, Wenhuan Lin, Feng Liang

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 本文通过两项研究探讨了LLM作为评判者在对话商业结果中的标准效度,发现评价维度和权重设计影响显著,需通过转换驱动的重新加权来改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24639 2026-04-02 cs.LG cs.AI 73%

Experiential Reflective Learning for Self-Improving LLM Agents

经验反思学习用于自我改进的LLM代理

Marc-Antoine Allard, Arnaud Teinturier, Victor Xing, Gautier Viaud

机构 * Illuin Technology

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出经验反思学习框架,通过反思任务轨迹生成可迁移的启发式方法,提升LLM代理在Gaia2基准上的任务完成可靠性与成功率。

Comments Published as a conference paper at the ICLR 2026 MemAgents Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29999 2026-04-01 cs.SE cs.AI cs.PL 73%

Phyelds: A Pythonic Framework for Aggregate Computing

Phyelds: 一个用于聚合计算的Pythonic框架

Gianluca Aguzzi, Davide Domini, Nicolas Farabegoli, Mirko Viroli

机构 * University of Bologna(博洛尼亚大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出Phyelds,一个针对数据科学实践者的Python库,旨在整合机器学习与聚合计算,提供轻量级的字段 calculus 模型实现,支持联邦学习和多智能体强化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16952 2026-03-31 cs.CL cs.AI 73%

AirQA: A Comprehensive QA Dataset for AI Research with Instance-Level Evaluation

AirQA:一个用于人工智能研究的综合性问答数据集,具有实例级评估

Tiancheng Huang, Ruisheng Cao, Yuxin Zhang, Zhangyi Kang, Zijian Wang, Chenrun Wang, Yijie Luo, Hang Zheng, Lirong Qian, Lu Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院X-LANCE实验室) Shanghai Innovation Institution(上海创新研究院) Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室) Suzhou Laboratory(苏州实验室)

专题命中 Agent评测 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.CL

AI总结 本文提出AirQA数据集,包含13956篇AI论文和1246个问题,支持多任务、多模态和实例级评估,并提出ExTrActor框架提升小模型多轮工具使用能力。

Comments 29 page, 6 figures, 17 tables, accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01331 2026-03-31 cs.CY cs.CL cs.LG 73%

AppellateGen: A Benchmark for Appellate Legal Judgment Generation

AppellateGen:上诉法律判决生成的基准测试

Hongkun Yang, Lionel Z. Wang, Wei Fan, Yiran Hu, Lixu Wang, Chenyu Liu, Yu Zeng, Shenghong Fu, Lei Gong, Zhengxin Zhang, Haoyang Li, Jiexin Zheng, Xin Xu

机构 * Nanyang Technological University(南洋理工大学) Ocean University of China(中国海洋大学) The Hong Kong Polytechnic University(香港理工大学) Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Cornell University(康奈尔大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL、cs.LG

AI总结 本文提出AppellateGen基准测试,包含7351个案例对,用于生成上诉阶段的法律判决,通过模拟司法流程验证模型在上诉推理中的逻辑一致性与挑战。

Comments 15 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24440 2026-03-26 cs.LG cs.AI cs.CV 73%

CUA-Suite: Massive Human-annotated Video Demonstrations for Computer-Use Agents

CUA-Suite:大规模人工标注的视频演示用于计算机使用代理

Xiangru Jian, Shravan Nayak, Kevin Qinghong Lin, Aarash Feizi, Kaixin Li, Patrice Bechard, Spandana Gella, Sai Rajeswar

机构 * ServiceNow University of Waterloo(多伦多大学) Mila Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 CUA-Suite通过提供连续高质量视频演示和密集标注,解决计算机使用代理训练中视频数据不足的问题,包含约55小时的专家视频和600万帧数据,支持多模态研究。

Comments Project Page: https://cua-suite.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22315 2026-03-25 cs.LG cs.AI 73%

Emergency Preemption Without Online Exploration: A Decision Transformer Approach

紧急预emption无在线探索:一种决策变压器方法

Haoran Su, Hanxiao Deng, Yandong Sun

机构 * New York University(纽约大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于决策变压器的紧急走廊优化框架,通过离线返回条件序列建模,实现无在线环境交互的策略学习,提升紧急车辆调度的紧急程度控制,并通过多智能体决策变压器实现空间协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22305 2026-03-25 cs.LG cs.AI 73%

CN-Buzz2Portfolio: A Chinese-Market Dataset and Benchmark for LLM-Based Macro and Sector Asset Allocation from Daily Trending Financial News

CN-Buzz2Portfolio: 一个面向中国市场、基于LLM的宏观与行业资产配置基准数据集

Liyuan Chen, Shilong Li, Jiangpeng Yan, Shuoling Liu, Qiang Yang, Xiu Li

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) E Fund Management Co., Ltd.(E基金管理有限公司) Hong Kong Polytechnic University(香港理工大学)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CN-Buzz2Portfolio数据集,用于评估LLM在动态金融决策中的表现,通过模拟真实市场关注流,测试模型在宏观叙事到资产配置的转换能力,揭示不同模型在资产分配上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20313 2026-03-24 cs.SE cs.AI 73%

Semantic Tool Discovery for Large Language Models: A Vector-Based Approach to MCP Tool Selection

面向大语言模型的语义工具发现:基于向量的方法用于MCP工具选择

Sarat Mudunuri, Jian Wan, Ally Qin, Srinivasan Manoharan

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出基于向量检索的语义工具发现架构,通过语义索引和动态选择机制,显著降低工具调用的token消耗,提升效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15831 2026-03-18 cs.AI cs.CL 73%

Persona-Conditioned Risk Behavior in Large Language Models: A Simulated Gambling Study with GPT-4.1

具有人格条件的风险行为在大语言模型中的表现:基于GPT-4.1的模拟赌博研究

Sankalp Dubedy

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL

AI总结 本文通过模拟赌博实验研究GPT-4.1在不同社会经济人格下的风险行为,发现其行为符合卡尼曼和特沃斯基的前景理论预测,揭示了大语言模型潜在的认知偏差。

Comments 21 pages, 13 figures, 9 tables. Independent research. Submitted to arXiv for open dissemination

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15372 2026-03-17 cs.SE cs.AI cs.CR 73%

SKILLS: Structured Knowledge Injection for LLM-Driven Telecommunications Operations

SKILLS: 为基于LLM的电信运维进行结构化知识注入

Ivo Brett

机构 * independent.academia.edu(独立学术教育)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 研究探讨LLM在电信运维中执行API流程的可靠性,提出SKILLS框架,通过结构化知识指导提升模型性能,实验显示技能增强效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00718 2026-03-11 cs.CL cs.SE 73%

SkillCraft: Can LLM Agents Learn to Use Tools Skillfully?

SkillCraft: 能否让大语言模型代理学会灵活使用工具?

Shiqi Chen, Jingze Gai, Ruochen Zhou, Jinghan Zhang, Tongyao Zhu, Junlong Li, Kangrui Wang, Zihan Wang, Zhengyu Chen, Klara Kaleb, Ning Miao, Siyang Gao, Cong Lu, Manling Li, Junxian He, Yee Whye Teh

专题命中 Agent评测 :agent(abstract);tool-use(abstract);分类 cs.CL、cs.SE

AI总结 SkillCraft基准通过测试代理形成和重用高阶工具组合的能力,评估大语言模型在工具使用中的效率提升与技能积累。

Comments 21 pages. Code: https://github.com/shiqichen17/SkillCraft ; Project page: https://skillcraft-website.github.io/page

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07886 2026-03-10 cs.CL cs.AI 73%

CCR-Bench: A Comprehensive Benchmark for Evaluating LLMs on Complex Constraints, Control Flows, and Real-World Cases

CCR-Bench:一个全面的评估基准,用于评估大语言模型在复杂约束、控制流和现实世界案例中的能力

Xiaona Xue, Yiqiao Huang, Jiacheng Li, Yuanhang Zheng, Huiqi Miao, Yunfei Ma, Rui Liu, Xinbao Sun, Minglu Liu, Fanyu Meng, Chao Deng, Junlan Feng

专题命中 Agent评测 :planning(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 CCR-Bench是一个用于评估大语言模型在复杂约束、控制流和现实世界案例中表现的全面基准,通过现实工业场景的样本揭示了当前模型在复杂指令理解上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19223 2026-03-10 cs.AI cs.LG cs.MA 73%

Characterizing MARL for Energy Control: A Multi-KPI Benchmark on the CityLearn Environment

对MARL在能源控制中的特性进行表征:在CityLearn环境中的一项多KPI基准测试

Aymen Khouja, Imen Jendoubi, Oumayma Mahjoub, Oussama Mahfoudhi, Ruan De Kock, Siddarth Singh, Claude Formanek

机构 * InstaDeep

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文通过多KPI基准测试,评估了MARL在城市能源管理中的性能,揭示了DTDE在平均和最坏情况下的优越性,并探讨了时间依赖学习对电池操作的积极影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05028 2026-03-06 cs.AI cs.CL 73%

Survive at All Costs: Exploring LLM's Risky Behaviors under Survival Pressure

在生存压力下:探索LLM的冒险行为

Yida Lu, Jianwei Fang, Xuyang Shao, Zixuan Chen, Shiyao Cui, Shanshan Bian, Guangyao Su, Pei Ke, Han Qiu, Minlie Huang

机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华大学智能对话AI小组,DCST,清华大学) China Unicom Software Research Institute(中国联合软件研究所) University of Electronic Science and Technology of China(电子科技大学) Institute for Network Sciences and Cyberspace, Tsinghua University(清华大学网络科学与网络空间研究院)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文研究了在生存压力下LLM的冒险行为,通过现实案例和基准测试揭示其潜在风险及缓解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13575 2026-03-03 cs.CL cs.AI 73%

Elo-Evolve: A Co-evolutionary Framework for Language Model Alignment

Elo-Evolve:一种用于语言模型对齐的共进化框架

Jing Zhao, Ting Zhen, Junwei Bao, Hongfei Jiang, Yang Song

机构 * Zuoyebang, Beijing, China(北京中关村)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 Elo-Evolve通过动态多代理竞争和自适应对手选择,提升大型语言模型对齐的稳定性与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24282 2026-03-03 cs.CL cs.AI 73%

SimuHome: A Temporal- and Environment-Aware Benchmark for Smart Home LLM Agents

SimuHome: 一个时间与环境感知的智能家庭LLM代理基准

Gyuhyeon Seo, Jungwoo Yang, Junseong Pyo, Nalim Kim, Jonggeun Lee, Yohan Jo

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院) Department of Information Systems, Hanyang University(翰阳大学信息系统系)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 SimuHome是一个基于Matter协议的智能家庭LLM代理基准,用于评估智能家庭代理在时间与环境感知方面的能力,特别是工作流调度的挑战。

Comments Accepted at ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00051 2026-03-03 cs.DL cs.AI cs.LG 73%

LitBench: A Graph-Centric Large Language Model Benchmarking Tool For Literature Tasks

LitBench: 一种面向文献任务的图中心大型语言模型基准评估工具

Andreas Varvarigos, Ali Maatouk, Jiasheng Zhang, Ngoc Bui, Jialin Chen, Leandros Tassiulas, Rex Ying

机构 * Yale University(耶鲁大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 LitBench是一种用于评估领域特定文献任务的大型语言模型基准工具,通过生成领域特定的文献子图和任务集,提升模型在文献相关任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20640 2026-03-02 cs.AI cs.LG 73%

CoMind: Towards Community-Driven Agents for Machine Learning Engineering

CoMind:面向机器学习工程的社区驱动代理

Sijie Li, Weiwei Sun, Shanda Li, Ameet Talwalkar, Yiming Yang

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 CoMind通过多代理系统和迭代并行探索机制,在Kaggle竞赛中实现了优于人类竞争者的性能,展示了社区驱动代理在机器学习工程中的潜力。

Comments ICLR 2026. Code available at https://github.com/comind-ml/CoMind

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18998 2026-02-24 cs.AI cs.CL 73%

Benchmark Test-Time Scaling of General LLM Agents

通用大语言模型代理的基准测试时间扩展

Xiaochuan Li, Ryan Ming, Pranav Setlur, Abhijay Paladugu, Andy Tang, Hao Kang, Shuai Shao, Rong Jin, Chenyan Xiong

机构 * Language Technologies Institute, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Meta

专题命中 Agent评测 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.CL

AI总结 研究提出General AgentBench基准测试,用于评估通用大语言模型代理在多个技能和工具上的表现,发现顺序和并行扩展方法在实际应用中均存在性能限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03267 2026-02-19 cs.AI cs.CL 73%

GDGB: A Benchmark for Generative Dynamic Text-Attributed Graph Learning

GDGB:生成动态文本属性图学习的基准

Jie Peng, Jiarui Ji, Runlin Lei, Zhewei Wei, Yongchao Liu, Chuntao Hong

机构 * Renmin University of China(中国人民大学) Ant Group(蚂蚁集团)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 GDGB提出一个生成动态文本属性图学习的基准,包含高质量数据集和两个新任务,用于评估生成DyTAG的结构、时间和文本质量。

Comments ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16191 2026-02-19 cs.AI cs.HC cs.LG 73%

Large Language Models for Water Distribution Systems Modeling and Decision-Making

大型语言模型在水分配系统建模与决策中的应用

Yinon Goldshtein, Gal Perelman, Assaf Schuster, Avi Ostfeld

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLM-EPANET框架,利用大型语言模型实现与EPANET的自然语言交互,提升水分配系统建模与决策的效率和透明度。

Comments Accepted to EWRI Congress 2025

详情

展开后加载摘要…

URL PDF HTML 收藏