World Craft: Agentic Framework to Create Visualizable Worlds via Text
World Craft: 一种通过文本创建可视化世界的代理框架
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract)
AI总结 World Craft通过文本描述创建可视化世界,结合结构化模块和多代理框架,提升环境构建的效率和可控性。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
World Craft: 一种通过文本创建可视化世界的代理框架
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract)
AI总结 World Craft通过文本描述创建可视化世界,结合结构化模块和多代理框架,提升环境构建的效率和可控性。
基于图神经网络的多跳协作者选择任务特定信任评估
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract)
AI总结 本文提出基于图神经网络的分布式代理人工智能框架,用于多跳协作者选择中的任务特定信任评估,通过整合设备可信度评估结果,实现隐私保护的任务路径规划。
Journal ref IEEE Journal on Selected Areas in Communications, 2026
面向生物背景有限研究者的NGS下游分析代理AI模型开发
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract)
AI总结 本文提出了一种面向生物背景有限研究者的代理AI模型,通过自动化NGS下游分析、文献支持的解释和高级分析方法推荐,实现从基础数据处理到假设验证的无缝过渡。
AGENTSAFE:面向代理AI的统一伦理保障与治理框架
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);planning(abstract)
AI总结 AGENTSAFE提出一个统一的治理框架,通过风险分类转化为可操作的设计、运行时和审计控制,提供可衡量的预部署保障,并通过运行时治理和问责机制建立代理AI生态系统的信任。
Comments 12 pages, 1 figure
机构 * National University of Singapore(新加坡国立大学) ; University of California, Santa Barbara(加州大学圣巴巴拉分校) ; Singapore University of Technology and Design(新加坡科技设计大学)
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL、cs.LG
Comments 49 pages, 9 figures. Accepted by NeurIPS 2025 D&B Track
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract)
专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG
机构 * Wuhan University of Technology(武汉理工大学) ; Agency for Science, Technology and Research, Singapore(新加坡科技研究局) ; Hubei University(湖北大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG
机构 * Kunming University of Science and Technology(昆明理工大学)
专题命中 Agent评测 :agent(title,abstract);planning(abstract);agentic(abstract)
机构 * New York University(纽约大学) ; NYU Langone Health(纽约大学兰格医学中心) ; Genentech(基因泰克) ; NYU Grossman School of Medicine(纽约大学格罗斯曼医学院) ; Wenzhou Medical University(温州医科大学) ; Macau University of Science and Technology(澳门科学大学)
专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG
机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; University of Tokyo(东京大学) ; Tsinghua University(清华大学)
专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.LG
专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.SE
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL、cs.LG
机构 * Department of Electrical Engineering and Computer Sciences, University of California at Berkeley(加州大学伯克利分校电子工程与计算机科学系) ; Toyota Motor North America(丰田北美公司)
专题命中 Agent评测 :planning(title,abstract);agent(abstract);multi-agent(abstract)
Comments 8 pages, 9 figures, 3 tables
专题命中 Agent评测 :agent(title,abstract);planning(abstract);agentic(abstract)
Comments 18 pages, 5 figures
专题命中 Agent评测 :agent(title,abstract);planning(abstract);multi-agent(abstract)
Comments arXiv admin note: substantial text overlap with arXiv:2406.02063
Journal ref JFSMA-JFMS 2024
专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract)
AI智能体为何违反规则?框架、情境与社会信号如何影响合规性
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract,comments);分类 cs.AI、cs.CL
AI总结 该研究运用法律与经济学的合规理论,发现安全微调AI模型大体合规,任务优化与智能体模型会在低惩罚等条件下违规,且引入经济激励等会导致大规模合规失败,指出模型选择与合规性评估需改进。
Comments Published at 2026 AAAI/ACM Conference on AI, Ethics, and Society and 2026 COLM Workshop on Agent Behavior
专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.LG;autonomous agent(comments)
Comments Full version of the paper presented at AAMAS 2018 (International Conference on Autonomous Agents and Multiagent Systems)
面向开放式护理计划协调的自适应竞技场式可争议专家论证网络
机构 * University of New Brunswick(新不伦瑞克大学) ; National Research Council Canada(加拿大国家研究委员会)
专题命中 Agent评测 :agent(summary_cn,abstract);multi-agent(abstract);分类 cs.AI
AI总结 针对开放式护理计划协调中单一LLM流程的不足,提出多Agent神经符号框架CANOE,经医学微调模型在相关数据集上表现出强临床正确性,且CANOE具备可解释性与人类可争议性。
Comments Accepted at the 4th International Conference on Frontiers of Artificial Intelligence, Ethics, and Multidisciplinary Applications
ASTELD:自主AI智能体的六轴分类框架——设计、评估与OpenClaw案例研究
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract,comments);分类 cs.AI
AI总结 该研究提出ASTELD六轴分类框架,用于比较自主AI智能体平台,通过案例研究验证其效用,揭示跨平台模式与创新方向,发现本地优先部署与企业级安全结合的空白区域。
Comments 40 pages, 4 figures, 6 tables. Introduces and empirically evaluates the ASTELD six-axis classification framework across eight autonomous AI agent platforms, with OpenClaw as an in-depth case study
ExtractBench:模式引导的企业文档抽取基准
专题命中 Agent评测 :agentic(summary_cn,abstract);agent(abstract);分类 cs.AI
AI总结 研究针对企业文档模式引导抽取的评估需求,构建首个同时评估值准确率等多指标的基准ExtractBench,发现LlamaExtract Agentic Plus在成本远低于编码智能体的情况下,准确率可与之媲美。
从分析到综合:个性化大语言模型智能体中的隐式行为对齐基准测试
机构 * National University of Singapore(新加坡国立大学) ; University of Toronto(多伦多大学) ; University of Minnesota Twin Cities(明尼苏达大学双城分校) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; University of Oxford(牛津大学)
专题命中 Agent评测 :agent(summary_cn,abstract);autonomous agent(abstract);分类 cs.AI
AI总结 该研究针对大语言模型智能体的个性化问题,构建了IBA-Bench基准,提出IBA-Agent框架,实验显示其可在九类场景中提升隐式行为对齐效果,但有效个性化仍是重大挑战。
I-WebGenBench: 评估大语言模型生成的科学网页应用中的交互性
机构 * Vast Intelligence Lab(vast 智能实验室) ; UTS ; University of Liverpool(利物浦大学)
专题命中 Agent评测 :agent(summary_cn,abstract);autonomous agent(abstract);tool use(abstract);分类 cs.CL
AI总结 提出 Paper-to-Interactive-System Agent 将研究论文转化为可执行交互式网页系统,并构建 PaperVoyager 框架以显式建模机制和交互逻辑,显著提升生成质量。
Comments 9 pages, 4 figures
面向VLM-as-a-Judge评估的视障辅助基准
机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)
专题命中 Agent评测 :agent(summary_cn,abstract);workflow(abstract);分类 cs.CL
AI总结 针对视障辅助任务中VLM-as-a-Judge评估的可靠性问题,提出VIABLE基准(含30万+样本、有效性-公正性-稳定性框架及12种失败模式分类),发现现有模型不可靠,并开发VIA-Judge-Agent方法提升诊断准确性和用户偏好。
Agentick: 一个统一的连续决策制定代理基准测试
机构 * Mila Quebec AI Institute(魁北克AI研究所) ; Université de Montréal(蒙特利尔大学) ; Google DeepMind(谷歌DeepMind)
专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract);planning(abstract)
AI总结 Agentick是一个统一的连续决策制定代理基准测试,评估RL、LLM、VLM等代理在共同基础上的表现,揭示各方法的不足,为通用自主代理研究提供实验基础。
AI代理合谋的脆弱性
机构 * National University of Singapore(新加坡国立大学) ; Boston University(波士顿大学)
专题命中 Agent评测 :agent(title);AI agent(title);分类 cs.AI
AI总结 本文研究了AI代理合谋的脆弱性,发现异质性会减少合谋均衡。实验显示,耐心异质性和数据访问异质性削弱合谋,而模型大小差异反而稳定合谋,讨论了反垄断政策。
Comments 48 pages, 7 figures, 8 tables (including appendix)
Helmsman: 通过协作LLM代理实现联邦学习系统的自主合成
机构 * Eindhoven University of Technology(埃因霍温理工大学)
专题命中 Agent评测 :agent(abstract);planning(abstract);workflow(abstract);agentic(abstract)
AI总结 Helmsman通过协作LLM代理实现联邦学习系统的自主合成,提供端到端的自动化解决方案,生成性能优于传统手工基线。
专题命中 Agent评测 :agent(title);AI agent(title);分类 cs.AI
Comments Add Limitations section
机构 * Harvard Medical School(哈佛医学院) ; University of Saskatchewan(萨斯喀彻温大学) ; University Hospital Heidelberg (UKHD)(海德堡大学医院(UKHD))
专题命中 Agent评测 :agent(title);AI agent(title);分类 cs.CL