arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM SIGKDD Conference on Knowledge Discovery and Data Mining · 会议 · Data Mining

2026-08-24 至 2026-08-24 共收录 3
2608.20614 2026-08-24 cs.AI 新提交

Evaluating Skills, Not Just Agents: Agentic Continuous Evaluation of Skills

评估技能,而非仅评估智能体:智能体驱动的技能持续评估

Christopher Kevin, Narendran Raghavan, Jean-Francois Puget, Roshni Malani, Meghana Puvvadi, Moshe Abramovitch, Mohit Gupta, Rama Akkiraju, Subodh Prabhu, Yogesh Dangi, Wei Luo, Seong Hee Lee

机构 * NVIDIA(英伟达)

AI总结 该研究提出ACES框架,通过配对实际 trials等方式评估技能附加价值,实验表明其能发现扫描式审核无法观测的信号,开源实现已在NVIDIA SkillEvaluator中提供。

Comments 15 pages. Extended preprint incorporating versions accepted at Agent Skills '26 (ACM CAIS 2026) and the KDD 2026 Workshop on Enterprise AI Agents: From Prototypes to Production (oral presentation). Open-source implementation: this https URL (https://github.com/NVIDIA/SkillEvaluator)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20357 2026-08-24 cs.IR cs.AI 新提交

Clarify-Then-Search: A Clarification Benchmark for Deep Search with End-to-End Nugget Restoration

先澄清再搜索:面向端到端 nugget 恢复的深度搜索澄清基准

Deqiang Huang, Jingbo Zhou, Xinjiang Lu, Tong Xu, Hua Wu, Enhong Chen

AI总结 该研究提出 Clarify-Then-Search 基准,评估 LLM 生成的澄清问题对深度搜索效用的提升,实验显示 k=1 时澄清优于基线,GPT-5.2 和 ERNIE-4.5-Turbo-128K 分别在 k=1、k=3 时表现最佳。

Comments Accepted to KDD 2026 Datasets and Benchmarks Track. 12 pages, 4 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01493 2026-08-24 cs.IR cs.AI cs.CV cs.MM 版本更新

PhotoBench: Beyond Visual Matching Towards Personalized Intent-Driven Photo Retrieval

PhotoBench: 超越视觉匹配,迈向个性化意图驱动的图片检索

Tianyi Xu, Rong Shan, Junjie Wu, Jiadeng Huang, Teng Wang, Jiachen Zhu, Wenteng Chen, Minxin Tu, Quantao Dou, Zhaoxiang Wang, Changwang Zhang, Weinan Zhang, Jun Wang, Jianghao Lin

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 PhotoBench 是首个基于真实个人相册构建的基准,旨在通过多源意图驱动推理提升个性化图片检索能力。

Comments Accepted by KDD'26 Benchmark track

详情

展开后加载摘要…

URL PDF HTML 收藏