$p1$: Better Prompt Optimization with Fewer Prompts
用更少提示实现更好的提示优化
机构 * Cornell University(康奈尔大学) ; Microsoft(微软) ; Harvard University(哈佛大学) ; Databricks AI Research(Databricks AI研究)
AI总结 研究揭示提示优化有效性取决于系统提示与响应方差,提出$p1$过滤方法提升优化效果,实验显示其在推理基准上优于基线方法。
大厂专区
用更少提示实现更好的提示优化
机构 * Cornell University(康奈尔大学) ; Microsoft(微软) ; Harvard University(哈佛大学) ; Databricks AI Research(Databricks AI研究)
AI总结 研究揭示提示优化有效性取决于系统提示与响应方差,提出$p1$过滤方法提升优化效果,实验显示其在推理基准上优于基线方法。
OriginBlame:人工智能训练数据集的记录级和令牌级数据溯源
机构 * HuggingFace(拥抱脸) ; Datatrove(数据宝库) ; The Linux Foundation(Linux基金会) ; Databricks(Databricks公司) ; Weights & Biases(权重与偏差公司)
AI总结 研究针对模型训练者在数据删除时无法精准定位记录所属作者的问题,提出OriginBlame系统,通过记录级和令牌级溯源及确定性查询解决,评估显示能消除过度删除并提升遗忘效果,增加少量吞吐量开销。
Comments 13 pages, 5 figures
AutoIndex:学习用于检索的表示程序
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Databricks Mosaic Research(Databricks Mosaic研究)
AI总结 AutoIndex框架通过搜索对文档进行多种操作的程序来优化文档表示,在CRUMB基准上评估,相比BM25基线显著提升召回率,证明文档表示应作为优化目标,而非固定预处理选择。
SEVRA-BENCH:审查智能体中的社会工程漏洞
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Microsoft Core AI(微软核心人工智能) ; Amazon AWS(亚马逊AWS) ; Databricks
AI总结 提出SEVRA-BENCH基准,通过社会工程攻击框架评估LLM代码审查智能体拒绝恶意PR的能力,发现闭源与开源模型间存在显著安全差距。
更多技能,更差智能体?扩展技能库时技能遮蔽降低性能
机构 * Databricks Inc.(Databricks公司)
AI总结 本文研究LLM智能体技能库扩展导致性能下降的现象,提出将性能下降分解为技能遮蔽和上下文开销两种效应,并通过实验证明技能遮蔽是主要瓶颈。
电子商务中的大规模高频定价
机构 * Zalando SE ; Databricks
AI总结 提出一种预测-优化框架,结合梯度提升树与多目标优化,实现时尚电商促销活动的每日高频定价,通过23次A/B测试验证,利润提升约6%。
QPP能否选择正确的查询变体?评估RAG流水线中的查询变体选择
机构 * UC Berkeley(伯克利大学) ; Databricks(Databricks公司)
AI总结 本文研究了在RAG流水线中如何选择最佳查询变体,通过大规模实验评估了预检索和后检索预测器的性能,发现检索相关性与生成保真度之间存在'效用差距',但QPP能有效提升端到端质量。
CodeScout: 为软件代理提供上下文化的问题陈述增强
机构 * University of Maryland, College Park(马里兰大学帕克分校) ; Amazon Web Services (AWS)(亚马逊云服务(AWS)) ; Databricks
AI总结 CodeScout通过轻量级预探索将模糊请求转化为完整问题陈述,提升软件代理性能,实验表明其在解决率上提升20%。
FlashOptim: 用于内存高效训练的优化器
机构 * Databricks AI Research(Databricks AI研究院)
AI总结 FlashOptim通过减少每参数内存消耗50%以上,同时保持模型质量和API兼容性,显著提升内存高效训练性能。
Comments Source code is available at https://github.com/databricks/flashoptim
OfficeQA Pro:一个企业级端到端 grounded 推理基准测试
机构 * Databricks AI Research(Databricks人工智能研究)
AI总结 OfficeQA Pro 是一个企业级基准测试,评估 AI 代理在大规模文档语料库上进行端到端 grounded 推理的能力,发现结构化文档表示可显著提升性能。
Comments 24 pages, 16 figures. Introduces the OfficeQA Pro benchmark for grounded reasoning over enterprise documents
通过强化学习的知识代理:KARL
机构 * Databricks AI Research(Databricks人工智能研究)
AI总结 KARL通过强化学习训练企业搜索代理,结合多任务学习和定制合成数据,实现高效且高性能的知识代理,在多个复杂任务中表现优异。
Comments 77 pages, 43 figures, 17 tables
超越人类表现:一种视觉-语言多智能体方法用于制药制造中的质量控制
机构 * GSK, Enterprise AI(葛兰素史克、企业人工智能) ; Databricks
AI总结 本文提出一种结合深度学习与视觉-语言模型的多智能体框架,用于提高制药制造中菌落形成单位检测的准确性和效率,实现高质量的质量控制。
app.build:一种用于扩展基于代理的提示到应用程序生成的生产框架
机构 * Databricks ; THWS University of Applied Sciences Würzburg-Schweinfurt (CAIRO)(THWS应用科学大学沃尔夫斯堡-施维林(CAIRO))
AI总结 app.build通过结构化环境和系统验证提升基于代理的应用程序生成效率,实现高可行性与质量,为生产级代理系统提供参考实现。
Tyche: 医疗图像分割的随机上下文学习
机构 * CSAIL MIT(MIT计算机科学与人工智能实验室) ; MIT Broad Institute(MITBroad研究所) ; MGH(麻省总医院) ; MosaicML ; DataBricks ; MIT ; HMS, MGH(哈佛医学院、麻省总医院)
AI总结 Tyche通过上下文学习方法,无需重新训练即可为医疗图像分割生成随机预测,提升分割任务的灵活性和鲁棒性。
Comments Accepted at IEEE / CVF Computer Vision and Pattern Recognition Conference (CVPR) 2024 as a highlight. Code available at https://github.com/mariannerakic/tyche
机构 * UC Santa Cruz(加州大学圣克ruz分校) ; Washington University in St. Louis(华盛顿大学圣路易斯分校) ; Databricks(Databricks公司) ; Google DeepMind(谷歌DeepMind) ; UC Berkeley(加州大学伯克利分校)
机构 * Databricks
机构 * University of Waterloo(滑铁卢大学) ; Databricks(Databricks公司)
Comments 21 pages, 4 figures, 8 tables
机构 * Cornell University(康奈尔大学) ; Princeton University(普林斯顿大学) ; Databricks Mosaic Research(Databricks 混合研究) ; Carnegie Mellon University(卡内基梅隆大学) ; Harvard University(哈佛大学)
机构 * Columbia University(哥伦比亚大学) ; Stanford University(斯坦福大学) ; Databricks(Databricks公司)
Comments Accepted to NAACL 2025 Main Conference
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; Databricks(Databricks公司)
机构 * Databricks ; Gustavus Adolphus College(古斯塔夫斯·阿道弗斯学院)
Comments 5 pages, 5 tables, 1 figure
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; Databricks(Databricks公司)
Comments 12 pages, 11 figures
机构 * Harvard University(哈佛大学) ; Google DeepMind(谷歌DeepMind) ; Databricks(Databricks公司)
机构 * Harvard University(哈佛大学) ; Stanford University(斯坦福大学) ; MIT(麻省理工学院) ; Databricks(Databricks公司) ; Carnegie Mellon University(卡内基梅隆大学)
机构 * New York University(纽约大学) ; Databricks(Databricks公司)
机构 * Databricks(达特睿奇科技)
Comments 12 pages, 4 figures, To appear in the 4th NeurIPS Workshop on Efficient Natural Language and Speech Processing (ENLSP), 2024
机构 * Databricks Mosaic Research(Databricks Mosaic研究机构)
Comments 2024 NeurIPS workshop on Adaptive Foundation Models: Evolving AI for Personalized and Efficient Learning
机构 * Stanford University(斯坦福大学) ; Databricks ; Google DeepMind(谷歌DeepMind)
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Databricks(Databricks公司)
机构 * Databricks Mosaic AI ; Stanford University(斯坦福大学)