arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

ServiceNow

共收录 149
2603.29852 2026-09-02 cs.GR cs.AI cs.CV 版本更新

VectorGym: A Multi-Task Benchmark for SVG Code Generation, Sketching and Editing

VectorGym:一个多任务基准用于SVG代码生成、草图和编辑

Joan Rodriguez, Haotian Zhang, Abhay Puri, Haoran Dai, Tianyang Zhang, Meng Lin, Rishav Pramanik, Xiaoqing Xie, Marco Terral Rodriguez, Darsh Kaushik, Aly Shariff, Perouz Taslakian, Spandana Gella, Sai Rajeswar, David Vazquez, Christopher Pal, Marco Pedersoli

机构 * ServiceNow Research(ServiceNow 研究院) Mila, Quebec AI Institute(Mila 魁北克人工智能研究所) Columbia University(哥伦比亚大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Stony Brook University(石溪大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Minzu University of China(中央民族大学) University of Waterloo(滑铁卢大学) Canada CIFAR AI Chair(加拿大 CIFAR 人工智能讲席) Computer Vision Center(计算机视觉中心)

AI总结 VectorGym提出一个涵盖SVG生成、复杂编辑和视觉理解的多任务基准,通过专家标注解决现有基准的不足,采用多任务强化学习方法,训练出性能领先的Qwen3-VL模型,公开可用。

Comments Accepted to EMNLP 2026. Camera-ready version. Updated author list and author order

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15017 2026-09-01 cs.CL 版本更新

Are Online Skill and Memory Modules Always Worth Their Tokens? A Budget-Constrained Study of Web Agents

在线技能与记忆模块是否总是值得其令牌消耗?Web代理的预算约束研究

Sina Hajimiri, Masih Aminbeidokhti, Jose Dolz, Ismail Ben Ayed, Issam H. Laradji, Spandana Gella, Nicolas Gontier

机构 * ServiceNow AI Research(ServiceNow AI 研究院) ÉTS Montreal(蒙特利尔高等技术学院) University of British Columbia(不列颠哥伦比亚大学) McGill University(麦吉尔大学)

AI总结 在固定推理预算下,对比三种在线增强模块与令牌匹配的基线,发现基线在总成功率上匹配或超越所有增强方法,且常使用更少令牌。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03204 2026-09-01 cs.CL 版本更新

FocusAgent: Simple Yet Effective Ways of Trimming the Large Context of Web Agents

FocusAgent:修剪网页智能体大上下文的简单有效方法

Imene Kerboua, Sahar Omidi Shayegan, Megh Thakkar, Xing Han Lù, Léo Boisvert, Massimo Caccia, Jérémy Espinas, Alexandre Aussem, Véronique Eglin, Alexandre Lacoste

机构 * LIRIS - CNRS, INSA Lyon, Universite Claude Bernard Lyon 1(LIRIS - CNRS,INSA里昂,克劳德·贝尔纳大学里昂) Esker ServiceNow Research(ServiceNow研究) Mila - Quebec AI Institute(魁北克人工智能研究所) McGill University(麦吉尔大学) Polytechnique Montréal(蒙特利尔理工学院)

AI总结 该研究提出FocusAgent,通过轻量级LLM检索器修剪网页智能体的无关上下文,在保持性能的同时减少观测规模超50%,并降低提示注入攻击风险。

Comments TMLR 08/2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28547 2026-08-31 cs.LG 新提交

DARTS: Decoder-Aware Representation Tuning via Surgery for Model Merging

DARTS:通过“手术”实现感知解码器的表示调优以完成模型合并

Aaryan Ajay Sharma, Sai Nishanth Padala, Seganrasan Subramanian

机构 * ServiceNow(ServiceNow(服务now公司)) University of Twente(特温特大学)

AI总结 针对模型合并中解码器存在的表示偏差挑战,本文提出DARTS方法,通过熵加权L1损失与逐位置加性偏差校正,在三类任务上较标准方法获显著改进且新增参数极少。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26623 2026-08-28 cs.AI 新提交

AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling

AgentJudgeBench:用于评估智能体工具调用的多难度基准

Abhigya Verma, Amit Kumar Saha, Seganrasan Subramanian, Sai Harshitha Aluru

机构 * ServiceNow AI(ServiceNow人工智能部门)

AI总结 该研究提出AgentJudgeBench基准,评估LLM评判在智能体工具调用工作流上的可靠性,发现其对齐度随难度下降,真实值并非总有益,还给出了实用评估指南。

Comments 31 Pages, 9 Figures, 31 Tables, Accepted as a main conference paper at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24804 2026-08-26 cs.AI cs.SE 新提交

StarHarness: Evolving Harnesses with Stratified Search for Enterprise Environments

StarHarness:针对企业环境的分层搜索进化 harness(工具适配层)

Esakkivel Esakkiraja, Denis Akhiyarov, Vikas Yadav, Sai Rajeswar, Patrice Bechard, Sridhar Nemala, Sagar Davasam

机构 * ServiceNow(ServiceNow公司) Mila(米拉研究所) Université de Montréal(蒙特利尔大学)

AI总结 StarHarness是一种固定模型权重的harness进化框架,经分层搜索优化后,在ITBench等3个企业任务基准上性能提升20-35个百分点,且可跨GPT、Qwen模型迁移,缓解模型-环境不匹配问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11295 2026-08-13 cs.CR cs.AI 新提交

Backdoor Decontamination Dynamics in LLM Agents

大语言模型智能体中的后门净化动力学

Gabriel Huang, Abhay Puri, Léo Boisvert, Alexandre Drouin, Perouz Taslakian, Spandana Gella, Christopher Pal

机构 * ServiceNow Research(ServiceNow研究院) Mila -- Quebec AI Institute(米拉-魁北克人工智能研究所) McGill University(麦吉尔大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能讲席)

AI总结 本研究针对大语言模型智能体的后门问题,提出框架研究净化动力学,发现防御性投毒加遗忘可高效擦除多数后门,中间层仍留触发器感知痕迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09930 2026-08-11 cs.SD cs.AI cs.CL 新提交

Beyond Naturalness: Probing Automated Text-To-Speech Evaluators on Linguistically Grounded Dimensions

超越自然性:基于语言维度探究自动文本转语音评估器

Oluwanifemi Bamgbose, Simon Rosen, Jash Shah, Lindsay Devon Brin, Hoang H Nguyen, Anke Koelzer, Rachel Hansen, Tara Bogavelli, Fanny Riols

机构 * ServiceNow(ServiceNow公司)

AI总结 该研究构建了首个TTS维度级元评估基准,测试发现MOS预测器聚焦声学信号质量,Audio-LLM评估器检测能力具选择性且依赖提示,两类方法均难捕捉语言结构化语音错误,相关资源已公开。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05159 2026-08-05 cs.CR cs.AI cs.LG 版本更新

Malice in Agentland: Down the Rabbit Hole of Backdoors in the AI Supply Chain

Agentland中的恶意行为:深入AI供应链后门问题

Léo Boisvert, Abhay Puri, Chandra Kiran Reddy Evuru, Nazanin Sepahvand, Nicolas Chapados, Quentin Cappart, Jason Stanley, Alexandre Lacoste, Krishnamurthy Dj Dvijotham, Alexandre Drouin

机构 * ServiceNow Research Mila - Qu\'ebec AI Institute

AI总结 研究探讨了在交互数据上微调AI代理时引入的安全漏洞,提出三种供应链威胁模型,证明通过污染少量演示即可使代理泄露用户信息。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10913 2026-07-31 cs.CL 版本更新

LLM2Vec-Gen: Generative Embeddings from Large Language Models

LLM2Vec-Gen:从大型语言模型生成嵌入向量

Parishad BehnamGhader, Vaibhav Adlakha, Fabian David Schmidt, Nicolas Chapados, Marius Mosbach, Siva Reddy

机构 * McGill University(麦吉尔大学) Mila–Quebec AI Institute(米拉-魁北克人工智能研究所) ServiceNow Research(ServiceNow研究院) Cohere Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

AI总结 LLM2Vec-Gen通过自监督学习生成大型语言模型的嵌入向量,无需微调,提升MTEB基准测试性能,并保留语义和推理能力。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23326 2026-07-28 cs.AI 新提交

ESF-Bench: Benchmarking Challenging Slot-Filling Scenarios for Real-World Enterprise Applications

ESF-Bench:针对现实世界企业应用的具有挑战性的槽填充场景基准测试

Toby Liang, Gopal Sarda, Sagar Davasam, Vikas Yadav

机构 * ServiceNow(ServiceNow公司)

AI总结 针对大语言模型在企业实际部署中槽填充面临的挑战,介绍ESF-Bench基准,它含多轮样本和槽,跨越多个领域,揭示了当前模型局限性,还公开了数据集、分类法及评估代码以推动该领域研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15927 2026-07-20 cs.LG cs.AI 版本更新

DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone

DiffuMamba:基于Mamba架构的高吞吐量扩散语言模型

Vaibhav Singh, Oleksiy Ostapenko, Pierre-André Noël, Eugene Belilovsky, Torsten Scholak

机构 * ServiceNow Research, Montreal, Canada(ServiceNow研究机构,加拿大蒙特利尔) Concordia University(Concordia大学)

AI总结 DiffuMamba基于Mamba架构,通过结合扩散目标与线性序列建模,实现了高吞吐量的扩散语言模型,在长序列任务中表现出色。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12451 2026-07-16 cs.LG 版本更新

Overcoming the Modality Gap in Context-Aided Forecasting

克服情境差距以实现上下文辅助预测

Vincent Zhihao Zheng, Étienne Marcotte, Arjun Ashok, Andrew Robert Williams, Lijun Sun, Alexandre Drouin, Valentina Zantedeschi

机构 * ServiceNow Research(ServiceNow研究) McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克AI研究所)

AI总结 本文提出半合成数据增强方法,生成高质量上下文以提升上下文辅助预测性能,构建了700万规模的数据集,并验证了其在真实场景中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23128 2026-07-09 cs.LG 版本更新

Bound to Disagree: Generalization Bounds via Certifiable Surrogates

必然存在分歧:通过可验证替代物的泛化界

Mathieu Bazinet, Valentina Zantedeschi, Pascal Germain

机构 * Département d’informatique et génie logiciel Université Laval(计算机与软件工程系洛桑大学) ServiceNow Research(ServiceNow研究)

AI总结 针对深度学习模型泛化界的问题,提出基于新分歧证书的方法,通过替代模型界定预测器真实风险,利用三种框架训练替代模型验证证书紧密性及方法通用性,无需修改目标模型和训练过程。

Comments Published in the 42nd conference on Uncertainty in Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07267 2026-07-03 cs.AI cs.CL cs.LG 版本更新

BRIDGE: Predicting Human Task Completion Time From Model Performance

BRIDGE: 从模型性能预测人类任务完成时间

Fengyuan Liu, Jay Gala, Nilaksh, Dzmitry Bahdanau, Siva Reddy, Hugo Larochelle

机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) McGill University(麦吉尔大学) Polytechnique Montréal(蒙特利尔理工学院) Periodic Labs(Periodic实验室) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) ServiceNow Research(ServiceNow研究)

AI总结 提出BRIDGE框架,利用项目反应理论从模型性能中学习潜在任务难度,并将其与人类任务完成时间对齐,从而仅凭模型性能预测新基准上的人类任务完成时间。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00570 2026-07-02 cs.CL 新提交

Dual-Confidence Contrastive Decoding for Retrieval-Augmented Generation

双置信对比解码用于检索增强生成

Raymond Li, Md Tawkat Islam Khondaker, Amirhossein Abaskohi, Gabriel Murray, Giuseppe Carenini, Issam H. Laradji

机构 * ServiceNow Research(ServiceNow研究院) University of British Columbia(不列颠哥伦比亚大学)

AI总结 针对多文档检索增强生成中的内部证据冲突问题,提出无需训练的双置信对比解码方法,结合文档级和词元级置信度选择正负流,在DRQA等基准上取得最佳平均性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29648 2026-06-30 cs.CL cs.AI cs.LG cs.MA

Hybrid Retriever Evolution for Multimodal Document Reasoning Agents

混合检索器演化:面向多模态文档推理代理

Bohan Yao, Shruthan Radhakrishna, Vikas Yadav

机构 * ServiceNow University of Washington(华盛顿大学)

AI总结 提出失败驱动的演化框架,让元代理自动学习任务代理如何协调多种检索器进行多步文档问答,实现自适应检索路由,在MMLongBench-Doc和DocBench上提升高达19.6分。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00069 2026-06-24 cs.CY cs.AI cs.CL 版本更新

Societal Alignment Frameworks Can Improve LLM Alignment

社会对齐框架可以改进大语言模型对齐

Karolina Stańczak, Nicholas Meade, Mehar Bhatia, Hattie Zhou, Konstantin Böttinger, Jeremy Barnes, Jason Stanley, Jessica Montgomery, Richard Zemel, Nicolas Papernot, Nicolas Chapados, Denis Therien, Timothy P. Lillicrap, Ana Marasović, Sylvie Delacroix, Gillian K. Hadfield, Siva Reddy

机构 * ETH Zurich(苏黎世联邦理工学院) Mila, McGill University(麦吉尔大学米尔人工智能实验室) University of Cambridge(剑桥大学) Columbia University(哥伦比亚大学) University of Toronto, Google DeepMind(多伦多大学与DeepMind) McGill University, ServiceNow(麦吉尔大学与ServiceNow) Google DeepMind(谷歌DeepMind) University of Utah(犹他大学) King's College London(伦敦国王学院) Johns Hopkins University(约翰霍普金斯大学) Mila, McGill University, ServiceNow(麦吉尔大学米尔人工智能实验室与ServiceNow)

AI总结 本文提出借鉴社会、经济和契约对齐框架来改进大语言模型对齐,探讨不确定性在其中的作用,并将目标未指定性视为机遇而非缺陷,同时强调参与式对齐界面设计的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21710 2026-06-23 cs.CL cs.AI cs.IR 新提交

PrivacyAlign: Contextual Privacy Alignment for LLM Agents

PrivacyAlign: LLM代理的上下文隐私对齐

Manveer Singh Tamber, Abhay Puri, Marc-Etienne Brunet, Perouz Taslakian, Jimmy Lin, Spandana Gella

机构 * University of Waterloo(滑铁卢大学) ServiceNow AI Research(ServiceNow AI 研究) McGill University(麦吉尔大学) Mila -- Quebec AI Institute(米拉——魁北克人工智能研究所)

AI总结 提出PrivacyAlign数据集,通过人类标注对齐LLM代理的隐私决策,并引入基于标注的奖励建模以提升隐私对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21638 2026-06-23 cs.CR cs.CL 新提交

Toward Open Weight Models Without Risks: Separating Public and Private Capabilities in LLMs

迈向无风险的开源权重模型:在LLM中分离公共与私有能力

Charbel El Feghali, Arkil Patel, Nicholas Meade, Spandana Gella, Verna Dankers, Siva Reddy

机构 * Mila and McGill University(Mila和麦吉尔大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) ServiceNow Research(ServiceNow研究) McGill-NLP/tiered-language-models(麦吉尔-自然语言处理/分层语言模型)

AI总结 提出层级语言模型(TLM),通过单一权重集和秘密密钥实现多级能力控制,公共配置保持基础能力,密钥配置解锁私有能力,抵抗微调提取和密钥部分泄露。

Comments Preprint. 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19881 2026-06-19 cs.CL 新提交

REDACT: A Systematically Controlled Multilingual Benchmark for Personal Information Detection

REDACT:一个系统控制的个人信息检测多语言基准

Guneesh Vats, Anubha Agrawal, Shikha Singhal, Ajita Dash, Praison Selvaraj, Vidhan Jhawar, Ranga Prasad Chenna, Bharadwaj Y M G

机构 * ServiceNow

AI总结 提出REDACT基准,包含13,427条记录、51种实体类型、25种语言,通过强度-2覆盖阵列采样控制9个生成轴,并引入实体级元数据(披露状态、形式、GDPR敏感层级)以支持分层评估,揭示检测器在敏感数据上的架构依赖性失败模式。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18191 2026-06-19 cs.AI cs.MA 新提交

DRFLOW: A Deep Research Benchmark for Personalized Workflow Prediction

DRFLOW:用于个性化工作流预测的深度研究基准

Md Tawkat Islam Khondaker, Raymond Li, Muhammad Abdul-Mageed, Laks V. S. Lakshmanan, Issam H. Laradji

机构 * ServiceNow AI Research(ServiceNow人工智能研究)

AI总结 提出DRFLOW基准,评估AI代理从异构源预测个性化工作流的能力,包含5领域100任务,并设计7个诊断指标,实验显示现有代理性能有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18508 2026-06-18 cs.CL cs.IR 新提交

MCompassRAG: Topic Metadata as a Semantic Compass for Paragraph-Level Retrieval

MCompassRAG:主题元数据作为段落级检索的语义指南针

Amirhossein Abaskohi, Raymond Li, Gaetano Cimino, Peter West, Giuseppe Carenini, Issam H. Laradji

机构 * University of British Columbia(不列颠哥伦比亚大学) University of Salerno(萨莱诺大学) ServiceNow Research(ServiceNow研究院)

AI总结 提出MCompassRAG框架,通过主题元数据增强段落表示,利用LLM蒸馏训练轻量检索器,实现主题感知检索,在六个基准上平均信息效率提升8.24%,延迟降低5倍以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18381 2026-06-18 cs.CL cs.IR 新提交

SproutRAG: Attention-Guided Tree Search with Progressive Embeddings for Long-Document RAG

SproutRAG: 基于注意力引导的树搜索与渐进嵌入的长文档RAG

Amirhossein Abaskohi, Issam H. Laradji, Peter West, Giuseppe Carenini

机构 * University of British Columbia(不列颠哥伦比亚大学) ServiceNow Research(ServiceNow研究院)

AI总结 提出SproutRAG,通过注意力引导构建句子级分块树,实现多粒度检索,无需额外LLM调用,平均信息效率提升6.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13608 2026-06-16 cs.AI cs.LG 新提交

AgentBeats: Agentifying Agent Assessment for Openness, Standardization, and Reproducibility

AgentBeats:面向开放性、标准化和可复现性的智能体评估代理化

Xiaoyuan Liu, Jianhong Tu, Yuqi Chen, Siyuan Xie, Sihan Ren, Tianneng Shi, Gal Gantar, Evan Sandoval, Donghyun Lee, Daniel Miao, Peter J. Gilbert, Nick Hynes, Mauro Staver, Warren He, David Marn, Andrew Low, Xi Zhang, Elron Bandel, Michal Shmueli-Scheuer, Siva Reddy, Alexandre Drouin, Alexandre Lacoste, Ramayya Krishnan, Elham Tabassi, Yu Su, Victor Barres, Chenguang Wang, Wenbo Guo, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) Purdue University(普渡大学) University of Ljubljana(卢布尔雅那大学) University of Washington(华盛顿大学) Oasis Labs University of Maryland(马里兰大学) IBM Research(IBM研究院) Mila McGill University(麦吉尔大学) ServiceNow Research(ServiceNow研究院) Carnegie Mellon University(卡内基梅隆大学) National Institute of Standards and Technology(美国国家标准与技术研究院) The Ohio State University(俄亥俄州立大学) University of Cambridge(剑桥大学) University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

AI总结 提出代理化智能体评估(AAA)框架,通过标准化协议(A2A和MCP)统一评估接口,实现开放、可复现的多智能体评估,并基于AgentBeats系统通过大规模竞赛和案例研究验证其覆盖性、实用性和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07332 2026-06-11 cs.LG cs.AI 版本更新

Grounding Computer Use Agents on Human Demonstrations

基于人类演示的计算机使用智能体基础构建

Aarash Feizi, Shravan Nayak, Xiangru Jian, Kevin Qinghong Lin, Kaixin Li, Rabiul Awal, Xing Han Lù, Johan Obando-Ceron, Juan A. Rodriguez, Nicolas Chapados, David Vazquez, Adriana Romero-Soriano, Reihaneh Rabbany, Perouz Taslakian, Christopher Pal, Spandana Gella, Sai Rajeswar

机构 * Mila - Quebec AI Institute(魁北克AI研究所) McGill University(麦吉尔大学) Université de Montréal(蒙特利尔大学) ServiceNow Research(ServiceNow研究) University of Waterloo(滑铁卢大学) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) Polytechnique Montréal(蒙特利尔理工学院) École de Technologie Supérieure(高级技术学院) CIFAR AI Chair(CIFAR人工智能主席)

AI总结 为解决桌面环境高质量基础数据稀缺问题,构建了包含87个应用、56K截图和3.56M人工标注的GroundCUA数据集,并基于此训练GroundNext模型,在5个基准上以少于先前十分之一的数据取得最优结果。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08049 2026-06-09 cs.AI cs.MA 新提交

SKILL.nb: Selective Formalization and Gated Execution for Durable Agent Workflows

SKILL.nb:用于持久代理工作流的选择性形式化与门控执行

Amine El Hattami, Nicolas Chapados, Christopher Pal

机构 * ServiceNow Research Mila Polytechnique Montréal(蒙特利尔综合理工学院) Canada CIFAR AI Chair(加拿大CIFAR人工智能讲席)

AI总结 提出SKILL.nb框架,通过选择性形式化和门控执行管理代理工作流的生命周期可靠性,在WebArena-Verified上单轮成功率达53.7%,重执行保留率91.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03811 2026-06-03 cs.CR cs.AI cs.LG

AI Agents Enable Adaptive Computer Worms

AI代理实现自适应计算机蠕虫

Jonas Guan, Tom Blanchard, Hanna Foerster, Hengrui Jia, Gabriel Huang, Nicolas Papernot

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) University of Cambridge(剑桥大学) ServiceNow

AI总结 本研究展示了AI代理能够生成针对每个目标的定制攻击策略,利用被感染机器上的大语言模型自我维持并传播,形成自持的AI驱动网络威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30727 2026-06-01 cs.CL

MosaicLeaks:Privacy Risks in Querying-in-the-Open for Deep Research Agents

MosaicLeaks:深度研究代理的开放查询中的隐私风险

Alexander Gurung, Spandana Gella, Alexandre Drouin, Issam H. Laradji, Perouz Taslakian, Rafael Pardinas

机构 * ServiceNow AI Research(ServiceNow AI研究院) University of Edinburgh(爱丁堡大学) Mila - Quebec AI Institute(魁北克AI研究所) McGill University(麦吉尔大学) University of British Columbia(不列颠哥伦比亚大学)

AI总结 针对深度研究代理在查询外部工具时可能泄露本地敏感信息的问题,提出MosaicLeaks基准测试和隐私感知深度研究(PA-DR)框架,通过强化学习降低信息泄露风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30553 2026-06-01 cs.LG cs.IT math.IT

Destruction is a General Strategy to Learn Generation; Diffusion's Strength is to Take it Seriously; Exploration is the Future

破坏是学习生成的一般策略;扩散的优势在于认真对待它;探索是未来

Pierre-André Noël

机构 * ServiceNow AI Research(ServiceNow AI研究院)

AI总结 本文提出扩散模型作为信息隐藏与猜测框架的一部分,论证其破坏式信息隐藏比手工设计更灵活,尤其在数据稀缺场景有优势,并探讨强化学习技术移植到扩散上下文时的微妙问题及原生探索方向。

Comments Published April 27th, 2026 as an ICLR blogpost https://iclr-blogposts.github.io/2026/blog/2026/destruction/

Journal ref Noël, Piere-André. "Destruction is a General Strategy to Learn Generation; Diffusion's Strength is to Take it Seriously; Exploration is the Future", ICLR Blogposts, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏