arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

2026-05-13 至 2026-05-13 共收录 6
2605.12487 2026-05-13 cs.CL cs.IR cs.LG

Task-Adaptive Embedding Refinement via Test-time LLM Guidance

基于测试时LLM引导的任务自适应嵌入细化

Ariel Gera, Shir Ashury-Tahan, Gal Bloch, Ohad Eytan, Assaf Toledo

机构 * IBM Research(IBM研究院)

AI总结 本文提出利用LLM反馈优化查询嵌入表示,提升零样本搜索和分类任务的性能,实验表明在多个基准上提升达25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06785 2026-05-13 cs.LG cs.AI

Distributional Process Reward Models: Calibrated Prediction of Future Rewards via Conditional Optimal Transport

分布过程奖励模型:通过条件最优传输实现未来奖励的校准预测

Rachel Ma, Dylan Hadfield-Menell, Kristjan Greenewald

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) MIT(麻省理工学院) IBM Research(IBM研究院) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

AI总结 本文提出利用条件最优传输校准过程奖励模型,通过估计成功概率的单调条件分位数函数,提升模型校准和不确定性估计能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05630 2026-05-13 cs.CL cs.AI cs.CR

One Turn Too Late: Response-Aware Defense Against Hidden Malicious Intent in Multi-Turn Dialogue

一念之差:多轮对话中针对隐藏恶意意图的响应感知防御

Xinjie Shen, Rongzhe Wei, Peizhi Niu, Haoyu Wang, Ruihan Wu, Eli Chien, Bo Li, Pin-Yu Chen, Pan Li

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) UCSD(加州大学圣地亚哥分校) National Taiwan University(台湾大学) IBM Research(IBM研究院) Virtue AI

AI总结 本文提出TurnGate,通过检测最早使交互达到有害行为阈值的轮次,提升多轮对话中恶意意图检测效果,同时保持低拒绝率。

Comments Project Website: https://turn-gate.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16849 2026-05-13 cs.LG

GIST: Gauge-Invariant Spectral Transformers for Scalable Graph Neural Operators

GIST: 用于可扩展图神经算子的规范不变频谱变换

Mattia Rigotti, Nicholas Thumiger, Thomas Frick

机构 * IBM Research(IBM研究院)

AI总结 GIST通过限制注意力至高效近似频谱嵌入的成对内积,解决了不规则网格上神经算子的规范不变性与计算复杂性之间的矛盾,证明其在端到端O(N)复杂度下能估计精确的规范不变图核,并在多个基准上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11730 2026-05-13 cs.LG cs.CR

Persona-Conditioned Adversarial Prompting: Multi-Identity Red-Teaming for Adversarial Discovery and Mitigation

基于身份的对抗提示:多身份红队测试用于对抗发现与缓解

Cristian Morasso, Anisa Halimi, Muhammad Zaid Hameed, Douglas Leith

机构 * IBM Research(IBM研究院) Trinity College Dublin(都柏林大学)

AI总结 本文提出PCAP方法,通过多身份对抗搜索发现真实攻击场景,提升模型鲁棒性,生成多样化防御数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16769 2026-05-13 cs.LG cs.CL cs.CR cs.CV

Red-Teaming Text-to-Image Models via In-Context Experience Replay and Semantic-Preserving Prompt Rewriting

通过上下文经验回放和语义保留提示重写对文本到图像模型进行红队测试

Zhi-Yi Chin, Pin-Yu Chen, Wei-Chen Chiu, Mario Fritz

机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全中心) IBM Research(IBM 研究院) National Yang Ming Chiao Tung University(国立阳明交通大学)

AI总结 本文提出ICER框架,通过提示重写和上下文经验回放生成流畅的对抗性提示,有效提升图像生成模型的安全性测试能力,实验表明其在多个安全机制上优于现有方法。

Comments The source code is available at https://github.com/zhiyichin/ICER

详情

展开后加载摘要…

URL PDF HTML 收藏