arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-09-01 至 2026-09-01 共收录 9
2608.30585 2026-09-01 cs.LG 新提交

The Safety Relay in Roleplay Jailbreaks: A Component-Resolved Causal Analysis of Harm Recognition and Refusal

角色扮演越狱中的安全继电器:对有害内容识别与拒绝的组件解析因果分析

Md Mokarram Chowdhury, Ernie Chang, Yang Li

机构 * Iowa State University(爱荷华州立大学) Meta

AI总结 本研究通过机制可解释性分析角色扮演越狱中模型服从有害请求的机制,发现安全继电器衰减等规律,明确了安全措施需维持有害识别到拒绝的关联。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30559 2026-09-01 cs.SD 新提交

SPHERE: Automatic Music Upmixing via Audio Language Model Post-Training with Spatial Heuristic Rewards

SPHERE:通过结合空间启发式奖励的音频语言模型后训练实现自动音乐上混

Zixun Guo, Calvin Murdock, Sanjeel Parekh, W Owen Brimijoin, Simon Dixon, Joshua Reiss, Ishwarya Ananthabhotla

机构 * Meta Reality Labs(元宇宙实验室) Queen Mary University of London(伦敦玛丽女王大学)

AI总结 该研究提出基于音频语言模型后训练的自动音乐上混方法,设计含6个子奖励的Sphere奖励套件,证明领域知识可蒸馏入语言模型实现该任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28701 2026-09-01 cs.CV 新提交

TopoAgent: A Structure-Aware Perception-to-Reasoning Framework for Diagram-to-Graph Topology Extraction with Large Vision-Language Models

TopoAgent:基于大型视觉语言模型的感知到推理的结构感知框架,用于图到图拓扑提取

Bangwei Guo, Xujiang Zhao, Yanchi Liu, Wei Cheng, Shengyu Chen, Dongyue Li, Masaharu Morimoto, Takayuki Kuroda, Dimitris Metaxas, Haifeng Chen

机构 * Rutgers University(罗格斯大学) Meta NEC Labs America(美国NEC实验室) University of Electro-Communications(电气通信大学) NEC Corporation(日本电气公司)

AI总结 该研究针对图到图拓扑提取任务构建了TopoBench-180基准,并提出TopoAgent框架,结合感知、结构先验与推理,在基准上性能优于现有模型,填补了多模态结构化理解的空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06621 2026-09-01 cs.AI 版本更新

NxN E-valuation: Hypothesis Certification via a Conformal CRT Null

NxN E-评估:通过共形CRT空假设进行假设验证

Bin Wang, Yan Zhong

机构 * Meta

AI总结 本文提出NxN E-评估算法,利用大型训练集让样本互为空假设,实现共形CRT以验证LLM的假设,可作为LLM循环验证和保留数据测试的更优替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19313 2026-09-01 cs.LG cs.AI 版本更新

Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information

脱离上下文的广义信赖域策略优化算法:利用特权信息学习解决难题

Priyank Agrawal, Ankur Samanta, Shervin Ghasemlou, Boris Vidolov, Jalaj Bhandari, Kavosh Asadi, Daniel Jiang, Aditya Modi

机构 * Meta AI Columbia University(哥伦比亚大学)

AI总结 研究利用特权信息解决强化学习难题,提出脱离上下文的广义信赖域策略优化算法(OC - GRPO),通过引导展开和重要性校正目标避免训练不匹配,在标准数学推理基准上比普通GRPO有显著提升且成本低。

Comments 24 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24232 2026-09-01 cs.CV cs.GR 版本更新

FiCA: Feed-forward instant Gaussian Codec Avatars from a Single Portrait Image

FiCA:基于单张肖像图像的前馈即时高斯编解码器化身

Kim Youwang, Zhengyu Yang, Liuhao Ge, Yu Rong, Timur Bagautdinov, Su Zhaoen, Nir Sopher, Jovan Popović, Teng Deng, Tae-Hyun Oh, Chen Cao

机构 * Codec Avatars Lab, Meta(Meta编解码虚拟化身实验室) Dept. of Electrical Engineering, POSTECH(浦项科技大学电气工程系) School of Computing, KAIST(韩国科学技术院计算机学院)

AI总结 提出FiCA,一种结合人类视觉基础模型和扩散模型的前馈管道,从单张图像生成逼真、可驱动的3D高斯化身,无需测试时优化。

Comments Project page: this https URL (https://kim-youwang.github.io/FiCA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06181 2026-09-01 cs.CL 版本更新

Investigating Social Bias Changes in Quantized Language Models

不确定性驱动量化大语言模型中的社会偏见变化

Stanley Z. Hua, Sanae Lotfi, Irene Y. Chen

机构 * UC Berkeley(伯克利大学) Centre for Computational Medicine at The Hospital for Sick Children(儿童医院计算医学中心) UCSF(旧金山大学) Meta Superintelligence Labs(Meta超智能实验室)

AI总结 研究发现量化过程导致大语言模型中社会偏见的翻转,且不确定性与量化强度影响偏见变化,需进行后续评估以确保可靠性。

Comments Accepted to COLM 2026 (10 pages, 5 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22707 2026-09-01 cs.IR cs.AI 版本更新

CoFiRec: Coarse-to-Fine Tokenization for Generative Recommendation

CoFiRec: 生成推荐中的粗到细分词

Tianxin Wei, Xuying Ning, Xuxing Chen, Ruizhong Qiu, Yupeng Hou, Yan Xie, Shuang Yang, Zhigang Hua, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta University of California San Diego(加州大学圣地亚哥分校)

AI总结 CoFiRec通过粗到细分词提升生成推荐效果,有效捕捉用户意图演变。

Comments RecSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01359 2026-09-01 cs.CR cs.AI 版本更新

Breaking the Code: Security Assessment of AI Code Agents Through Systematic Jailbreaking Attacks

破解代码:通过系统性越狱攻击对AI代码代理进行安全评估

Shoumik Saha, Jifan Chen, Sam Mayers, Sanjay Krishna Gouda, Zijian Wang, Varun Kumar

机构 * University of Maryland – College Park(马里兰大学-College Park) AWS AI Labs(AWS人工智能实验室) Meta Superintelligence Labs(Meta超智能实验室)

AI总结 提出JAWS-Bench基准测试,通过三级工作区评估代码LLM代理的越狱风险,发现代理化使攻击成功率提升1.6倍,并揭示可执行攻击代码的高比例。

Comments 22 pages, 18 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏