arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-15 至 2026-01-15 共收录 36 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3 篇

2601.08842 2026-01-15 cs.CL cs.AI 88%

Resisting Correction: How RLHF Makes Language Models Ignore External Safety Signals in Natural Conversation

对抗修正:RLHF如何使语言模型在自然对话中忽视外部安全信号

Felipe Biava Cataneo

机构 * Felipe Biava Cataneo(独立研究者)

专题命中 偏好对齐 :RLHF(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI

AI总结 RLHF使语言模型在自然对话中忽视外部安全信号,影响安全纠正的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08848 2026-01-15 cs.CL cs.AI 81%

PediaMind-R1: A Temperament-Aware Language Model for Personalized Early Childhood Care Reasoning via Cognitive Modeling and Preference Alignment

PediaMind-R1: 一种基于气质的个性化婴幼儿护理推理语言模型:通过认知建模与偏好对齐

Zihe Zhang, Can Zhang, Yanheng Xu, Xin Hu, Jichao Leng

机构 * School of Future Information and Innovation, Fudan University(未来信息与创新学院,复旦大学) Corporate Research, Bosch (China) Investment Ltd.(博世(中国)投资有限公司研发部)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 PediaMind-R1通过整合认知建模与偏好对齐,实现基于婴幼儿气质的个性化护理推理。

Comments Accepted at EMNLP 2025 PALS Workshop (PALS: EXPLORING ACTIVE AND PASSIVE LLM PERSONALIZATION)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06475 2026-01-15 cs.CL 70%

HapticLLaMA: A Multimodal Sensory Language Model for Haptic Captioning

HapticLLaMA:一种多模态感官语言模型用于触觉描述

Guimin Hu, Daniel Hershcovich, Hasti Seifi

机构 * University of Copenhagen(哥本哈根大学) Arizona State University(亚利桑那州立大学)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL

AI总结 HapticLLaMA是一种多模态感官语言模型,通过触觉信号生成描述,利用两种分词器和强化学习提升触觉感知描述能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 3 篇

2508.06457 2026-01-15 cs.CR cs.AI cs.CL cs.MA 62%

ScamAgents: How AI Agents Can Simulate Human-Level Scam Calls

ScamAgents: 人工智能代理如何模拟人类水平的诈骗电话

Sanket Badhe

机构 * Rutgers University(罗格斯大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ScamAgent,一种基于LLM的多轮代理,能生成逼真诈骗电话脚本并模拟欺诈场景,揭示现有安全机制对代理威胁的不足,呼吁加强多轮安全审计和检测生成AI驱动的对话欺骗。

Comments Accepted at CAMLIS 25: Conference on Applied Machine Learning for Information Security. 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09353 2026-01-15 cs.AI 57%

Monte-Carlo Tree Search with Neural Network Guidance for Lane-Free Autonomous Driving

基于神经网络引导的蒙特卡罗树搜索用于无车道自动驾驶

Ioannis Peridis, Dimitrios Troullinos, Georgios Chalkiadakis, Pantelis Giankoulidis, Ioannis Papamichail, Markos Papageorgiou

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种基于神经网络引导的蒙特卡罗树搜索方法,用于无车道环境下的自动驾驶,旨在提高交通流率并优化安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.06135 2026-01-15 cs.CL cs.CV 57%

Prompting4Debugging: Red-Teaming Text-to-Image Diffusion Models by Finding Problematic Prompts

Prompting4Debugging: 通过寻找问题性提示对文本到图像扩散模型进行红队测试

Zhi-Yi Chin, Chieh-Ming Jiang, Ching-Chun Huang, Pin-Yu Chen, Wei-Chen Chiu

机构 * Department of Computer Science, National Yang Ming Chiao Tung University, Hsinchu, Taiwan(国家阳明交通大学计算机科学系) IBM Research, NY 10598, USA(IBM研究院)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 Prompting4Debugging通过寻找问题性提示揭示文本到图像扩散模型的安全漏洞,表明现有安全机制存在重大缺陷。

Comments ICML 2024 main conference paper. The source code is available at https://github.com/zhiyichin/P4D

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 3 篇

2407.20224 2026-01-15 cs.CL 70%

Can Editing LLMs Inject Harm?

能否通过编辑LLM注入危害?

Canyu Chen, Baixiang Huang, Zekun Li, Zhaorun Chen, Shiyang Lai, Xiongxiao Xu, Jia-Chen Gu, Jindong Gu, Huaxiu Yao, Chaowei Xiao, Xifeng Yan, William Yang Wang, Philip Torr, Dawn Song, Kai Shu

机构 * Northwestern University(西北大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出编辑攻击作为LLM安全威胁,揭示了通过编辑注入虚假信息和偏见的风险及高隐蔽性。

Comments Accepted to Proceedings of AAAI 2026. The first two authors contributed equally. 7 pages for main paper, 31 pages including appendix. The code, results, dataset for this paper and more resources are on the project website: https://llm-editing.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01741 2026-01-15 cs.CV 67%

Simulated Ensemble Attack: Transferring Jailbreaks Across Fine-tuned Vision-Language Models

模拟集成攻击:在微调视觉-语言模型之间转移劫持

Ruofan Wang, Xin Wang, Yang Yao, Juncheng Li, Xuan Tong, Xingjun Ma

机构 * Fudan University, Shanghai, China(复旦大学) The University of Hong Kong, Hong Kong, China(香港大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)

AI总结 本文提出SEA框架,通过模拟微调过程中的参数变化,实现跨不同微调变体的高效劫持攻击,揭示了微调导致的局部参数位移对攻击有效性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09129 2026-01-15 cs.CR 50%

KryptoPilot: An Open-World Knowledge-Augmented LLM Agent for Automated Cryptographic Exploitation

KryptoPilot: 一种面向开放世界的知识增强型大语言模型代理用于自动化密码学利用

Xiaonan Liu, Zhihao Li, Xiao Lan, Hao Ren, Haizhou Wang, Xingshu Chen

专题命中 越狱攻击 :alignment(abstract)

AI总结 KryptoPilot通过开放世界知识增强和受控推理,提升LLM在密码学CTF挑战中的自动化解决能力。

Comments 14 Pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 3 篇

2510.23675 2026-01-15 cs.CR cs.AI 83%

QueryIPI: Query-agnostic Indirect Prompt Injection on Coding Agents

QueryIPI: 针对编码代理的查询无关间接提示注入

Yuchong Xie, Zesen Liu, Mingyu Luo, Zhixiang Zhang, Kaikai Zhang, Yuanyuan Yuan, Zongjie Li, Ping Chen, Shuai Wang, Dongdong She

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 提示注入 :prompt injection(title,abstract);safety(abstract);分类 cs.AI

AI总结 QueryIPI通过利用系统不变性与工具描述,实现对编码代理的查询无关间接提示注入,实验显示其在模拟代理中达到87%的成功率,揭示了现实中的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05755 2026-01-15 cs.CR cs.AI 77%

VIGIL: Defending LLM Agents Against Tool Stream Injection via Verify-Before-Commit

VIGIL: 通过验证后再提交协议保护LLM代理免受工具流注入攻击

Junda Lin, Zhaomeng Zhou, Zhi Zheng, Shuochen Liu, Tong Xu, Yong Chen, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) North Automatic Control Technology Research Institute(北自动控制技术研究所)

专题命中 提示注入 :alignment(abstract);safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 VIGIL通过验证后再提交协议保护LLM代理免受工具流注入攻击,有效提升安全性和效用平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06416 2026-01-15 cs.AI cs.HC 57%

Advancing AI Negotiations: A Large-Scale Autonomous Negotiation Competition

推进人工智能谈判:大规模自主谈判竞赛

Michelle Vaccaro, Michael Caosun, Harang Ju, Sinan Aral, Jared R. Curhan

机构 * MIT Sloan School of Management(麻省理工学院斯隆管理学院) Johns Hopkins Carey Business School(约翰霍普金斯大学卡里商学院)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文通过大规模自主谈判竞赛发现,温暖特质在AI谈判中表现优异,主导策略在价值争夺中有效,需建立新的AI谈判理论以优化代理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 1 篇

2508.10337 2026-01-15 cs.AI cs.LG 62%

A Curriculum Learning Approach to Reinforcement Learning: Leveraging RAG for Multimodal Question Answering

一种基于RAG的强化学习课程学习方法:用于多模态问答

Chenliang Zhang, Lin Wang, Yuanyuan Lu, Yusheng Qi, Kexin Wang, Peixu Hou, Wenshi Chen

机构 * Meituan(美团)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种结合课程学习与强化学习的方法,用于多模态问答任务,通过检索增强生成系统在挑战中取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 2 篇

2601.09306 2026-01-15 cs.IR cs.AI 57%

On-Device Large Language Models for Sequential Recommendation

设备端的大语言模型用于序列推荐

Xin Xia, Hongzhi Yin, Shane Culpepper

机构 * The University of Queensland(昆士兰大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI

AI总结 本文提出OD-LLM框架,通过低秩压缩和分词归一化技术,实现设备端高效准确的序列推荐模型部署。

Comments WSDM'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09113 2026-01-15 cs.AI 57%

The AI Hippocampus: How Far are We From Human Memory?

人工智能海马体:我们离人类记忆还有多远?

Zixia Jia, Jiaqi Li, Yipeng Kang, Yuxuan Wang, Tong Wu, Quansen Wang, Xiaobo Wang, Shuyi Zhang, Junzhe Shen, Qing Li, Siyuan Qi, Yitao Liang, Di He, Zilong Zheng, Song-Chun Zhu

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI

AI总结 本文综述了大语言模型和多模态大语言模型中记忆机制的分类与研究进展,探讨了隐性、显性和代理记忆框架,以及多模态场景下的记忆整合与挑战。

Journal ref Transactions on Machine Learning Research (11/2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 11 篇

2601.08843 2026-01-15 cs.CL cs.LG 84%

Rubric-Conditioned LLM Grading: Alignment, Uncertainty, and Robustness

基于评分标准的LLM评分:对齐、不确定性与鲁棒性

Haotian Deng, Chris Farber, Jiyoon Lee, David Tang

机构 * Purdue University(普渡大学)

专题命中 安全评测 :alignment(title,abstract);prompt injection(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了基于评分标准的LLM评分的对齐性、不确定性与鲁棒性,发现评分标准粒度增加时对齐性下降,通过信任曲线分析发现过滤低置信度预测可提升准确性,同时模型对同义词替换敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09112 2026-01-15 cs.CY 83%

Seeking Human Security Consensus: A Unified Value Scale for Generative AI Value Safety

寻求人类安全共识:面向生成式AI价值安全的统一价值尺度

Ying He, Baiyang Li, Yule Cao, Huirun Xu, Qiuxian Chen, Shu Chen, Shangsheng Ren

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CY

AI总结 本文提出生成式AI价值安全尺度,通过生命周期视角构建价值安全风险分类和事件库,并通过基准测试揭示模型间价值安全性能差异,强调建立共享安全基础的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16281 2026-01-15 cs.RO cs.AI cs.LG 81%

Do What You Say: Steering Vision-Language-Action Models via Runtime Reasoning-Action Alignment Verification

按言行事:通过运行时推理-动作对齐验证引导视觉-语言-动作模型

Yilin Wu, Anqi Li, Tucker Hermans, Fabio Ramos, Andrea Bajcsy, Claudia Pérez-D'Arpino

机构 * NVIDIA(NVIDIA公司) Carnegie Mellon University(卡内基梅隆大学) University of Utah(犹他大学) University of Sydney(悉尼大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 通过运行时推理-动作对齐验证方法提升视觉-语言-动作模型的鲁棒性和行为组合能力

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09066 2026-01-15 cs.CL cs.AI 62%

Mi:dm 2.0 Korea-centric Bilingual Language Models

Mi:dm 2.0 韩国中心双语语言模型

Donghoon Shin, Sejung Lee, Soonmin Bae, Hwijung Ryu, Changwon Ok, Hoyoun Jung, Hyesung Ji, Jeehyun Lim, Jehoon Lee, Ji-Eun Han, Jisoo Baik, Mihyeon Kim, Riwoo Chung, Seongmin Lee, Wonjae Park, Yoonseok Heo, Youngkyung Seo, Seyoun Won, Boeun Kim, Cheolhun Heo, Eunkyeong Lee, Honghee Lee, Hyeongju Ju, Hyeontae Seo, Jeongyong Shim, Jisoo Lee, Junseok Koh, Junwoo Kim, Minho Lee, Minji Kang, Minju Kim, Sangha Nam, Seongheum Park, Taehyeong Kim, Euijai Ahn, Hong Seok Jeung, Jisu Shin, Jiyeon Kim, Seonyeong Song, Seung Hyun Kong, Sukjin Hong, Taeyang Yun, Yu-Seon Kim, A-Hyun Lee, Chae-Jeong Lee, Hye-Won Yu, Ji-Hyun Ahn, Song-Yeon Kim, Sun-Woo Jung, Eunju Kim, Eunji Ha, Jinwoo Baek, Yun-ji Lee, Wanjin Park, Jeong Yeop Kim, Eun Mi Kim, Hyoung Jun Park, Jung Won Yoon, Min Sung Noh, Myung Gyo Oh, Wongyoung Lee, Yun Jin Park, Young S. Kwon, Hyun Keun Kim, Jieun Lee, YeoJoo Park

机构 * Tech. Innovation Group(技术创新组)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 Mi:dm 2.0是一款专为韩国中心AI设计的双语大语言模型,通过整合韩国社会价值观和常识知识,提升文化适应性和生成能力,支持多任务和多场景应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08869 2026-01-15 cs.CY cs.AI 62%

AI Deployment Authorisation: A Global Standard for Machine-Readable Governance of High-Risk Artificial Intelligence

AI部署授权:面向高风险人工智能的全球标准:机器可读的治理机制

Daniel Djan Saparning

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出AI部署授权分数(ADAS),通过五个维度评估AI系统,生成可验证的部署证书,以实现安全、合法且可扩展的人工智能治理。

Comments 28 pages, 4 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09613 2026-01-15 cs.CV cs.AI 57%

CogRail: Benchmarking VLMs in Cognitive Intrusion Perception for Intelligent Railway Transportation Systems

CogRail: 对智能铁路运输系统中认知入侵感知的视觉语言模型进行基准测试

Yonglin Tian, Qiyao Zhang, Wei Xu, Yutong Wang, Yihao Wu, Xinyi Li, Xingyuan Dai, Hui Zhang, Zhiyong Cui, Baoqing Guo, Zujun Yu, Yisheng Lv

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Automation, Beijing Institute of Technology(自动化学院,北京理工大学) Signal & Communication Research Institute, China Academy of Railway Sciences(信号与通信研究所,中国铁路科学研究院) Beijing Huairou Academy of Parallel Sensing(北京怀柔平行感知院) School of Computer Science and Technology, Beijing Jiaotong University(计算机科学与技术学院,北京交通大学) State Key Lab of Intelligent Transportation Systems, School of Transportation Science and Engineering, Beihang University(智能交通系统国家重点实验室,交通科学与工程学院,北京航空航天大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 CogRail提出一个用于评估视觉语言模型在认知入侵感知任务中性能的基准,通过联合微调框架提升模型在时空推理和威胁分析中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18159 2026-01-15 cs.CV cs.LG 57%

Improved Segmentation of Polyps and Visual Explainability Analysis

改进的息肉分割与可视化可解释性分析

Akwasi Asare, Thanh-Huy Nguyen, Ulas Bagci

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 本研究提出PolypSeg-GradCAM框架,结合U-Net与Grad-CAM提升息肉分割精度并增强模型可解释性,实验结果在Dice系数、IoU和AUC-ROC等指标上均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19789 2026-01-15 cs.LG 57%

What Can RL Bring to VLA Generalization? An Empirical Study

RL能为VLA泛化带来什么?一项实证研究

Jijia Liu, Feng Gao, Bingwen Wei, Xinlei Chen, Qingmin Liao, Yi Wu, Chao Yu, Yu Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 安全评测 :DPO(abstract);分类 cs.LG

AI总结 本研究通过实证分析发现,PPO在提升VLA的语义理解和执行鲁棒性方面优于SFT,同时保持视觉鲁棒性,为VLA泛化提供了有效的方法。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09136 2026-01-15 cs.CV cs.AI 57%

SkinFlow: Efficient Information Transmission for Open Dermatological Diagnosis via Dynamic Visual Encoding and Staged RL

SkinFlow: 通过动态视觉编码和分阶段强化学习实现开放性皮肤病诊断的高效信息传输

Lijun Liu, Linwei Chen, Zhishou Zhang, Meng Tian, Hengfu Cui, Ruiyang Li, Zhaocheng Liu, Qiang Ju, Qianxi Li, Hong-Yu Zhou

机构 * Baichuan Inc.(百川公司) Department of Dermatology Peking University First Hospital(北京大学第一医院皮肤科) Beijing Key Laboratory of Molecular Diagnosis on Dermatoses(北京分子皮肤病诊断重点实验室) National Clinical Research Center for Skin and Sexually Transmitted Diseases(国家皮肤及性传播疾病临床医学研究中心) NMPA Key Laboratory for Quality Control and Evaluation of Cosmetics(国家药监局化妆品质量控制与评价重点实验室) School of Biomedical Engineering Tsinghua University(清华大学生物医学工程学院) University of Hong Kong(香港大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 SkinFlow通过动态视觉编码和分阶段强化学习提升皮肤病诊断效率,实现比通用模型更优的准确率

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08868 2026-01-15 cs.CV cs.AI cs.RO 57%

Residual Cross-Modal Fusion Networks for Audio-Visual Navigation

残差跨模态融合网络用于音频视觉导航

Yi Wang, Yinfeng Yu, Bin Ren

机构 * School of Computer Science and Technology, Xinjiang University, Urumqi, China(新疆大学计算机科学与技术学院) Joint International Research Laboratory of Silk Road Multilingual Cognitive(丝绸之路多语认知联合国际实验室) School of Mechatronic Engineering and Automation Shanghai University, Shanghai, China(上海大学机电工程与自动化学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出残差跨模态融合网络,通过双向残差交互实现音频视觉信息互补建模,提升跨域导航性能。

Comments Main paper (10 pages). Accepted for publication by the 14th international conference on Computational Visual Media (CVM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08839 2026-01-15 cs.CL 57%

Recursive Knowledge Synthesis for Multi-LLM Systems: Stability Analysis and Tri-Agent Audit Framework

多LLM系统的递归知识合成:稳定性分析与三代理审计框架

Toshiyuki Shigemura

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出三代理框架用于多LLM系统稳定性分析,通过递归知识合成实现安全可靠的知识生成。

Comments 25 pages, 9 figures. Pilot feasibility study using public-access large language models without API-level orchestration

详情

展开后加载摘要…

URL PDF HTML 收藏

8. AI治理与伦理 5 篇

2505.17217 2026-01-15 cs.CL cs.AI cs.CY 67%

Mitigating Gender Bias via Fostering Exploratory Thinking in LLMs

通过促进大语言模型的探索性思维来缓解性别偏见

Kangda Wei, Hasnat Md Abdullah, Ruihong Huang

专题命中 AI治理与伦理 :DPO(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 通过生成性别中性故事对并利用直接偏好优化,该研究旨在减少大语言模型中的性别偏见,同时保持模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09281 2026-01-15 cs.AI 57%

STaR: Sensitive Trajectory Regulation for Unlearning in Large Reasoning Models

STaR:用于大推理模型中去学习的敏感轨迹调节

Jingjing Zhou, Gaoxiang Cong, Li Su, Liang Li

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 STaR通过敏感轨迹调节方法,实现了大推理模型中高效且稳定的隐私保护去学习,减少隐私泄露风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09141 2026-01-15 cs.CL 57%

Identity-Robust Language Model Generation via Content Integrity Preservation

通过内容完整性保护实现身份鲁棒的语言模型生成

Miao Zhang, Kelly Chen, Md Mehrab Tanjim, Rumi Chunara

机构 * New York University(纽约大学) Adobe Research(Adobe研究)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

AI总结 本文提出了一种轻量级、无需训练的框架,通过保留语义关键属性并中和非关键身份信息,实现身份鲁棒的语言模型生成,有效减少身份依赖性偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08880 2026-01-15 cs.CY 57%

LERA: Reinstating Judgment as a Structural Precondition for Execution in Automated Systems

LERA:将判断作为执行的结构性前提重新引入自动化系统中

Jing, Liu

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 LERA提出判断作为执行的结构性前提,通过治理门将执行合法性绑定到判断完成,确保执行权威的问责性。

Comments 12 pages, 1 figure. Conceptual architecture paper

详情

展开后加载摘要…

URL PDF HTML 收藏