arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-26 至 2026-08-26 共收录 85 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 12 篇

2608.24163 2026-08-26 eess.AS cs.AI cs.LG 新提交 82%

Preference Optimization for Non-Verbal Vocalization Synthesis

非言语发声合成的偏好优化

Haoyang Li, Chenglin Xu, Junchuan Zhao, Yuang Cao, Liumeng Xue, Yiwen Guo, Eng Siong Chng

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文针对支持非言语发声的文本转语音系统,研究偏好优化相关设计,提出NV-CER指标,在Emilia-NV等数据集上验证标准DPO设置的有效性,为相关后训练提供实用见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23632 2026-08-26 cs.AI cs.SE 新提交 81%

Function-Level Execution Feedback for Code Preference Optimization

用于代码偏好优化的函数级执行反馈

Idris Nechnech, Sehwan Kim, Jimin Seo, Yeongoon Kim, Minhae Oh, Sangwoo Hong, Jungwoo Lee

机构 * Seoul National University(首尔大学) Konkuk University(建国大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.AI

AI总结 本研究提出STEP-KTODER框架,将代码步骤定义为多函数程序的模块级函数,结合函数级过程监督与程序结果级反馈,在多个代码基准测试中优于KTO、DPO等方法,且验证了执行标签的重要性。

Comments 20 pages, 8 figures, 14 tables. Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21883 2026-08-26 cs.CL 版本更新 81%

Token-weighted Direct Preference Optimization with Attention

基于注意力的令牌加权直接偏好优化

Chengyu Huang, Zhuohang Li, Sheng-Yen Chou, Claire Cardie

机构 * Cornell University(康奈尔大学) Vanderbilt University(范德比大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL

AI总结 提出Token-weighted DPO (TwDPO)方法,利用注意力机制估计令牌权重,在不增加额外训练成本的情况下提升大语言模型与人类偏好对齐的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24192 2026-08-26 cs.AI cs.CL 新提交 81%

Preference Data Selection for Mitigating the Alignment Tax in Large Language Models

缓解大语言模型对齐税的偏好数据选择

Minsu Kim, Jianxun Lian, Xing Xie, Steven Euijong Whang

机构 * Microsoft Research Asia(微软亚洲研究院)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出BALIGN策略,通过筛选偏好数据的三个关键特征,缓解大语言模型对齐税,在保留通用能力的同时提升对齐效果,达到最优帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24046 2026-08-26 cs.AI 新提交 79%

Algorithmic Impact Reveals the Hidden Social Choice Structure of Alignment

算法影响揭示对齐的隐藏社会选择结构

Zachary Wojtowicz, Michelle Si, Finale Doshi-Velez, Ariel Procaccia

机构 * MIT(麻省理工学院) Harvard University(哈佛大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 该研究将AI对齐问题转化为凸影响空间上的线性优化,结合福利经济学与机制设计,推导了防策略的社会选择机制及最大化功利主义社会福利的对齐协议,并通过多领域人类偏好实证验证其福利影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06621 2026-08-26 cs.GL cs.LG stat.ML 版本更新 77%

The Theorems of Dr. David Blackwell and Their Contributions to Artificial Intelligence

大卫·布莱克韦尔定理及其对人工智能的贡献

Napoleon Paxton

机构 * School of Information, University of California, Berkeley(加州大学伯克利分校信息学院)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.LG

AI总结 本文综述了布莱克韦尔的三个重要定理及其对现代人工智能和机器学习的影响,包括马尔可夫链蒙特卡罗推断、自主机器人导航、生成模型训练等领域的应用。

Comments Survey article, 20 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19342 2026-08-26 stat.ML cs.LG stat.ME 版本更新 70%

Contextual Online Uncertainty-Aware Preference Learning for Human Feedback

基于上下文的在线不确定性感知偏好学习用于人类反馈

Nan Lu, Ethan Lee, Ethan X. Fang, Junwei Lu

机构 * Department of Biostatistics, Harvard T.H. Chan School of Public Health(哈佛大学T.H.陈公共卫生学院生物统计学系) Department of Biostatistics & Bioinformatics, Duke University(杜克大学生物统计学与生物信息学系)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出一种新的统计框架,利用动态上下文信息在线决策和统计推断最优模型,通过人类偏好数据实现最优 regret 绑定和估计量渐近分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02041 2026-08-26 cs.CL cs.AI 版本更新 62%

EstLLM: Enhancing Estonian Capabilities in Multilingual LLMs via Continued Pretraining and Post-Training

EstLLM:通过持续预训练和后训练增强多语言大语言模型中的爱沙尼亚能力

Aleksei Dorkin, Taido Purason, Emil Kalbaliyev, Hele-Andra Kuulmets, Marii Ojastu, Mark Fišel, Tanel Alumäe, Eleri Aedmaa, Krister Kruusmaa, Kairit Sirts

机构 * Institute of Computer Science, University of Tartu(塔尔图大学计算机科学研究院) Department of Software Science, Tallinn University of Technology(塔林技术大学软件科学系) Institute of the Estonian Language, Tallinn, Estonia(爱沙尼亚语言研究院) School of Humanities, Tallinn University(塔林大学人文学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 EstLLM通过持续预训练和后训练提升多语言大语言模型中爱沙尼亚的能力,增强语言和推理表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23999 2026-08-26 cs.CY 新提交 57%

The urban right to AI: Pluralistic co-design and governance of public space

城市的AI权利:公共空间的多元协同设计与治理

Rashid Mushkani

专题命中 偏好对齐 :alignment(abstract);分类 cs.CY

AI总结 本论文提出公民AI权利与多元对齐方法,以蒙特利尔为实证基础,结合Street Review与LIVS研究,构建市政AI治理框架,解决公共空间AI决策中的多元价值争议问题。

Comments Ph.D. dissertation, Université de Montréal, 231 pages, 59 figures, 28 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23397 2026-08-26 cs.AI 版本更新 57%

MediSkill-Evo: Process-Constrained Self-Evolution for Evidence-Grounded Clinical Interaction

MediSkill-Evo:面向证据依据的临床交互的过程约束自进化

Ruoyu Wu, Shenfu Xie, Yinqian Sun, Haibo Tong, Feifei Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 偏好对齐 :safety(abstract);分类 cs.AI

AI总结 MediSkill-Evo是无需主干微调的临床智能体,通过四类经验存储库与过程约束偏好工具优化,在多维度评估中提升了诊断准确率等指标,验证了其临床交互性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07557 2026-08-26 cs.RO cs.AI cs.CV 版本更新 57%

AeroDPO: Unleashing Lightweight UAV Navigation with High-Fidelity Perception and Automated Preference Optimization

AeroDPO:释放具备高保真感知与自动偏好优化的轻量级无人机导航能力

Peng Xu, Chengcheng Wang, Shaohua Wan

专题命中 偏好对齐 :DPO(abstract_cn);分类 cs.AI

AI总结 本文提出AeroDPO,通过高保真感知与自动偏好优化,使20亿参数轻量级无人机导航模型达到70亿参数模型的成功率,同时降低分布外场景碰撞率,成为自主空中智能体新SOTA。

Comments 7 pages, 3 figures, 4 tables, Code is available at: [ this https URL (https://github.com/XuPeng23/AeroDPO) ]

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14069 2026-08-26 cs.CL 版本更新 57%

Open Rubric System: Scaling Reinforcement Learning with Pairwise Adaptive Rubric

开放评分系统:通过成对自适应评分表扩展强化学习

Ruipeng Jia, Yunyi Yang, Wen Wang, Yuxin Wu, Yongbo Gai, Siyuan Tao, Mengyu Zhou, Jianhe Lin, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴文勤大模型应用团队) Beijing University Of Posts and Telecommunications(北京邮电大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 开放评分系统通过成对自适应评分表和可验证评分表实现强化学习的稳健对齐,提升开放性任务的辨别力和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 10 篇

2508.09473 2026-08-26 cs.LG cs.AI cs.CL 版本更新 89%

NeuronTune: Fine-Grained Neuron Modulation for Balanced Safety-Utility Alignment in LLMs

NeuronTune:用于大语言模型中安全-效用平衡对齐的细粒度神经元调制

Birong Pan, Jianhao Chen, Mayi Xu, Qiankun Pi, Yuanyuan Zhu, Ming Zhong, Tieyun Qian

机构 * Birong Pan, Mayi Xu, Qiankun Pi, Jianhao Chen, Yuanyuan Zhu, Ming Zhong, Tieyun Qian(作者)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 NeuronTune是一种细粒度神经元调制框架,通过定位安全关键与效用保留神经元并动态控制干预范围,实现了大语言模型安全与效用的平衡优化,性能优于现有最先进技术。

Comments This work was accepted by WISE2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24275 2026-08-26 cs.AI cs.CL 新提交 81%

RePolicy: Reinforcement Learning for Safety-Policy Invocation in Agent Safeguards

RePolicy:用于智能体安全保障中安全策略调用的强化学习方法

Houcheng Jiang, Boxuan Zhang, Qiyong Zhong, Junfeng Fang, Xiang Wang, Xiangnan He

机构 * Zhejiang University(浙江大学) Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 针对现有智能体安全保障方法难以适应未见轨迹和变化策略上下文的问题,提出RePolicy方法,结合PolicyTraj-20K与带可验证奖励和策略上下文扰动的GRPO,在六个智能体安全基准上取得良好安全检测与策略调用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24191 2026-08-26 cs.CL cs.AI 新提交 81%

'Ghaib in Translation' aka Unseen Harm: Measuring Cross-Script Safety Inconsistency with 'Missed-in-Urdu' Scores in LLM Hate Speech Detection

《翻译中的隐秘危害:利用“乌尔语未检出”分数测量大型语言模型仇恨言论检测中的跨文字安全不一致性》

Fawzia Zehra (Fuzzy) Kara-Isitt, Sonal Khosla, Stephen Swift

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对乌尔语在LLM安全评估中的缺失问题,测试五款LLM在多类乌尔语相关数据集上的表现,发现其跨文字安全不一致性,且开放权重模型问题更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10068 2026-08-26 cs.CR cs.AI cs.CL 版本更新 79%

ADVERSA: Measuring Multi-Turn Guardrail Degradation and Judge Reliability in Large Language Models

ADVERSA:测量大型语言模型中多轮护栏退化和裁判可靠性

Harry Owiredu-Ashley

机构 * Independent Researcher(独立研究者)

专题命中 安全训练 :jailbreak(abstract,abstract_cn);safety(abstract);分类 cs.CL、cs.AI

AI总结 ADVERSA通过连续合规轨迹评估大型语言模型在多轮对抗中的护栏退化及裁判可靠性,揭示早期轮次更易成功突破。

Comments 12 pages, 12 figures. Independent research. Code and artifacts: this https URL (https://github.com/Harry-Ashley/adversa-guardrail-degradation). Published in the 2026 IEEE/ACIS 24th International Conference on Software Engineering Research, Management and Applications (SERA), pp. 414-417. Recipient of the Best Paper Award at IEEE/ACIS SERA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24777 2026-08-26 cs.AI cs.CR 新提交 74%

StepGuard: Learning Step-Level Guardrails with Scalable Supervision and Safety-Utility Balancing

StepGuard:利用可扩展监督与安全-效用平衡学习步骤级护栏

Zhijie Zheng, Yu Li, Chen Qian, Yuqian Fu, Yanwei Fu, Lu Sheng, Jing Shao, Dongrui Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beihang University(北京航空航天大学) Fudan University(复旦大学) Renmin University of China(中国人民大学) KAUST(阿卜杜拉国王科技大学)

专题命中 安全训练 :safety(title);分类 cs.AI

AI总结 该研究针对LLM智能体交互的安全风险,提出步骤级护栏模型StepGuard,通过自动数据引擎StepGen与动态平衡学习方法Balance-GRPO训练,在降低攻击成功率的同时仅小幅影响效用。

Comments Accepted by EMNLP 2026. Project page: this https URL (https://zheng977.github.io/StepGuard/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24037 2026-08-26 cs.CL 新提交 70%

Curved Inference II: Sleeper Agent Geometry - Extending Interpretability Beyond Probes

曲线推理 II:休眠智能体几何——将可解释性扩展至探测技术之外

Rob Manson

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文扩展了Anthropic的休眠智能体研究,提出曲线推理框架,引入语义表面积度量,通过多轮上下文窗口分析自然欺骗推理的几何特征,为线性检测失效时提供了可扩展的无监督检测路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24654 2026-08-26 cs.CL cs.CY 新提交 62%

Expectation, Backlash, Recovery, and Excitement: How Model Releases Shape Reddit Perceptions of Conversational AI Systems

期望、反弹、恢复与兴奋:模型发布如何塑造Reddit对对话式AI系统的认知

Vahid Rahimzadeh, Yury Zhauniarovich, Savvas Zannettou

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.CY

AI总结 该研究通过分析Reddit讨论发现,对话式AI系统的模型发布会动态影响用户认知,不同提供商的模型发布在情感表现与关注主题上存在明显差异,这类发布是面向用户的重要干预措施。

Comments Accepted at EMNLP 2026 Main Conference. The companion website is available at this https URL (https://vavre.github.io/p/upai)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02520 2026-08-26 cs.MA cs.AI cs.LG eess.SY 版本更新 62%

Highway Congestion Reduction through Reinforcement Learning Based Eulerian Headway Control

基于强化学习的欧拉车头间距控制实现高速公路拥堵缓解

Yaron Veksler, Sharon Hornstein, Han Wang, Maria Laura Delle Monache, Daniel Urieli

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对传统拥堵控制策略的缺陷,提出基于强化学习的欧拉车头间距控制系统,经大规模仿真验证可显著提升交通流量,为高速公路拥堵缓解提供实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24214 2026-08-26 cs.AI 新提交 57%

MetaRAG: Belief-Action Aligned Policy Optimization for Agentic RAG

MetaRAG:面向智能体检索增强生成的信念-行动对齐策略优化

Qiuyi Qi, Tian Liang, Jiamu Wang, Jinjian Zhang, Wei Zhou, Pengcheng Zhu, Linjian Mo, Ming Kong, Jie Liu, Qiang Zhu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) City University of Hong Kong(香港城市大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 MetaRAG是面向智能体RAG的信念-行动对齐策略优化框架,通过优先验证的行动生成与内部信念探测,提升了智能体RAG的准确率-效率权衡,收益可迁移至多种场景与模型。

Comments EMNLP 2026 MainConference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23941 2026-08-26 cs.AI 新提交 57%

More Rejective, Not More Discriminative: The Unit of Verification in Pre-Execution LLM Oversight

更多弃权(不执行),而非更强判别性:预执行大语言模型监督中的验证单元

Yuchen Han, Cheng Yan, Wuyang Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究针对预执行LLM监督的验证单元问题,提出双前缀框架,发现一或两个行动的短验证单元信息性最高,更长窗口会使监控器更倾向于弃权而非提升判别性。

Comments 37 pages, 20 figures, 32 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 1 篇

2608.23959 2026-08-26 cs.CR cs.AI cs.IR cs.LG 新提交 90%

NeuronGuard: Robust LLM Safety Alignment via Ablation-Aware Safety Signal Redistribution

NeuronGuard:通过感知消融的安全信号重新分配实现鲁棒的大语言模型安全对齐

Anjun Gao, Yueyang Quan, Yufei Xia, Zhuqing Liu, Minghong Fang

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 NeuronGuard是一种微调阶段防御方法,通过重新分配安全信号抵御越狱和神经元级攻击,在三个LLM、六种攻击下实现近乎零攻击成功率且保持任务准确率。

Comments To appear in EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 6 篇

2602.06268 2026-08-26 cs.CL cs.LG 版本更新 88%

MPIB: A Benchmark for Medical Prompt Injection Attacks and Clinical Safety in LLMs

MPIB:用于医疗提示注入攻击和大语言模型临床安全性的基准

Junhyeok Lee, Han Jang, Kyu Sung Choi

机构 * Seoul National University College of Medicine(首尔国立大学医学院) Seoul National University(首尔国立大学) Seoul National University College of Medicine, Seoul National University Hospital(首尔国立大学医学院、首尔国立大学医院)

专题命中 提示注入 :safety(title,abstract);prompt injection(title,abstract);分类 cs.CL、cs.LG

AI总结 MPIB是一个用于评估医疗提示注入攻击和大语言模型临床安全性的基准,通过测量临床危害事件率和攻击成功率来评估模型的安全性。

Comments 19 pages, 7 figures, 18 tables. Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23873 2026-08-26 cs.AI cs.CL cs.CR cs.LG 新提交 82%

Semantic Overlays: Mitigating Prompt Injection with Annotations Beyond Tokens and Steering Vectors

语义覆盖层:通过超越 token 和引导向量的注释缓解提示注入攻击

Joshua Penman

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出 Semantic Overlays 技术,通过在冻结语言模型残差流上应用小型学习适配器构建带外注释通道,有效缓解提示注入攻击,在多个基准测试中大幅降低攻击成功率且保持模型效用。

Comments 21 pages, 4 figures, 13 tables. Interactive demo: this https URL (https://semantic-overlays.vercel.app). Code and released adapters: this https URL (https://github.com/JoshuaSP/semantic-overlays)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24022 2026-08-26 cs.CR cs.AI 新提交 57%

What Guides the Agent? Adjudicating Unauthorized Behavior via Localizing Behavior-Guiding Instructions

智能体的决策依据是什么?通过定位行为引导指令来裁决未授权行为

Yichao Gao, Yumo Zhang, Yunhao Yao, Haohua Du, Puhan Luo, Ruiqi Li, Zhiqiang Wang

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 针对LLM智能体易受动态注入攻击的问题,提出Attnlocate框架,通过目标检测定位行为引导指令以裁决未授权行为,在多场景下表现优异且可跨模型迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24017 2026-08-26 cs.CR cs.AI 新提交 57%

WebMCP-Phalanx: Enforcing and Characterizing Trust Boundaries for Browser-Integrated LLM Agents

WebMCP-Phalanx:为浏览器集成的大语言模型智能体实施并刻画信任边界

Lin-Fa Lee, YI-YU Chang, Kuo-Hui Yeh

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 针对浏览器集成 LLM 智能体的安全风险,提出 WebMCP-Phalanx 双层架构,验证其可降低攻击成功率、阻断多数提示注入,仅少量工具返回攻击成功,任务效用未受明显影响。

Comments 8 pages, 1 figure, AAAI2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23763 2026-08-26 cs.CR cs.AI 新提交 57%

TrustShiftProbe: Characterizing, Benchmarking, and Defending Staged Trust Attacks on MCP Servers

TrustShiftProbe:对MCP服务器上的阶段性信任攻击进行表征、基准测试与防御

Mehrdad Rostamzadeh, Sidhant Narula, Mohammad Ghasemigol, Daniel Takabi

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本研究针对MCP服务器的阶段性信任攻击提出TrustShiftProbe框架,建立威胁模型、攻击引擎与防御机制SHIELD,使攻击成功率从69.5%降至42.7%

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17170 2026-08-26 cs.CR cs.AI cs.PL 版本更新 57%

Beyond OAuth: Task-Scoped Authorization for AI Agents via Natural Language Slices

PAuth - 精确任务范围授权 for 代理

Reshabh K Sharma, Linxi Jiang, Shuo Chen, Zhiqiang Lin

机构 * University of Washington(华盛顿大学) The Ohio State University(俄亥俄州立大学) Microsoft Research(微软研究院)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 PAuth通过隐式授权模型精确控制代理执行任务所需的操作权限,通过NL切片和信封结构确保操作合法性,实验表明其在安全和性能上均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 2 篇

2608.24807 2026-08-26 cs.SE cs.AI 新提交 57%

Automatic Model Card Generation Using an LLM

基于大语言模型的自动模型卡片生成

Tajkia Rahman Toma, Balreet Grewal, Cor-Paul Bezemer

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本研究提出基于LLM的MCTidy与MCGenie,前者重组模型卡片为标准化模板,后者从仓库数据直接生成,经48个Hugging Face模型验证,可实现标准化、可扩展的模型卡片文档生成。

详情

展开后加载摘要…

URL PDF HTML 收藏