arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-31 至 2026-08-31 共收录 34 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 2 篇

2510.09260 2026-08-31 cs.CR cs.LG 版本更新 90%

GREAT: Generalizable Backdoor Attacks in RLHF via Emotion-Aware Trigger Synthesis

GREAT: 通过情感感知触发器在RLHF中实现可泛化的后门攻击

Subrat Kishore Dutta, Yuelin Xu, Piyush Pant, Xiao Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA赫尔姆霍茨信息安全中心)

专题命中 偏好对齐 :RLHF(title,title_cn);分类 cs.LG

AI总结 提出GREAT框架,利用情感感知触发器在RLHF中构造自然分布后门,通过潜在空间聚类和多样性提示策略生成愤怒触发器,实现对未见触发器的泛化攻击。

Comments Accepted in EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28387 2026-08-31 cs.AI cs.LG 版本更新 73%

Prompts Without Evidence: How Neuroimaging Mentions Shift Clinical Vision-Language Model Predictions

脚手架效应:提示框架如何驱动临床VLM评估中的表面多模态增益

Doan Nam Long Vu, Simone Balloccu

机构 * Technical University of Darmstadt(达姆施塔特技术大学)

专题命中 偏好对齐 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 研究发现,在临床VLM评估中,提示中提及MRI可用性即可解释70-80%的性能提升,与图像数据是否存在无关,这种“脚手架效应”揭示了表面评估无法反映真实多模态推理能力。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 5 篇

2509.19212 2026-08-31 cs.CL cs.AI 版本更新 86%

Steering Multimodal Large Language Models Decoding for Context-Aware Safety

面向上下文感知安全的多模态大语言模型解码引导

Zheyuan Liu, Zhangchen Xu, Guangyao Dou, Xiangchi Yuan, Zhaoxuan Tan, Radha Poovendran, Meng Jiang

机构 * University of Notre Dame(notre dame 大学) University of Washington(华盛顿大学) Johns Hopkins University(约翰霍普金斯大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型安全对齐的平衡难题,提出SafeCoDe解码框架,通过两阶段机制优化上下文敏感的弃权行为,在多基准实验中有效提升安全性能且保留模型有用性。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12066 2026-08-31 cs.LG cs.AI cs.CL 版本更新 85%

The Instability of Safety: How Random Seeds and Temperature Expose Inconsistent LLM Refusal Behavior

安全性的不稳定性:随机种子和温度如何暴露LLM拒绝行为的一致性问题

Erik Larsen

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现LLM在随机种子和温度变化下安全拒绝行为不稳定,提出安全性稳定性指数并推荐多样本评估以提高可靠性。

Comments 17 pages, 7 figures, 9 tables. Code and data available at this https URL (https://github.com/erikl2/safety-refusal-stability). v3: corrects dataset attribution (AdvBench+HarmBench, not BeaverTails), fixes label-derived statistics and CIs, revises the judge-noise analysis to a sensitivity framing; conclusions unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24418 2026-08-31 cs.CR 版本更新 82%

GSPR: Aligning LLM Safeguards as Generalizable Safety Policy Reasoners

GSPR:将大语言模型(LLM)安全防护措施对齐为可泛化的安全策略推理器

Haoran Li, Jingru Zeng, Yulin Chen, Huihao Jing, Wenbin Hu, Hao Peng, Haochen Shi, Xi Yang, Ziqian Zeng, Sirui Han, Yangqiu Song

专题命中 安全训练 :safety(title,abstract)

AI总结 针对现有LLM安全防护措施泛化性不足的问题,提出可泛化安全策略推理器GSPR,通过强化学习在多安全基准训练后提升安全与类别预测能力,且推理token成本更低。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24662 2026-08-31 cs.NI 版本更新 71%

OpenTwin: Closed-Loop Digital Twins for Trustworthy Policy Deployment in Open RAN

OpenTwin:面向开放RAN的数字孪生驱动闭环KPM推理与控制

Zifan Zhang, Md Sharif Hossen, Dara Ron, Vijay K. Shah, Yuchen Liu

专题命中 安全训练 :trustworthy(title)

AI总结 针对O-RAN中KPM数据稀缺和AI模型直接部署风险,提出基于开源模拟器和O1接口的数字孪生框架OpenTwin,采用XGBoost与递归最小二乘两步ML方法实现高精度KPM镜像与节能控制。

Comments 13 pages, 5 tables, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02009 2026-08-31 cs.AI 版本更新 57%

HALT: Verification-Aware Stopping for Retrieval-Augmented Search Agents

HALT:面向检索增强搜索智能体的感知验证式停止策略

Daeyoung Roh, Donghee Han

机构 * KAIST(韩国科学技术院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 该研究针对检索增强搜索智能体的冗余检索问题,提出轻量级感知验证停止策略HALT,在三个多跳QA基准上减少冗余搜索且保持精确匹配,无需修改宿主智能体。

Comments Accepted to Findings of EMNLP 2026. 23 pages, 6 figures. Code: this https URL (https://github.com/Noverse0/HALT)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 4 篇

2605.12015 2026-08-31 cs.CR cs.AI cs.CL cs.LG cs.MA 版本更新 85%

SkillSafetyBench: Evaluating Agent Safety under Skill-Facing Attack Surfaces

SkillSafetyBench:在技能面攻击表面下评估智能体安全性

Chang Jin, An Wang, Zeming Wei, Kai Wang, Biaojie Zeng, Qiaosheng Zhang, Chao Yang, Jingjing Qu, Xia Hu, Xingcheng Xu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) East China Normal University(华东师范大学)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SkillSafetyBench基准,通过155个对抗案例评估大语言模型智能体在技能、本地工件和执行环境文件等非用户攻击下的安全失败模式。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26971 2026-08-31 cs.CV cs.MM 版本更新 82%

TempJail: Temporal Jailbreak Attacks against Image-to-Video Generation Models

TempJail:针对图像到视频生成模型的时序越狱攻击

Qi Lu, Zehui Guo, David Yuanda Gan, Zijing Li, Hengda Zhang, Weijun Xu, Qiankun Zhang

机构 * School of Cyber Science and Engineering, Huazhong University of Science and Technology(华中科技大学网络空间科学与工程学院) School of Mathematical Sciences, Peking University(北京大学数学科学学院) School of Software and engineering, Huazhong University of Science and Technology(华中科技大学软件学院) School of Computer Science, Nanjing University(南京大学计算机学院)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract)

AI总结 本文提出TempJail时序越狱框架,针对图像到视频生成模型的时序漏洞,通过分解恶意提示、受控潜在扰动等方式提升攻击成功率,在Kling等模型上获显著效果。

Comments Accepted by ACM Multimedia 2026 (ACM MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18154 2026-08-31 cs.CL cs.AI cs.DB 版本更新 81%

FENCE: A Financial and Multimodal Jailbreak Detection Dataset

FENCE:一个金融和多模态越狱检测数据集

Mirae Kim, Seonghun Jeong, Youngjun Kwak

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI

AI总结 针对金融领域多模态越狱检测资源匮乏的问题,提出FENCE数据集,包含韩英双语文本和图像,用于训练和评估检测器,实验表明基线检测器准确率达99%。

Comments lrec 2026 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19423 2026-08-31 cs.CR cs.AI cs.LG 版本更新 79%

The Autonomy Tax: Defense Training Breaks LLM Agents

自主性税:防御训练破坏LLM智能体

Shawn Li, Yue Zhao

机构 * University of Southern California(南加州大学)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);prompt injection(abstract);分类 cs.AI、cs.LG

AI总结 揭示防御训练在提升LLM智能体安全性时,系统性地破坏其工具执行能力,导致任务失败率飙升,且无法有效防御复杂攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 1 篇

2608.27141 2026-08-31 cs.CR cs.AI 版本更新 79%

Safety Does Not Compose: Non-Decaying Loop State for Autonomous LLM Agents

安全性无法组合:自主大型语言模型智能体的非衰减循环状态

Chenhao Wu, Haoxuan Jia, Yang Liu, Yingguang Yang, Yuhan Lin, Chongyang Zhang, Hao Zheng, Yulin Huang, Jianshen Zhang, Yongzhi Qi, Shang Luo, Kefu Xu, Jifeng Zhu, Bin Chong

机构 * University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Supply Chain Tech Team Y, JD.com(京东Y供应链技术团队) Peking University(北京大学) Fudan University(复旦大学) Fullive-AI(Fullive人工智能)

专题命中 红队测试 :safety(title,abstract);分类 cs.AI

AI总结 该研究发现自主LLM智能体的轨迹级安全保障存在组合性缺陷,提出非衰减循环安全状态的LoopHarness方案,可限制未授权不可逆操作数量,通过Agent-SafetyBench等评估验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 提示注入 1 篇

2608.23873 2026-08-31 cs.AI cs.CL cs.CR cs.LG 版本更新 82%

Semantic Overlays: Mitigating Prompt Injection with Annotations Beyond Tokens and Steering Vectors

语义覆盖层:通过超越 token 和引导向量的注释缓解提示注入攻击

Joshua Penman

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出 Semantic Overlays 技术,通过在冻结语言模型残差流上应用小型学习适配器构建带外注释通道,有效缓解提示注入攻击,在多个基准测试中大幅降低攻击成功率且保持模型效用。

Comments 21 pages, 4 figures, 13 tables. Interactive demo: this https URL (https://semantic-overlays.vercel.app). Code and released adapters: this https URL (https://github.com/JoshuaSP/semantic-overlays)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 1 篇

2605.02016 2026-08-31 cs.CR cs.CY 版本更新 57%

What's on Your Mind? Exploring Privacy of Mental Health Apps

你在想什么?探索心理健康应用的隐私

Chloe Georgiou, Hans Lu, Emiliano De Cristofaro, Gene Tsudik

专题命中 隐私与版权 :alignment(abstract);分类 cs.CY

AI总结 通过对25款流行的Android心理健康应用进行静态分析、动态网络捕获和LLM辅助隐私政策提取,发现这些应用存在严重的透明度问题,包括未披露的跟踪器、权限政策矛盾以及第三方AI处理披露不充分。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 13 篇

2607.15058 2026-08-31 cs.CV cs.RO 版本更新 78%

SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignment

SUFLECA:扩大用于CAD到图像对齐的特征学习

Saad Ejaz, Miguel Fernandez-Cortizas, Javier Civera, Holger Voos, Jose Luis Sanchez-Lopez

机构 * Automation and Robotics Research Group, Interdisciplinary Centre for Security, Reliability, and Trust (SnT), University of Luxembourg(自动化与机器人研究组,卢森堡大学跨学科安全、可靠性与信任中心(SnT)) Faculty of Science, Technology, and Medicine, University of Luxembourg(卢森堡大学科学、技术与医学学院) I3A, Universidad de Zaragoza(萨拉戈萨大学I3A)

专题命中 安全评测 :alignment(title,abstract)

AI总结 研究旨在解决CAD到图像对齐问题,提出弱监督框架SUFLECA。通过归一化物体坐标监督扩大特征学习,结合几何一致匹配算法,能准确快速对齐,在ScanNet25k上取得优异成绩,优于零样本基线并超越全监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20409 2026-08-31 cs.CL cs.AI cs.CY 版本更新 75%

Cognitive Chain-of-Thought (CoCoT): Structured Multimodal Reasoning about Social Situations

认知链式推理(CoCoT):关于社会情境的结构化多模态推理

Eunkyu Park, Wesley Hanwen Deng, Gunhee Kim, Motahhare Eslami, Maarten Sap

机构 * Seoul National University(首尔国立大学) Human-Computer Interaction Institute, Carnegie Mellon University(人机交互研究所,卡内基梅隆大学) Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出CoCoT框架,通过感知、情境推断和规范应用三个阶段提升多模态社会推理能力,在多个任务中取得显著提升。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26159 2026-08-31 cs.CL cs.AI 版本更新 62%

Self-Generated Text Recognition: Quality Heuristics, Cross-Task Transfer, and Downstream Bias in LLM Evaluation

自生成文本识别:LLM评估中的质量启发式、跨任务迁移与下游偏差

Jesse St. Amand, Callum Canavan, Sohaib Imran, Joseph Hewson, Aaron Lutz, Shi Feng, Puria Radmard, Lennie Wells

机构 * George Washington University(乔治·华盛顿大学) Geodesic Research(吉奥戴斯克研究机构) University of Cambridge(剑桥大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 该研究聚焦LLM的自生成文本识别(SGTR)能力,明确了导致过往研究结论分歧的实验设计因素,发现SGTR性能可跨任务迁移,且训练SGTR会引发下游偏差,强调需监控SGTR以保障AI安全。

Comments 31 pages, 9 figures (3 main body, 6 appendix), 18 tables (1 main body, 17 appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05183 2026-08-31 cs.CL cs.AI cs.HC 版本更新 62%

The Granularity Gap: A Multi-Dimensional Cross-Generational Audit of Sycophancy in Gemini Models

粒度差距:Gemini 模型中谄媚行为的多维纵向审计

Patrick Keough

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 通过多维度分级评估(Likert 0-4),揭示 Gemini 模型在连续尺度上的谄媚行为,发现粗粒度二值指标掩盖了大量社会顺从行为,且代际进步非单调,存在对齐税(谄媚与真实性负相关)。

Comments v3: Minor changes, prose improvements, nine sentences reformatted, no change to claims v2: Major correction. Three v1 claims withdrawn (U-shaped detection curve, recalibration remedy, one reliability figure); the central 29% result survives. Adds a four-judge panel over a stratified 1,200-response sample, 10,792 votes with written reasoning. Data unchanged from v1. 21 pages, 8 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.10891 2026-08-31 cs.LG cs.AI cs.CV cs.RO eess.SY 版本更新 62%

Transformer-Based Autonomous Driving Models and Deployment-Oriented Compression: A Survey

基于Transformer的自动驾驶模型与面向部署的压缩:综述

Juan Zhong, Yuhang Shi, Zukang Xu, Xi Chen

机构 * Renmin University of China(中国人民大学) Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院) Shanghai Academy of AI for Science(上海人工智能科学研究院) Department of houmo.ai(houmo.ai部门)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了基于Transformer的自动驾驶模型,并从部署角度分析了压缩与加速策略(如量化、剪枝、知识蒸馏等)如何影响模型设计、部署性、鲁棒性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27977 2026-08-31 cs.AI cs.LG 版本更新 62%

D3-Gym: Constructing Real-World Verifiable Environments for Data-Driven Discovery

D3-Gym:构建现实世界可验证环境用于数据驱动发现

Hanane Nour Moussa, Yifei Li, Zhuoyang Li, Yankai Yang, Cheng Tang, Tianshu Zhang, Nesreen K. Ahmed, Ali Payani, Ziru Chen, Huan Sun

机构 * The Ohio State University(俄亥俄州立大学) Cisco Research(思科研究)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 D3-Gym通过构建首个自动化的可验证环境数据集,提升科学数据驱动发现的模型能力,验证信号质量高,训练效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24845 2026-08-31 cs.IR cs.AI 版本更新 57%

REPREC: Representation Driven Parameter-Efficient Recommendation System

REPREC:表示驱动的参数高效推荐系统

Harshini Kavuru, Dwipam Katariya, Giri Iyengar, Pranab Mohanty, Kalanand Mishra, Raghu Machiraju

机构 * The Ohio State University(俄亥俄州立大学) Capital One, AI Foundations(Capital One人工智能基础部)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究基于大语言模型的序列推荐,提出REPREC轻量级框架,通过轻量级用户表示对齐和MLP注入器映射用户嵌入,在多基准数据集实验中优于LoRA,能保持性能并降低训练时间,平衡推荐质量与计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06869 2026-08-31 cs.AI 版本更新 57%

Evidence-Based Intelligent Diagnostic and Therapeutic Visualization System with Large Language Models: Multi-Turn Interaction and Multimodal Treatment Plan Generation

基于证据的智能诊断与治疗可视化系统与大语言模型:多轮交互与多模态治疗方案生成

Yunhan Wang, Yuda Wang, Zhiying Tu, Mingqiang Song, Li Song, Kun Li, Dianhui Chu, Bolin Zhang

机构 * Harbin Institute of Technology, Weihai(哈尔滨工业大学(威海)) Harbin Institute of Technology (Weihai) Qingdao Research Institute(哈尔滨工业大学(威海)青岛研究院) Shandong Key Laboratory of Digital Service Computing Technology and Systems(山东省数字服务计算技术与系统重点实验室) Weihai Municipal Hospital(威海市人民医院) Shanghai Taizhu Technology Co., Ltd(上海泰山技术有限公司) Tianjin Zhifu Qihuang Medical Technology Co., Ltd(天津中孚启黄医疗技术有限公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 提出知识增强的可视化诊断系统,通过知识图谱约束、信息增益驱动提问和多模态治疗呈现,提升中医辨证透明度和治疗可解释性。

Comments 29 pages, 9 figures, 5 tables, including supporting information

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18414 2026-08-31 cs.CR cs.AI 版本更新 57%

Prompts Don't Protect: Architectural Enforcement via MCP Proxy for LLM Tool Access Control

提示不保护:通过MCP代理实现的架构强制以实现LLM工具访问控制

Rohith Uppala

机构 * Independent Researcher(独立研究员)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种受控的MCP代理,通过在工具发现和工具调用两个阶段实施基于属性的访问控制(ABAC),有效阻止了未经授权的工具调用,而提示基于的限制仅能减少11-18个百分点的未授权调用率,证明了架构强制在部署的智能体系统中实现可靠工具访问控制的必要性。

Comments 7 pages, 4 tables, 2 figures. Camera-ready version accepted to the EMNLP 2026 Industry Track; adds benign-utility and abstention evaluation, latency percentiles, and revised limitations

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06079 2026-08-31 cs.CV cs.AI 版本更新 57%

Scientific Graphics Program Synthesis via Dual Self-Consistency Reinforcement Learning

通过双自一致性强化学习实现科学图形程序合成

Juekai Lin, Yun Zhu, Honglin Lin, Sijing Li, Tianwei Lin, Zheng Liu, Xiaoyang Wang, Wenqiao Zhang, Lijun Wu

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出双自一致性强化学习框架,结合高质量数据集和多维基准,提升科学图形到可编辑TikZ代码的转换能力,实现视觉与结构的高精度优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26519 2026-08-31 cs.CE cs.SE 版本更新 50%

Report of the 2026 Workshop on Next-Generation Ecosystems for Scientific Computing: Harnessing Community, Software, and AI for Cross-Disciplinary Team Science

2026年科学计算下一代生态系统研讨会报告:利用社区、软件与AI推进跨学科团队科学

Lois Curfman McInnes, Dorian Arnold, Prasanna Balaprakash, Mike Bernhardt, Franck Cappello, Beth Cerny, Deborah DiazGranados, Anshu Dubey, Nichole Etienne, Roscoe Giles, Diego Gomez-Zara, Denice Ward Hood, Mary Ann Leung, Vanessa Lopez-Marrero, Olivia B. Newton, Irene Qualters, Keita Teranishi, Stefan M. Wild, Gabrielle Allen, Richard Arthur, Alexandra Ballow, Tony Baylis, David E. Bernholdt, Daniel Bielich, Johanna Cohoon, Jeremy Crampton, Charles Ferenbaugh, Stephen M. Fiore, Thomas Herault, Tanzima Islam, Stephen Jacobsohn, Meifeng Lin, Charles Lively, Satoshi Matsuoka, Stasa Milojevic, Daniel Nichols, Chris Oehmen, Santiago Ospina Tabares, Michael E. Papka, Katherine Riley, Damian Rouson, Sudip K. Seal, Brittany Segundo, John Shalf, Andrew Siegel, Valerie Taylor, Jim Willenbring, Lou Woodley

专题命中 安全评测 :trustworthy(abstract)

AI总结 本报告梳理2026年科学计算下一代生态系统研讨会成果,明确四大战略主题及八项社区行动优先事项,为AI时代构建可信可持续的科学计算生态系统指明方向。

Comments 27 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25210 2026-08-31 cs.DB 版本更新 50%

Bolt-on, Verifiable Provenance for LLM-Powered Data Processing

用于大语言模型驱动数据处理的外挂式可验证来源

Yiming Lin, Sepanta Zeighami, Aditya G. Parameswaran

专题命中 安全评测 :trustworthy(abstract)

AI总结 针对LLM黑盒无法提供答案来源及可信度的问题,提出外挂式框架BLIP,可高效生成小尺寸可验证来源,在七个数据集上准确率较最优基线高30%以上且成本低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12411 2026-08-31 cs.CV 版本更新 50%

DeferredSeg:A Multi-Expert Deferral Framework for Medical Image Segmentation

DeferredSeg: 一种多专家延迟框架用于可信的医学图像分割

Qiuyu Tian, Haoliang Sun, Yunshan Wang, Yinghuan Shi, Yilong Yin

机构 * School of Software, Shandong University(山东大学软件学院) Department of Clinical Laboratory, Shandong Provincial Hospital Affiliated to Shandong First Medical University(山东第一医科大学附属山东省人民医院临床检验科) School of Computer Science and Technology, Nanjing University(南京大学计算机科学与技术学院)

专题命中 安全评测 :trustworthy(abstract)

AI总结 DeferredSeg通过引入延迟感知分割框架,在医学图像分割中实现人机协作,通过动态路由和损失函数提升分割可靠性,优于基线方法。

Comments Accepted by Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏

8. AI治理与伦理 3 篇

2608.13574 2026-08-31 cs.AI cs.MA 版本更新 70%

Agentao: A Policy-Governed Runtime Harness for Embeddable Tool-Using LLM Agents

Agentao:面向使用工具的大语言模型智能体的受管控本地优先运行时

Bo Jin, Qiang Jiao, Xin Tong

机构 * The Third Research Institute of the Ministry of Public Security(公安部第三研究所) Bureau of Science and Technology Information Ministry of Public Security of the People’s Republic of China(中华人民共和国公安部科技信息局) School of Information and Cyber Security People’s Public Security University of China(中国人民公安大学信息与网络安全学院)

专题命中 AI治理与伦理 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 针对工具使用型LLM智能体的安全管控需求,提出Agentao运行时,通过分层架构分离动作提案与授权执行,将权限等构建为显式抽象,提升智能体可管控性与可检查性。

Comments The code is publicly available at Github. We are conducting testing and analysis of this framework, and will provide experimental results and examples in future versions

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13673 2026-08-31 cs.CY 版本更新 57%

Comparing Apples to Oranges: A Taxonomy for Navigating the Global Landscape of AI Regulation

将苹果与橙子对比:AI监管全球格局梳理的分类体系

Sacha Alanoca, Shira Gur-Arieh, Tom Zick, Kevin Klyman

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文针对AI监管全球格局构建分类体系,梳理五大司法管辖区的AI监管规则,提供交互式可视化工具,以减少法律不确定性,助力全球协调的AI治理。

Comments 24 pages, 3 figures, FAccT '25

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05281 2026-08-31 cs.HC 版本更新 50%

Algorithmic Fairness Perceptions in the Global South: Evidence from Bangladesh on Ride-Sharing, Beauty Filters, and Large Language Models

全球南方的算法公平感知:来自孟加拉国关于网约车、美颜滤镜和大型语言模型的证据

Ahmed Abdal Shafi Rasel, Ahmed Mustafa Amlan, Tasmim Shajahan Mim

专题命中 AI治理与伦理 :trustworthy(abstract)

AI总结 该研究通过对孟加拉国199名民众的双语调查,揭示了情境影响算法公平感知、对算法保护需求普遍、美颜滤镜损害自我形象、识别与阐明LLM文化偏见存在差异等四个关键模式,指出仅结果导向的公平指标存在局限。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏