arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-27 至 2025-11-27 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 7 篇

2511.20931 2025-11-27 cs.CV cs.AI cs.LG 81%

Open Vocabulary Compositional Explanations for Neuron Alignment

开放词汇组合解释用于神经元对齐

Biagio La Rosa, Leilani H. Gilpin

机构 * Department of Computer Science and Engineering University of California, Santa Cruz(计算机科学与工程系加州大学圣克ruz分校)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种开放词汇组合解释框架,通过语义分割生成掩码来实现神经元对齐,提升解释的灵活性和适用性。

Comments 47 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20669 2025-11-27 cs.CL cs.AI 62%

Structured Definitions and Segmentations for Legal Reasoning in LLMs: A Study on Indian Legal Data

结构化定义与分割在大语言模型法律推理中的应用:对印度法律数据的研究

Mann Khatri, Mirza Yusuf, Rajiv Ratn Shah, Ponnurangam Kumaraguru

机构 * Indraprastha Institute of Information Technology(印度普拉斯塔学院信息科技研究所) International Institute of Information Technology Hyderabad(国际信息科技研究所(海得拉巴))

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文通过结构化定义与分割方法提升大语言模型在法律推理中的性能,实验显示在印度法律数据集上模型性能提升达1.5%-4.36%。

Comments Accepted at BDA 2025 as short paper; This paper is long version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19858 2025-11-27 cs.CL cs.AI 62%

A Systematic Analysis of Large Language Models with RAG-enabled Dynamic Prompting for Medical Error Detection and Correction

基于RAG动态提示的大型语言模型系统分析:用于医疗错误检测与纠正

Farzad Ahmed, Joniel Augustine Jerome, Meliha Yetisgen, Özlem Uzuner

机构 * George Mason University(乔治·马歇尔大学) University of Washington(华盛顿大学)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于RAG动态提示的医疗错误检测与纠正方法,通过对比不同提示策略,发现RDP在准确率、召回率和纠错可靠性方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20965 2025-11-27 cs.CV cs.CL 57%

TrafficLens: Multi-Camera Traffic Video Analysis Using LLMs

TrafficLens: 多摄像头交通视频分析使用LLMs

Md Adnan Arefeen, Biplob Debnath, Srimat Chakradhar

机构 * NEC Laboratories America(NEC美国实验室) University of Missouri–Kansas City (UMKC)(密苏里大学-堪萨斯城分校)

专题命中 其他安全 :safety(abstract);分类 cs.CL

AI总结 TrafficLens通过利用多摄像头重叠区域和对象相似性检测,高效地将视频转换为文本,减少处理时间并提升交通视频分析效率。

Comments 2024 IEEE 27th International Conference on Intelligent Transportation Systems (ITSC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21375 2025-11-27 cs.CV 50%

Thinking With Bounding Boxes: Enhancing Spatio-Temporal Video Grounding via Reinforcement Fine-Tuning

通过边界框思考:通过强化微调提升空间时间视频定位

Xin Gu, Haoji Zhang, Qihang Fan, Jingxuan Niu, Zhipeng Zhang, Libo Zhang, Guang Chen, Fan Chen, Longyin Wen, Sijie Zhu

机构 * ByteDance Intelligent Creation(字节跳动智能创作) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai Jiao Tong University(上海交通大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 其他安全 :alignment(abstract)

AI总结 STVG-o1通过强化微调提升空间时间视频定位性能,实现无需架构修改的先进结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21045 2025-11-27 cs.SD 50%

CartoonSing: Unifying Human and Nonhuman Timbres in Singing Generation

CartoonSing: 统一人类与非人类声音在歌唱生成中的表现

Jionghao Han, Jiatong Shi, Zhuoyan Tao, Yuxun Tang, Yiwen Zhao, Gus Xia, Shinji Watanabe

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Southern California(南加州大学) Renmin University of China(中国人民大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 其他安全 :alignment(abstract)

AI总结 CartoonSing通过统一框架生成非人类声音,解决非人类声音数据稀缺和音色差异问题,拓展了歌唱生成的应用范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21037 2025-11-27 cs.HC 50%

LOOM: Personalized Learning Informed by Daily LLM Conversations Toward Long-Term Mastery via a Dynamic Learner Memory Graph

LOOM:通过动态学习者记忆图实现每日LLM对话指导的个性化学习以实现长期掌握

Justin Cui, Kevin Pu, Tovi Grossman

专题命中 其他安全 :alignment(abstract)

AI总结 LOOM通过动态学习者记忆图分析每日LLM对话,生成个性化学习材料以实现长期掌握,兼顾连续性和主动性,提升学习者持续进步与即时相关性的平衡。

Comments Accepted to the PerFM Workshop at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏