arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-03 至 2025-12-03 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 5 篇

2305.19478 2025-12-03 cs.CV 78%

Permutation-Aware Action Segmentation via Unsupervised Frame-to-Segment Alignment

通过无监督帧到段对齐实现感知-aware的动作分割

Quoc-Huy Tran, Ahmed Mehmood, Muhammad Ahmed, Muhammad Naufil, Anas Zafar, Andrey Konin, M. Zeeshan Zia

机构 * Retrocausal, Inc.(Retrocausal公司)

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文提出一种无监督框架,通过帧到段对齐实现感知-aware的动作分割,利用变换器模型和伪标签提升分割性能。

Comments Accepted to WACV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22563 2025-12-03 cs.CL q-bio.NC 57%

Do Large Language Models Think Like the Brain? Sentence-Level Evidences from Layer-Wise Embeddings and fMRI

大语言模型是否像大脑思考?来自逐句嵌入和fMRI的层间证据

Yu Lei, Xingyang Ge, Yi Zhang, Yiming Yang, Bolei Ma

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本研究通过比较LLMs的层级嵌入与fMRI数据,揭示了大语言模型在句级层面与人类大脑的相似性,展示了LLMs在语言处理中的潜在应用价值。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15176 2025-12-03 q-bio.NC cs.AI 57%

Brain-aligning of semantic vectors improves neural decoding of visual stimuli

语义向量对齐改进视觉刺激的神经解码

Shirin Vafaei, Ryohei Fukuma, Takufumi Yanagisawa, Huixiang Yang, Satoru Oshino, Naoki Tani, Hui Ming Khoo, Hidenori Sugano, Yasushi Iimura, Hiroharu Suzuki, Madoka Nakajima, Kentaro Tamura, Haruhiko Kishima

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 语义向量对齐通过改进神经表示结构,提升视觉刺激的解码准确性。

Comments 88 pages, 30 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22052 2025-12-03 cs.CV 50%

Ov3R: Open-Vocabulary Semantic 3D Reconstruction from RGB Videos

Ov3R:从RGB视频流中进行开放词汇语义3D重建

Ziren Gong, Xiaohan Li, Fabio Tosi, Jiawei Han, Stefano Mattoccia, Jianfei Cai, Matteo Poggi

机构 * University of Bologna(博洛尼亚大学) USTC(中科大) BIT(北京理工) Monash University(墨尔本大学)

专题命中 其他安全 :alignment(abstract)

AI总结 Ov3R通过结合CLIP语义和融合描述符,实现从RGB视频流中进行开放词汇语义3D重建,提升空间人工智能的实时性和语义感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00360 2025-12-03 cs.PL 50%

ChopChop: a Programmable Framework for Semantically Constraining the Output of Language Models

ChopChop: 一种可编程框架,用于对语言模型输出进行语义约束

Shaan Nagy, Timothy Zhou, Nadia Polikarpova, Loris D'Antoni

专题命中 其他安全 :safety(abstract)

AI总结 ChopChop是一种可编程框架,通过语义约束提升语言模型输出的正确性和类型安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏