arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-03 至 2025-12-03 共收录 42 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 15 篇

2512.02329 2025-12-03 cs.SE 50%

Towards autonomous normative multi-agent systems for Human-AI software engineering teams

迈向自主规范的多智能体系统用于人机软件工程团队

Hoa Khanh Dam, Geeta Mahala, Rashina Hoda, Xi Zheng, Cristina Conati

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出自主规范的多智能体系统,通过大型语言模型赋能,实现人机协作的高效软件开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22686 2025-12-03 cs.CV 50%

Emergent Extreme-View Geometry in 3D Foundation Models

三维基础模型中的涌现极端视角几何

Yiwen Zhang, Joseph Tung, Ruojin Cai, David Fouhey, Hadar Averbuch-Elor

机构 * Cornell University(康奈尔大学) New York University(纽约大学) Kempner Institute, Harvard University(哈佛大学凯普勒研究所)

专题命中 安全评测 :alignment(abstract)

AI总结 本文研究了三维基础模型在极端视角下的几何理解能力,并提出轻量级对齐方案提升其相对姿态估计性能,同时引入新的未见过的互联网场景基准。

Comments Project page is at https://ext-3dfms.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 5 篇

2504.16148 2025-12-03 cs.CY cs.AI 62%

Towards responsible AI for education: Hybrid human-AI to confront the Elephant in the room

迈向负责任的教育AI:混合人类-人工智能以应对教育领域的关键问题

Danial Hooshyar, Gustav Šír, Yeongwook Yang, Eve Kikas, Raija Hämäläinen, Tommi Kärkkäinen, Dragan Gašević, Roger Azevedo

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨教育AI中的关键问题,提出神经符号AI作为解决这些问题的混合方法,以实现负责任的AI系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02265 2025-12-03 cs.LG cs.CY 62%

The Effect of Enforcing Fairness on Reshaping Explanations in Machine Learning Models

在机器学习模型中强制公平性对解释重塑的影响

Joshua Wolff Anderson, Shyam Visweswaran

机构 * Intelligent Systems Program, University of Pittsburgh(1 智能系统计划,匹兹堡大学) Department of Biomedical Informatics, University of Pittsburgh(2 生物医学信息学系,匹兹堡大学)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY、cs.LG

AI总结 本研究探讨了在医疗机器学习中通过偏见缓解技术提高公平性如何影响基于Shapley的特征排名,发现公平性提升可能改变特征重要性排名,强调了在模型评估中需综合考虑准确性、公平性和可解释性。

Comments 10 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02058 2025-12-03 cs.CY cs.CL 62%

Misalignment of LLM-Generated Personas with Human Perceptions in Low-Resource Settings

在低资源环境下,LLM生成的人设与人类感知的错位

Tabia Tanzin Prama, Christopher M. Danforth, Peter Sheridan Dodds

机构 * Computational Story Lab(计算故事实验室) Vermont Complex Systems Institute(佛罗里达复杂系统研究所) Vermont Advanced Computing Center(佛罗里达高级计算中心) Department of Mathematics and Statistics(数学与统计学系) Department of Computer Science University of Vermont(佛罗里达大学计算机科学系) Santa Fe Institute(圣菲研究所)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 本研究发现,在低资源环境中,LLM生成的人设在共情和可信度方面显著劣于人类,需通过现实数据验证以确保其可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02508 2025-12-03 cs.LG 57%

Water Quality Estimation Through Machine Learning Multivariate Analysis

通过机器学习多变量分析估计水质

Marco Cardia, Stefano Chessa, Alessio Micheli, Antonella Giuliana Luminare, Francesca Gambineri

机构 * University of Pisa(比萨大学) ARCHA S.R.L.(ARCHA公司)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG

AI总结 本文通过结合紫外-可见光谱与机器学习,提出了一种用于水质评估的多变量分析方法,以实现快速、准确且可解释的水质参数检测。

Comments The paper has been accepted at Italian Workshop on Neural Networks (WIRN) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02562 2025-12-03 eess.SY cs.SY 50%

Intervention Strategies for Fairness and Efficiency at Autonomous Single-Intersection Traffic Flows

自主单交叉口交通流的公平性与效率干预策略

Salman Ghori, Ania Adil, Melkior Ornik, Eric Feron

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本文提出了一种基于混合整数线性规划的干预策略,用于在无信号灯的交叉口上优化自主代理的公平性与效率,通过仿真验证早干预和公平性意识控制的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 5 篇

2305.19478 2025-12-03 cs.CV 78%

Permutation-Aware Action Segmentation via Unsupervised Frame-to-Segment Alignment

通过无监督帧到段对齐实现感知-aware的动作分割

Quoc-Huy Tran, Ahmed Mehmood, Muhammad Ahmed, Muhammad Naufil, Anas Zafar, Andrey Konin, M. Zeeshan Zia

机构 * Retrocausal, Inc.(Retrocausal公司)

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文提出一种无监督框架,通过帧到段对齐实现感知-aware的动作分割,利用变换器模型和伪标签提升分割性能。

Comments Accepted to WACV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22563 2025-12-03 cs.CL q-bio.NC 57%

Do Large Language Models Think Like the Brain? Sentence-Level Evidences from Layer-Wise Embeddings and fMRI

大语言模型是否像大脑思考?来自逐句嵌入和fMRI的层间证据

Yu Lei, Xingyang Ge, Yi Zhang, Yiming Yang, Bolei Ma

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本研究通过比较LLMs的层级嵌入与fMRI数据,揭示了大语言模型在句级层面与人类大脑的相似性,展示了LLMs在语言处理中的潜在应用价值。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15176 2025-12-03 q-bio.NC cs.AI 57%

Brain-aligning of semantic vectors improves neural decoding of visual stimuli

语义向量对齐改进视觉刺激的神经解码

Shirin Vafaei, Ryohei Fukuma, Takufumi Yanagisawa, Huixiang Yang, Satoru Oshino, Naoki Tani, Hui Ming Khoo, Hidenori Sugano, Yasushi Iimura, Hiroharu Suzuki, Madoka Nakajima, Kentaro Tamura, Haruhiko Kishima

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 语义向量对齐通过改进神经表示结构,提升视觉刺激的解码准确性。

Comments 88 pages, 30 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22052 2025-12-03 cs.CV 50%

Ov3R: Open-Vocabulary Semantic 3D Reconstruction from RGB Videos

Ov3R:从RGB视频流中进行开放词汇语义3D重建

Ziren Gong, Xiaohan Li, Fabio Tosi, Jiawei Han, Stefano Mattoccia, Jianfei Cai, Matteo Poggi

机构 * University of Bologna(博洛尼亚大学) USTC(中科大) BIT(北京理工) Monash University(墨尔本大学)

专题命中 其他安全 :alignment(abstract)

AI总结 Ov3R通过结合CLIP语义和融合描述符,实现从RGB视频流中进行开放词汇语义3D重建,提升空间人工智能的实时性和语义感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00360 2025-12-03 cs.PL 50%

ChopChop: a Programmable Framework for Semantically Constraining the Output of Language Models

ChopChop: 一种可编程框架,用于对语言模型输出进行语义约束

Shaan Nagy, Timothy Zhou, Nadia Polikarpova, Loris D'Antoni

专题命中 其他安全 :safety(abstract)

AI总结 ChopChop是一种可编程框架,通过语义约束提升语言模型输出的正确性和类型安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏