arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-10-13 至 2025-10-13 共收录 43 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 13 篇

2405.20179 2025-10-13 cs.CL cs.AI cs.RO 81%

Robo-Instruct: Simulator-Augmented Instruction Alignment For Finetuning Code LLMs

Zichao Hu, Junyi Jessy Li, Arjun Guha, Joydeep Biswas

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI

Comments Conference on Language Modeling (COLM) 2025, Project site: https://amrl.cs.utexas.edu/robo-instruct/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07979 2025-10-13 cs.CV 78%

Visual Representation Alignment for Multimodal Large Language Models

Heeji Yoon, Jaewoo Jung, Junwan Kim, Hyungyu Choi, Heeseong Shin, Sangbeom Lim, Honggyu An, Chaehyun Kim, Jisang Han, Donghyun Kim, Chanho Eom, Sunghwan Hong, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) New York University(纽约大学) Chung-Ang University(Chung-Ang 大学) Korea University(韩国大学) ETH Zürich(苏黎世联邦理工学院)

专题命中 其他安全 :alignment(title,abstract)

Comments Project Page: https://cvlab-kaist.github.io/VIRAL/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08855 2025-10-13 cs.LG cs.AI cs.CL 67%

Time-Aware Feature Selection: Adaptive Temporal Masking for Stable Sparse Autoencoder Training

T. Ed Li, Junyu Ren

机构 * Yale University(耶鲁大学) University of Chicago(芝加哥大学)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments First submitted on February 10th, 2025 to ICLR 2025 Workshop (XAI4Science: From Understanding Model Behavior to Discovering New Scientific Knowledge). The paper was accepted but the workshop does not generate proceedings. Now uploading to arXiv to make the paper publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19528 2025-10-13 cs.CV cs.AI cs.GR cs.LG 62%

RAGDiffusion: Faithful Cloth Generation via External Knowledge Assimilation

Xianfeng Tan, Yuhan Li, Wenxiang Shang, Yubo Wu, Jian Wang, Xuanhong Chen, Yi Zhang, Ran Lin, Bingbing Ni

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

Comments Accept by ICCV 2025 (Highlight). Project website: https://colorful-liyu.github.io/RAGDiffusion-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09359 2025-10-13 cs.CL 57%

Understanding the Effects of Domain Finetuning on LLMs

Eshaan Tanwar, Deepak Nathani, William Yang Wang, Tanmoy Chakraborty

机构 * University of Copenhagen(哥本哈根大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Indian Institute of Technology, Delhi(德里印度理工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01298 2025-10-13 q-bio.QM cs.CV cs.LG 57%

MorphGen: Controllable and Morphologically Plausible Generative Cell-Imaging

Berker Demirel, Marco Fumero, Theofanis Karaletsos, Francesco Locatello

专题命中 其他安全 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09030 2025-10-13 cs.CL 57%

Automated Refinement of Essay Scoring Rubrics for Language Models via Reflect-and-Revise

Keno Harada, Lui Yoshida, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo(东京大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08921 2025-10-13 cs.CY 57%

GBA-UBF : A Large-Scale and Fine-Grained Building Function Classification Dataset in the Greater Bay Area

Chunsong Chen, Yichen Hou, Huan Chen, Junlin Li, Rong Fu, Qiushen Lai, Yiping Chen, Ting Han

专题命中 其他安全 :alignment(abstract);分类 cs.CY

Comments 12 pages, 10 figures, The 4th ACM SIGSPATIAL International Workshop on Spatial Big Data and AI for Industrial Applications (GeoIndustry '25), November 3--6, 2025, Minneapolis, MN, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08665 2025-10-13 cs.SE cs.AI 57%

RA-Gen: A Controllable Code Generation Framework Using ReAct for Multi-Agent Task Execution

Aofan Liu, Haoxuan Li, Bin Wang, Ao Yang, Hui Li

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学) Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(超高清沉浸媒体技术省重点实验室) Shenzhen Graduate School, Peking University(深圳研究生院,北京大学) Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08620 2025-10-13 cs.CL 57%

JAI-1: A Thai-Centric Large Language Model

Attapol T. Rutherford, Jullajak Karnjanaekarin, Narongkorn Panitsrisit, Pontakorn Trakuekul, Sumana Sumanakul, Natchanon Pollertlam

机构 * Jasmine Technology Solution, Thailand Department of Linguistics, Chulalongkorn University, Thailand(语言学系,朱拉隆功大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08885 2025-10-13 cs.RO cs.AI 57%

AirScape: An Aerial Generative World Model with Motion Controllability

Baining Zhao, Rongze Tang, Mingyuan Jia, Ziyou Wang, Fanghang Man, Xin Zhang, Yu Shang, Weichen Zhang, Wei Wu, Chen Gao, Xinlei Chen, Yong Li

机构 * Shenzhen International Graduate School, Tsinghua University Pengcheng Laboratory Shenzhen China School of Computer Science \& Technology, Beijing Institute of Technology Beijing China Department of Automation, Tsinghua University Beijing China Communication Engineering College, Northeastern University Qinhuangdao China Shenzhen International Graduate School, Tsinghua University Shenzhen China Department of Electronic Engineering, Tsinghua University Beijing China BNRist, Tsinghua University Beijing China Department of Electronic Engineering, Tsinghua University BNRist, Tsinghua University Beijing China Shenzhen International Graduate School, Tsinghua University Pengcheng Laboratory School of Computer Science \& Technology, Beijing Institute of Technology Department of Automation, Tsinghua University Communication Engineering College, Northeastern University Shenzhen International Graduate School, Tsinghua University Department of Electronic Engineering, Tsinghua University BNRist, Tsinghua University Department of Electronic Engineering, Tsinghua University BNRist, Tsinghua University

专题命中 其他安全 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09531 2025-10-13 cs.CV 50%

PRNet: Original Information Is All You Have

PeiHuang Zheng, Yunlong Zhao, Zheng Cui, Yang Li

专题命中 其他安全 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09400 2025-10-13 cs.SE 50%

TIT: A Tree-Structured Instruction Tuning Approach for LLM-Based Code Translation

He Jiang, Yufu Wang, Hao Lin, Peiyu Zou, Zhide Zhou, Ang Jia, Xiaochen Li, Zhilei Ren

专题命中 其他安全 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏