arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-10-21 至 2025-10-21 共收录 98 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 36 篇

2510.16095 2025-10-21 cs.AI 57%

Reliability of Large Language Model Generated Clinical Reasoning in Assisted Reproductive Technology: Blinded Comparative Evaluation Study

Dou Liu, Ying Long, Sophia Zuoqiu, Di Liu, Kang Li, Yiting Lin, Hanyi Liu, Rong Yin, Tian Tang

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11582 2025-10-21 cs.CL 57%

Subjective Evaluation Profile Analysis of Science Fiction Short Stories and its Critical-Theoretical Significance

Kazuyoshi Otsuka

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :RLHF(abstract);分类 cs.CL

Comments 38 pages. Manuscript submitted for review to the Journal of Computational Literary Studies (JCLS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10833 2025-10-21 cs.LG 57%

MergeBench: A Benchmark for Merging Domain-Specialized LLMs

Yifei He, Siqi Zeng, Yuzheng Hu, Rui Yang, Tong Zhang, Han Zhao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :safety(abstract);分类 cs.LG

Comments NeurIPS 2025 Track on Datasets and Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08750 2025-10-21 cs.CL 57%

HCR-Reasoner: Synergizing Large Language Models and Theory for Human-like Causal Reasoning

Yanxi Zhang, Xin Cong, Zhong Zhang, Xiao Liu, Dongyan Zhao, Yesai Wu

机构 * Center for Data Science, AAIS, Peking University(数据科学中心,AAIS,北京大学) Wangxuan Institute of Computer Technology, Peking University(王轩计算机技术研究所,北京大学) Tsinghua University(清华大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17034 2025-10-21 cs.CV 50%

Where, Not What: Compelling Video LLMs to Learn Geometric Causality for 3D-Grounding

Yutong Zhong

机构 * New York University(纽约大学)

专题命中 安全评测 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20149 2025-10-21 cs.SE 50%

Synergistic Enhancement of Requirement-to-Code Traceability: A Framework Combining Large Language Model based Data Augmentation and an Advanced Encoder

Jianzhang Zhang, Jialong Zhou, Nan Niu, Jinping Hua, Chuang Liu

专题命中 安全评测 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01879 2025-10-21 cs.MM cs.CV cs.SD eess.AS 50%

Nexus: An Omni-Perceptive And -Interactive Model for Language, Audio, And Vision

Che Liu, Yingji Zhang, Dong Zhang, Weijie Zhang, Chenggong Gong, Yu Lu, Shilin Zhou, Ziliang Gan, Ziao Wang, Haipang Wu, Ji Liu, André Freitas, Qifan Wang, Zenglin Xu, Rongjuncheng Zhang, Yong Dai

机构 * Imperial College London(伦敦帝国学院) University of Manchester(曼彻斯特大学) HiThink Research(HiThink研究院) Soochow University(苏州大学) Hong Kong Baptist University(香港 Baptist大学) Idiap Research Institute(Idiap研究 institute) Meta AI Fudan University(复旦大学)

专题命中 安全评测 :alignment(abstract)

Comments Project: https://github.com/HiThink-Research/NEXUS-O

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16597 2025-10-21 cs.IR 50%

FRONTIER-RevRec: A Large-scale Dataset for Reviewer Recommendation

Qiyao Peng, Chen Wang, Yinghui Wang, Hongtao Liu, Xuan Guo, Wenjun Wang

专题命中 安全评测 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16579 2025-10-21 cs.SE 50%

Human-Aligned Code Readability Assessment with Large Language Models

Wendkûuni C. Ouédraogo, Yinghua Li, Xueqi Dang, Pawel Borsukiewicz, Xin Zhou, Anil Koyuncu, Jacques Klein, David Lo, Tegawendé F. Bissyandé

专题命中 安全评测 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06767 2025-10-21 cs.SE 50%

Beyond Surface Similarity: Evaluating LLM-Based Test Refactorings with Structural and Semantic Awareness

Wendkûuni C. Ouédraogo, Yinghua Li, Xueqi Dang, Xin Zhou, Anil Koyuncu, Jacques Klein, David Lo, Tegawendé F. Bissyandé

专题命中 安全评测 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 5 篇

2510.16555 2025-10-21 cs.AI cs.LG 73%

Urban-R1: Reinforced MLLMs Mitigate Geospatial Biases for Urban General Intelligence

Qiongyan Wang, Xingchen Zou, Yutian Jiang, Haomin Wen, Jiaheng Wei, Qingsong Wen, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Carnegie Mellon University(卡内基梅隆大学) Squirrel Ai Learning

专题命中 AI治理与伦理 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04650 2025-10-21 cs.LG 57%

Neural Network Reprogrammability: A Unified Theme on Model Reprogramming, Prompt Tuning, and Prompt Instruction

Zesheng Ye, Chengyi Cai, Ruijiang Dong, Jianzhong Qi, Lei Feng, Pin-Yu Chen, Feng Liu

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02649 2025-10-21 cs.AI 57%

Fully Autonomous AI Agents Should Not be Developed

Margaret Mitchell, Avijit Ghosh, Alexandra Sasha Luccioni, Giada Pistilli

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17119 2025-10-21 cs.HC 50%

Design Framework for Conversational Agent in Couple relationships: A Systematic Review

Soyoung Jung, Sung Park

专题命中 AI治理与伦理 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07314 2025-10-21 cs.IR 50%

Learnable Item Tokenization for Generative Recommendation

Wenjie Wang, Honghui Bao, Xinyu Lin, Jizhi Zhang, Yongqi Li, Fuli Feng, See-Kiong Ng, Tat-Seng Chua

专题命中 AI治理与伦理 :alignment(abstract)

Comments Accepted by CIKM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 23 篇

2510.16540 2025-10-21 cs.CV cs.AI 79%

Enhancing Compositional Reasoning in CLIP via Reconstruction and Alignment of Text Descriptions

Jihoon Kwon, Kyle Min, Jy-yong Sohn

机构 * Seoul National University(首尔国立大学) Oracle(Oracle公司) Yonsei University(延世大学) Intel Labs(英特尔实验室)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

Comments Accepted at NeurIPS 2025 (poster). This is the camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17598 2025-10-21 cs.AI cs.CL cs.LG 78%

Reasoning Distillation and Structural Alignment for Improved Code Generation

Amir Jalilifard, Anderson de Rezende Rocha, Marcos Medeiros Raimundo

机构 * Universidade Estadual de Campinas(坎皮纳斯州立大学)

专题命中 其他安全 :alignment(title);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00003 2025-10-21 cs.CV 78%

Large Language Model-Guided Semantic Alignment for Human Activity Recognition

Hua Yan, Heng Tan, Yi Ding, Pengfei Zhou, Vinod Namboodiri, Yu Yang

机构 * Lehigh University(莱维理工大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Pittsburgh(匹兹堡大学)

专题命中 其他安全 :alignment(title);safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11018 2025-10-21 cs.CL cs.AI 76%

GRIFFIN: Effective Token Alignment for Faster Speculative Decoding

Shijing Hu, Jingyang Li, Xingyu Xie, Zhihui Lu, Kim-Chuan Toh, Pan Zhou

机构 * Fudan University(复旦大学) National University of Singapore(新加坡国立大学) Singapore Management University(新加坡管理学院)

专题命中 其他安全 :alignment(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03313 2025-10-21 cs.LG cs.CL 62%

LLM as GNN: Graph Vocabulary Learning for Text-Attributed Graph Foundation Models

Xi Zhu, Haochen Xue, Ziwei Zhao, Wujiang Xu, Jingyuan Huang, Minghao Guo, Qifan Wang, Kaixiong Zhou, Imran Razzak, Yongfeng Zhang

机构 * Rutgers University(罗格斯大学) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) University of Science and Technology of China(中国科学技术大学) Meta AI North Carolina State University(北卡罗来纳州立大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11704 2025-10-21 cs.CL cs.AI 62%

Adapting Chat Language Models Using Only Target Unlabeled Language Data

Atsuki Yamaguchi, Terufumi Morishita, Aline Villavicencio, Nikolaos Aletras

机构 * University of Sheffield(谢菲尔德大学) Hitachi, Ltd.(日立株式会社) University of Exeter(埃克塞特大学)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

Comments Accepted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10807 2025-10-21 cs.LG cs.AI stat.ML 62%

HardNet: Hard-Constrained Neural Networks with Universal Approximation Guarantees

Youngjae Min, Navid Azizan

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16068 2025-10-21 cs.CY cs.AI 62%

Co-Designing Interdisciplinary Design Projects with AI

Wei Ting Liow, Sumbul Khan, Lay Kee Ang

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.CY

Comments to be published in IEEE TALE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15996 2025-10-21 cs.LG cs.AI 62%

Using Kolmogorov-Smirnov Distance for Measuring Distribution Shift in Machine Learning

Ozan K. Tonguz, Federico Taschin

机构 * Carnegie Mellon University, USA(卡内基梅隆大学,美国) KTH Royal Institute of Technology, Sweden(皇家理工学院)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16952 2025-10-21 cs.HC cs.CL 57%

Real-Time World Crafting: Generating Structured Game Behaviors from Natural Language with Large Language Models

Austin Drake, Hang Dong

机构 * University of Exeter Department of Computer Science(埃克塞特大学计算机科学系)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

Comments 16 pages, 11 figures (including appendix). To be presented at the 5th Wordplay @ EMNLP workshop (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16885 2025-10-21 cs.LG 57%

UniGTE: Unified Graph-Text Encoding for Zero-Shot Generalization across Graph Tasks and Domains

Duo Wang, Yuan Zuo, Guangyue Lu, Junjie Wu

机构 * MIIT Key Laboratory of Data Intelligence and Management, Beihang University(信息科技部数据智能与管理重点实验室,北京航空航天大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16772 2025-10-21 cs.CV cs.AI 57%

Region in Context: Text-condition Image editing with Human-like semantic reasoning

Thuy Phuong Vu, Dinh-Cuong Hoang, Minhhuy Le, Phan Xuan Tan

机构 * Greenwich Vietnam FPT University(越南格林威治FPT大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18067 2025-10-21 cs.LG cs.CE 57%

Multiscale Neural PDE Surrogates for Prediction and Downscaling: Application to Ocean Currents

Abdessamad El-Kabid, Loubna Benabbou, Redouane Lguensat, Alex Hernández-García

机构 * Mila – Québec AI Institute(魁北克人工智能研究所) École polytechnique Palaiseau, France(巴黎理工大学Palaiseau分校) Université du Québec à Rimouski Lévis, Québec, Canada(魁北克 Rimouski 大学 Lévis 分校) Institut Pierre-Simon Laplace, IRD Sorbonne Université Paris, France(皮埃尔-西蒙·拉普拉斯研究所,IRD 巴黎索邦大学) Université de Montréal Montréal, Québec, Canada(蒙特利尔大学)

专题命中 其他安全 :safety(abstract);分类 cs.LG

Comments Tackling Climate Change with Machine Learning: workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11521 2025-10-21 cs.LG cs.RO 57%

LANGTRAJ: Diffusion Model and Dataset for Language-Conditioned Trajectory Simulation

Wei-Jer Chang, Wei Zhan, Masayoshi Tomizuka, Manmohan Chandraker, Francesco Pittaluga

机构 * UC Berkeley(加州大学伯克利分校) NEC Labs America(NEC美国实验室) UC San Diego(加州大学圣地亚哥分校)

专题命中 其他安全 :safety(abstract);分类 cs.LG

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25748 2025-10-21 cs.CV cs.AI 57%

Dolphin v1.0 Technical Report

Taohan Weng, Kaibing Hu, Henan Liu, Siya Liu, Xiaoyang Liu, Zhenyu Liu, Jiren Ren, Boyan Wang, Boyang Wang, Yiyu Wang, Yalun Wu, Chaoran Yan, Kaiwen Yan, Jinze Yu, Chi Zhang, Duo Zhang, Haoyun Zheng, Xiaoqing Guo, Jacques Souquet, Hongcheng Guo, Anjie Le

专题命中 其他安全 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏