arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-09-16 至 2025-09-16 共收录 17 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 17 篇

2509.11507 2025-09-16 cs.AI 70%

MedicalOS: An LLM Agent based Operating System for Digital Healthcare

Jared Zhu, Junde Wu

机构 * University of Oxford(牛津大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09686 2025-09-16 cs.IR cs.AI 70%

GeoGPT-RAG Technical Report

Fei Huang, Fan Wu, Zeqing Zhang, Qihao Wang, Long Zhang, Grant Michael Boquet, Hongyang Chen

机构 * GeoGPT Team(GeoGPT团队) Zhejiang Lab(浙江实验室)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

Comments 19 pages, 10 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11595 2025-09-16 cs.AI cs.CE cs.CR cs.LG cs.MA 62%

AMLNet: A Knowledge-Based Multi-Agent Framework to Generate and Detect Realistic Money Laundering Transactions

Sabin Huda, Ernest Foo, Zahra Jadidi, MA Hakim Newton, Abdul Sattar

机构 * School of Information and Communication Technology, Griffith University, QLD Australia(信息与通信技术学院,格里菲斯大学,昆士兰州澳大利亚) School of Information and Physical Sciences, The University of Newcastle, NSW Australia(信息与物理科学学院,新castle大学,新南威尔士州澳大利亚)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11376 2025-09-16 cs.LG cs.AI cs.CE 62%

Intelligent Reservoir Decision Support: An Integrated Framework Combining Large Language Models, Advanced Prompt Engineering, and Multimodal Data Fusion for Real-Time Petroleum Operations

Seyed Kourosh Mahjour, Seyed Saman Mahjour

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10802 2025-09-16 q-fin.RM cs.CL cs.LG q-fin.CP 62%

Why Bonds Fail Differently? Explainable Multimodal Learning for Multi-Class Default Prediction

Yi Lu, Aifan Ling, Chaoqun Wang, Yaxin Xu

机构 * School of Economics and Finance, Shanghai International Studies University(经济金融学院,上海国际问题研究大学) School of AI and Advanced Computing, Xi’an Jiaotong-Liverpool University(人工智能与先进计算学院,西安交通大学利物浦大学) School of Foreign Studies, Shanghai University of Finance and Economics(外国语言学院,上海金融学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12137 2025-09-16 eess.SY cs.AI cs.SY 57%

Control Analysis and Design for Autonomous Vehicles Subject to Imperfect AI-Based Perception

Tao Yan, Zheyu Zhang, Jingjing Jiang, Wen-Hua Chen

机构 * Department of Aeronautical and Automotive Engineering, Loughborough University(航空与汽车工程系,洛辛厄姆大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08638 2025-09-16 eess.AS cs.AI cs.MM cs.SD 57%

YuE: Scaling Open Foundation Models for Long-Form Music Generation

Ruibin Yuan, Hanfeng Lin, Shuyue Guo, Ge Zhang, Jiahao Pan, Yongyi Zang, Haohe Liu, Yiming Liang, Wenye Ma, Xingjian Du, Xinrun Du, Zhen Ye, Tianyu Zheng, Zhengxuan Jiang, Yinghao Ma, Minghao Liu, Zeyue Tian, Ziya Zhou, Liumeng Xue, Xingwei Qu, Yizhi Li, Shangda Wu, Tianhao Shen, Ziyang Ma, Jun Zhan, Chunhui Wang, Yatian Wang, Xiaowei Chi, Xinyue Zhang, Zhenzhu Yang, Xiangzhou Wang, Shansong Liu, Lingrui Mei, Peng Li, Junjie Wang, Jianwei Yu, Guojian Pang, Xu Li, Zihao Wang, Xiaohuan Zhou, Lijun Yu, Emmanouil Benetos, Yong Chen, Chenghua Lin, Xie Chen, Gus Xia, Zhaoxiang Zhang, Chao Zhang, Wenhu Chen, Xinyu Zhou, Xipeng Qiu, Roger Dannenberg, Jiaheng Liu, Jian Yang, Wenhao Huang, Wei Xue, Xu Tan, Yike Guo

机构 * HKUST(香港科技大学) MAP(多模态艺术投影)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments https://github.com/multimodal-art-projection/YuE

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11802 2025-09-16 cs.CL 57%

When Curiosity Signals Danger: Predicting Health Crises Through Online Medication Inquiries

Dvora Goncharok, Arbel Shifman, Alexander Apartsin, Yehudit Aperstein

专题命中 安全评测 :safety(abstract);分类 cs.CL

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10937 2025-09-16 cs.CL 57%

An Interpretable Benchmark for Clickbait Detection and Tactic Attribution

Lihi Nofar, Tomer Portal, Aviv Elbaz, Alexander Apartsin, Yehudit Aperstein

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10843 2025-09-16 cs.CL 57%

Evaluating Large Language Models for Evidence-Based Clinical Question Answering

Can Wang, Yiqun Chen

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06336 2025-09-16 cs.CV cs.AI cs.CR 57%

Multi-View Slot Attention Using Paraphrased Texts for Face Anti-Spoofing

Jeongmin Yu, Susang Kim, Kisu Lee, Taekyoung Kwon, Won-Yong Shin, Ha Young Kim

机构 * Yonsei University(延世大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments Accepted to ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06646 2025-09-16 econ.GN cs.CL q-fin.EC 57%

Evaluating and Aligning Human Economic Risk Preferences in LLMs

Jiaxin Liu, Yixuan Tang, Yi Yang, Kar Yan Tam

专题命中 安全评测 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14633 2025-09-16 q-bio.NC cs.AI cs.CV 57%

Evaluating Representational Similarity Measures from the Lens of Functional Correspondence

Yiqing Bo, Ansh Soni, Sudhanshu Srivastava, Meenakshi Khosla

机构 * University of California, San Diego(加州大学圣地亚哥分校) University of Pennsylvania(宾夕法尼亚大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

Comments Published in CCN 2025 Proceedings (Talk & Poster), May 14, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12076 2025-09-16 cs.IR 50%

AEFS: Adaptive Early Feature Selection for Deep Recommender Systems

Fan Hu, Gaofeng Lu, Jun Chen, Chaonan Guo, Yuekui Yang, Xirong Li

专题命中 安全评测 :alignment(abstract)

Comments Accepted by TKDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11885 2025-09-16 cs.CV 50%

BREA-Depth: Bronchoscopy Realistic Airway-geometric Depth Estimation

Francis Xiatian Zhang, Emile Mackute, Mohammadreza Kasaei, Kevin Dhaliwal, Robert Thomson, Mohsen Khadem

机构 * Baillie Gifford Pandemic Science Hub(巴利尔·吉福德疫情科学中心) Institute of Regeneration and Repair(再生与修复研究所) Heriot-Watt University(赫罗特-瓦特大学) Institute of Photonics and Quantum Science(光子与量子科学研究所)

专题命中 安全评测 :safety(abstract)

Comments The paper has been accepted to MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19260 2025-09-16 cs.CR 50%

ALRPHFS: Adversarially Learned Risk Patterns with Hierarchical Fast \& Slow Reasoning for Robust Agent Defense

Shiyu Xiang, Tong Zhang, Ronghao Chen

专题命中 安全评测 :safety(abstract)

Comments EMNLP 2025 findings, 20 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20065 2025-09-16 physics.app-ph physics.optics 50%

Fast approximate solvers for metamaterials design in electromagnetism

Raphael Pestourie

专题命中 安全评测 :trustworthy(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏