arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9346 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9346 篇

2505.22318 2026-03-25 cs.CL cs.LG 62%

Flying Pigs, FaR and Beyond: Evaluating LLM Reasoning in Counterfactual Worlds

飞行猪、FaR及更广泛的领域:评估LLM在反事实世界中的推理能力

Anish R Joishy, Ishwar B Balappanawar, Vamshi Krishna Bonagiri, Manas Gaur, Krishnaprasad Thirunarayan, Ponnurangam Kumaraguru

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Wright State University(威斯汀豪斯州立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了LLM在反事实场景下的推理能力,提出FaR方法以增强模型的元认知,减少逻辑与知识冲突带来的性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22328 2026-03-25 cs.LG cs.AI stat.ML 62%

Beyond the Mean: Distribution-Aware Loss Functions for Bimodal Regression

超越均值:用于双模回归的分布感知损失函数

Abolfazl Mohammadi-Seif, Carlos Soares, Rita P. Ribeiro, Ricardo Baeza-Yates

机构 * INESC TEC

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种分布感知损失函数,结合归一化RMSE、Wasserstein和Cramér距离,用于解决双模回归中的预测不确定性问题,提高了模型的稳定性与鲁棒性。

Comments 28 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22305 2026-03-25 cs.LG cs.AI 62%

CN-Buzz2Portfolio: A Chinese-Market Dataset and Benchmark for LLM-Based Macro and Sector Asset Allocation from Daily Trending Financial News

CN-Buzz2Portfolio: 一个面向中国市场、基于LLM的宏观与行业资产配置基准数据集

Liyuan Chen, Shilong Li, Jiangpeng Yan, Shuoling Liu, Qiang Yang, Xiu Li

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) E Fund Management Co., Ltd.(E基金管理有限公司) Hong Kong Polytechnic University(香港理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CN-Buzz2Portfolio数据集,用于评估LLM在动态金融决策中的表现,通过模拟真实市场关注流,测试模型在宏观叙事到资产配置的转换能力,揭示不同模型在资产分配上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00004 2026-03-24 cs.IR cs.CL cs.DL cs.LG 62%

C$^2$-Cite: Contextual-Aware Citation Generation for Attributed Large Language Models

C$^2$-Cite: 基于上下文感知的引用生成方法用于带属性的大语言模型

Yue Yu, Ting Bai, HengZhi Lan, Li Qian, Li Peng, Jie Wu, Wei Liu, Jian Luan, Chuan Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出C$^2$-Cite框架,通过整合引用标记与参考内容的语义关系,提升引用生成质量与响应正确性。

Comments WSDM26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08713 2026-03-24 cs.CL cs.AI 62%

Automatic Essay Scoring and Feedback Generation in Basque Language Learning

巴斯克语言学习中的自动作文评分与反馈生成

Ekhi Azurmendi, Xabier Arregi, Oier Lopez de Lacalle

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文首次公开了针对巴斯克语C1水平的自动作文评分与反馈生成数据集,通过微调开源模型提升评分与反馈质量,验证了编码器模型的可靠性及监督微调对性能的提升。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19299 2026-03-24 cs.LG cs.AI 62%

Open-weight genome language model safeguards: Assessing robustness via adversarial fine-tuning

开放权重基因组语言模型的安全保障:通过对抗性微调评估鲁棒性

James R. M. Black, Moritz S. Hanke, Aaron Maiwald, Tina Hernandez-Boussard, Oliver M. Crook, Jaspreet Pannu

机构 * Center for Health Security(健康安全中心) Johns Hopkins Bloomberg School of Public Health(约翰霍普金斯大学布隆伯格公共卫生学院) Department of Chemistry(化学系) University of Oxford(牛津大学) Stanford University School of Medicine(斯坦福大学医学院) Department of Chemistry & Kavli Institute for Nanoscience Discovery(化学系及卡弗里纳米科学发现研究所)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究评估了开放权重基因组语言模型在对抗性微调下的鲁棒性,发现通过微调有害病毒序列可恢复模型的滥用相关能力,强调了需要安全框架以确保模型安全部署。

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Biosecurity Safeguards for Generative AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14783 2026-03-24 cs.CL cs.CY 62%

Human or LLM as Standardized Patients? A Comparative Study for Medical Education

人类或大语言模型作为标准化患者?医学教育中的比较研究

Bingquan Zhang, Xiaoxiao Liu, Yuchi Wang, Lei Zhou, Qianqian Xie, Benyou Wang

机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Freedom AI

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.CY

AI总结 本文提出EasyMED框架和SPBench基准,通过对比实验显示其在医学教育中更接近人类标准化患者行为,尤其在案例一致性与可控披露方面表现更优,且在学习效果和成本效率上具有优势。

Comments 24 pages, 13 figures, 10 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21280 2026-03-24 cs.CY cs.AI 62%

WARBENCH: A Comprehensive Benchmark for Evaluating LLMs in Military Decision-Making

WARBENCH:评估大语言模型在军事决策中的综合基准

Zongjie Li, Chaozheng Wang, Yuchong Xie, Pingchuan Ma, Shuai Wang

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Chinese University of Hong Kong(香港中文大学) Zhejiang University of Technology(浙江工业大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出WARBENCH基准,揭示现有大语言模型在军事决策中存在结构性缺陷,包括战术推理崩溃、法律违规率高、量化降维导致性能下降等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19615 2026-03-23 cs.SD cs.AI cs.CL 62%

CAF-Score: Calibrating CLAP with LALMs for Reference-free Audio Captioning Evaluation

CAF-Score: 通过LALMs校准CLAP用于无参考音频描述评估

Insung Lee, Taeyoung Jeong, Haejun Yoo, Du-Seong Chang, Myoung-Wan Koo

机构 * Department of Artificial Intelligence, Sogang University, South Korea(人工智能系,ソガン大学,韩国)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CAF-Score,一种无参考音频描述评估指标,通过结合对比音频-文本嵌入与LALM推理,有效检测语法不一致和细微幻觉,实验表明其在BRACE基准上与人类判断相关性最高。

Comments A condensed version of this work has been submitted to Interspeech 2026. Section 10 is an extended analysis added in this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15047 2026-03-23 cs.HC cs.AI cs.CY 62%

Mapping Caregiver Needs to AI Chatbot Design: Strengths and Gaps in Mental Health Support for Alzheimer's and Dementia Caregivers

将照护需求映射到AI聊天机器人设计:阿尔茨海默病和痴呆症照护者的心理健康支持优势与不足

Jiayue Melissa Shi, Dong Whi Yoo, Keran Wang, Violeta J. Rodriguez, Ravi Karkar, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 研究探讨了阿尔茨海默病和痴呆症照护者在心理健康支持中的需求与AI聊天机器人设计的匹配度,通过访谈揭示了照护者在信息获取、情感支持等方面的需求及技术的优劣势。

Journal ref ACM Transactions on Computing for Healthcare, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23571 2026-03-23 cs.RO cs.AI cs.CV cs.LG 62%

RobotArena $\infty$: Scalable Robot Benchmarking via Real-to-Sim Translation

RobotArena ∞:通过现实到模拟的翻译实现可扩展的机器人评估

Yash Jangir, Yidi Zhang, Pang-Chi Lo, Kashu Yamazaki, Chenyu Zhang, Kuan-Hsun Tu, Tsung-Wei Ke, Lei Ke, Yonatan Bisk, Katerina Fragkiadaki

机构 * Carnegie Mellon University(卡内基梅隆大学) National Taiwan University(国立台湾大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RobotArena Infinity框架,通过模拟环境与在线人类反馈,解决机器人政策评估中的劳动密集型、安全性差等问题,实现可扩展的视觉-语言-动作评估。

Comments Website: https://robotarenainf.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08570 2026-03-23 cs.CV cs.AI cs.LG 62%

Superclass-Guided Representation Disentanglement for Spurious Correlation Mitigation

面向虚假相关性缓解的超类引导的表示解耦

Chenruo Liu, Hongjun Liu, Zeyu Lai, Yiqiu Shen, Chen Zhao, Qi Lei

机构 * New York University(纽约大学) NYU Grossman School of Medicine(纽约大学 Grossman 医学院) Zhejiang University(浙江大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用超类引导解耦表示以缓解虚假相关性,通过预训练视觉-语言模型的梯度注意力对齐和理论支持的最小最大最优特征使用策略,提升模型对复杂组结构和虚假相关性的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13207 2026-03-23 cs.CR cs.AI cs.LG 62%

LISAA: A Framework for Large Language Model Information Security Awareness Assessment

LISAA:大型语言模型信息安全意识评估框架

Ofir Cohen, Gil Ari Agmon, Asaf Shabtai, Rami Puzis

机构 * Computer and Information Science Ben-Gurion University of the Negev(计算机与信息科学贝纳尔·戈里翁大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LISAA框架,用于评估大型语言模型的信息安全意识,通过100个真实场景测试其安全知识、态度和行为,揭示当前模型在信息安全方面的普遍漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09252 2026-03-20 cs.CL cs.AI cs.HC 62%

DAVIS: Planning Agent with Knowledge Graph-Powered Inner Monologue

DAVIS:基于知识图谱的规划代理

Minh Pham Dinh, Munira Syed, Michael G Yankoski, Trenton W. Ford

机构 * Davis Institute for Artificial Intelligence(戴维斯人工智能研究所) Colby College(科伯学院) University of Notre Dame(圣约翰大学) William & Mary(威廉与玛丽学院)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DAVIS,一种基于知识图谱的规划代理,通过结构化和时间记忆实现模型驱动规划,并采用多轮检索系统提升科学任务处理能力,在ScienceWorld基准测试中表现优异。

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13590 2026-03-20 cs.CL cs.AI 62%

Vulnerability of LLMs' Stated Beliefs? LLMs Belief Resistance Check Through Strategic Persuasive Conversation Interventions

LLMs所声明信念的脆弱性?通过战略性说服对话干预检查LLMs信念抵抗性

Fan Huang, Haewoon Kwak, Jisun An

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 研究通过战略性说服对话干预评估LLMs在不同领域中的信念稳定性,发现小模型易受说服影响,而自信提示反而加剧了脆弱性,揭示了模型依赖性的鲁棒性限制。

Comments Updated new models and minor revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17692 2026-03-19 cs.LG cs.AI q-fin.CP q-fin.PM 62%

Can Blindfolded LLMs Still Trade? An Anonymization-First Framework for Portfolio Optimization

盲folded LLMs仍能进行交易吗?一个以匿名化优先的资产组合优化框架

Joohyoung Jeon, Hongchul Lee

机构 * Korea University(韩国大学) Mirae Asset Securities(美亚证券)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种以匿名化为核心的资产组合优化框架,通过盲fold LLMs来验证市场信号的合法性,实验显示在2025年期间实现了1.40的夏普比率,并通过负控实验验证信号的有效性。

Comments Accepted at the ICLR 2026 Workshop on Advances in Financial AI (FinAI). 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24384 2026-03-19 cs.CL cs.AI 62%

HarmMetric Eval: Benchmarking Metrics and Judges for LLM Harmfulness Assessment

HarmMetric Eval: 对LLM有害性评估的度量和裁判进行基准测试

Langqi Yang, Tianhang Zheng, Yixuan Chen, Kedong Xiu, Hao Zhou, Wangze Ni, Lei Chen, Zhan Qin, Kui Ren

机构 * The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Zhejiang University(浙江大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院) Pretraining Team, xAI(预训练团队,xAI) Hong Kong University of Science and Technology (GuangZhou)(香港科技大学(广州))

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出HarmMetric Eval,用于评估有害性度量和裁判的质量,发现传统参考型指标在细粒度评估中表现优于LLM裁判,改进的裁判通过结合细粒度标准和参考型指标提升了效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17385 2026-03-19 cs.LG cs.AI cs.CV 62%

Den-TP: A Density-Balanced Data Curation and Evaluation Framework for Trajectory Prediction

Den-TP:一种基于密度平衡的数据整理与评估框架用于轨迹预测

Ruining Yang, Yi Xu, Yun Fu, Lili Su

机构 * Northeastern University, USA(东北大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Den-TP框架,通过密度感知的数据整理和评估方法,平衡轨迹预测数据集的密度分布,提升模型鲁棒性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15797 2026-03-19 cs.LG cs.AI 62%

OMNIFLOW: A Physics-Grounded Multimodal Agent for Generalized Scientific Reasoning

OMNIFLOW:一种基于物理的多模态代理用于通用科学推理

Hao Wu, Yongheng Zhang, Yuan Gao, Fan Xu, Fan Zhang, Ruobing Xie, Ruijian Gou, Yuxuan Liang, Xiaomeng Huang, Xian Wu

机构 * Tsinghua University(清华大学) Tencent(腾讯) Shenzhen Loop Area Institute(深圳河套学院) Ocean University of China(海洋大学) HKUST (Guangzhou)(香港科技大学(广州))

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 OMNIFLOW通过引入语义-符号对齐机制和物理引导的推理流程,实现了多模态模型在物理定律下的科学推理,显著提升了零样本泛化和少样本适应能力,提供透明且物理一致的推理报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16260 2026-03-18 cs.CY cs.AI cs.HC 62%

Human/AI Collective Intelligence for Deliberative Democracy: A Human-Centred Design Approach

人类/人工智能集体智能用于审议民主:一种以人类为中心的设计方法

Anna De Liddo, Lucas Anastasiou, Simon Buckingham Shum

机构 * Knowledge Media Institute, The Open University(知识媒体研究所,开放大学) Connected Intelligence Centre, University of Technology Sydney(连接智能中心,技术悉尼大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 本文提出利用人工智能增强审议民主的集体智能概念,探讨以人类为中心的设计方法,通过协作设计方法识别挑战、细化用户场景并推导技术影响,展示AI支持下公民组织需求的实现案例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15950 2026-03-18 cs.CL cs.CY cs.SI 62%

POLAR:A Per-User Association Test in Embedding Space

POLAR:嵌入空间中的用户级关联测试

Pedro Bento, Arthur Buzelin, Arthur Chagas, Yan Aquino, Victoria Estanislau, Samira Malaquias, Pedro Robles Dutenhefner, Gisele L. Pappa, Virgilio Almeida, Wagner MeiraJr

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 POLAR在嵌入空间中进行用户级词汇关联测试,通过定制化的词汇轴评估作者差异,区分LLM驱动的机器人与真实账号,并揭示极端论坛中词汇偏移趋势。

Comments Accepted paper at ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15897 2026-03-18 cs.CL cs.AI 62%

COGNAC at SemEval-2026 Task 5: LLM Ensembles for Human-Level Word Sense Plausibility Rating in Challenging Narratives

COGNAC在SemEval-2026任务5中的应用:用于挑战性叙事中人类水平词义可信度评估的LLM集成

Azwad Anjum Islam, Tisa Islam Erana

机构 * Florida International University Knight Foundation School of Computing and Information Sciences(佛罗里达国际大学骑士基金会计算与信息科学学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出使用多个闭源商业LLM的集成方法,通过三种提示策略提升短篇故事中多义词词义可信度评估的准确性,最终在比赛中获得第四名。

Comments System description paper in SemEval-2026, Task 5

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22223 2026-03-18 cs.LG cs.AI cs.CR cs.NI 62%

ReGAIN: Retrieval-Grounded AI Framework for Network Traffic Analysis

ReGAIN:基于检索的网络流量分析人工智能框架

Shaghayegh Shajarian, Kennedy Marsh, James Benson, Sajad Khorsandroo, Mahmoud Abdelsalam

机构 * Computer Science(计算机科学) North Carolina A\&T State University(北卡罗来纳A&T州立大学) Institute for Cyber Security(网络安全研究所) University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 ReGAIN结合流量摘要、检索增强生成和大语言模型推理,实现透明准确的网络流量分析,通过多阶段框架提升安全性和性能,验证结果显示其在不同攻击类型中准确率高达95.95%-98.82%。

Comments Accepted to ICNC 2026. This is the accepted author manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12832 2026-03-18 cs.CL cs.AI 62%

From Passive to Persuasive: Localized Activation Injection for Empathy and Negotiation

从被动到说服:局部激活注入用于共情与谈判

Niranjan Chebrolu, Kokil Jaidka, Gerard Christopher Yeo

机构 * Centre for Trusted Internet and Community(可信互联网与社区中心) Department of Communications and New Media(通讯与新媒体系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出STAR方法,通过局部激活注入提升共情和谈判能力,实验证明其优于全局激活和指令预训练,表明复杂人际行为在LLM激活空间中以局部线性方向编码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23135 2026-03-18 cs.LG cs.AI cs.LO cs.PL cs.SE 62%

VERINA: Benchmarking Verifiable Code Generation

VERINA:可验证代码生成基准测试

Zhe Ye, Zhengxu Yan, Jingxuan He, Timothe Kasriel, Kaiyu Yang, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) Meta FAIR

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VERINA基准测试,用于全面评估代码、规范及证明生成能力,揭示LLM在可验证代码生成中的挑战,特别是证明生成的困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15713 2026-03-18 cs.LG cs.AI cs.IR 62%

Embedding-Aware Feature Discovery: Bridging Latent Representations and Interpretable Features in Event Sequences

嵌入感知特征发现:连接潜在表示与可解释特征在事件序列中

Artem Sakhno, Ivan Sergeev, Alexey Shestov, Omar Zoloev, Elizaveta Kovtun, Gleb Gusev, Andrey Savchenko, Maksim Makarenko

机构 * Sber AI Lab(Sber AI实验室) ISP RAS Research Center for Trusted AI(俄罗斯科学院信息与系统研究所可信人工智能研究中心)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出EAFD框架,通过结合预训练事件序列嵌入与自反思LLM驱动特征生成代理,解决嵌入与特征管道间的断层问题,实现特征的发现、评估与优化,提升事件序列处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15634 2026-03-18 cs.AI cs.IR cs.LG 62%

NextMem: Towards Latent Factual Memory for LLM-based Agents

NextMem: 向基于大语言模型的智能体构建潜在事实记忆

Zeyu Zhang, Rui Li, Xiaoyan Zhao, Yang Zhang, Wenjie Wang, Xu Chen, Tat-Seng Chua

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 NextMem提出一种基于自回归自编码器的潜在事实记忆框架,通过两阶段训练和量化技术提升记忆构建效率与准确性,在检索、鲁棒性和扩展性方面表现优异。

Comments 17 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15615 2026-03-17 cs.CL cs.AI 62%

Mechanistic Origin of Moral Indifference in Language Models

语言模型中道德冷漠的机制起源

Lingyu Li, Yan Teng, Yingchun Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示语言模型存在内在道德冷漠,通过构建道德向量并重构其拓扑关系,提升道德推理能力,实现75%的对抗性基准测试胜率。

Comments 24 pages, 11 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15221 2026-03-17 cs.LG cs.AI 62%

ADV-0: Closed-Loop Min-Max Adversarial Training for Long-Tail Robustness in Autonomous Driving

ADV-0:面向自动驾驶的闭环极小-极大对抗训练以提升长尾鲁棒性

Tong Nie, Yihong Tang, Junlin He, Yuewen Mei, Jie Sun, Lijun Sun, Wei Ma, Jian Sun

机构 * The Hong Kong Polytechnic University, Hong Kong SAR, China(香港理工大学) Tongji University, Shanghai, China(同济大学) McGill University, Montreal, QC, Canada(麦吉尔大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ADV-0框架,通过闭环极小-极大优化,将驾驶策略与对抗 agent 的交互视为零和马尔可夫博弈,提升自动驾驶对长尾场景的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14947 2026-03-17 cs.LG cs.AI 62%

FairMed-XGB: A Bayesian-Optimised Multi-Metric Framework with Explainability for Demographic Equity in Critical Healthcare Data

FairMed-XGB: 一种具有可解释性的多指标框架,用于关键医疗数据中的公平性

Mitul Goswami, Romit Chatterjee, Arif Ahmed Sekh

机构 * School of Computer Engineering, Kalinga Institute of Industrial Technology(计算机工程学院,卡林加工业技术学院) Bio-AI Lab, UiT The Arctic University of Norway(生物-人工智能实验室,北欧大学(UiT))

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FairMed-XGB框架,通过整合统计平衡差、Theil指数和Wasserstein距离的公平性感知损失函数,结合贝叶斯搜索优化XGBoost分类器,有效减少性别偏差并保持模型性能和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏