arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9346 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9346 篇

2506.06955 2026-03-17 cs.CL cs.AI 62%

BIS Reasoning 1.0: The First Large-Scale Japanese Benchmark for Belief-Inconsistent Syllogistic Reasoning

BIS推理1.0:首个大规模日语信念不一致三段论基准数据集

Ha-Thanh Nguyen, Hideyuki Tachibana, Chaoran Liu, Qianying Liu, Su Myat Noe, Koichi Takeda, Sadao Kurohashi

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出BIS推理1.0,首个针对大语言模型信念不一致推理评估的日语三段论数据集,通过系统引入逻辑有效但信念不一致的三段论,揭示信念偏差问题,并评估多种模型在零样本下的表现。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14586 2026-03-17 cs.HC cs.AI cs.CY 62%

The Scenic Route to Deception: Dark Patterns and Explainability Pitfalls in Conversational Navigation

通往欺骗的风景路线:对话导航中的暗模式与可解释性陷阱

Ilya Ilyankou, Stefano Cavazzi, James Haworth

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 研究探讨了生成式AI在行人导航中的应用,揭示了对话接口可能带来的操纵风险,并提出神经符号架构作为提升可信任度的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14170 2026-03-17 cs.IR cs.AI cs.CL 62%

Citation-Enforced RAG for Fiscal Document Intelligence: Cited, Explainable Knowledge Retrieval in Tax Compliance

引用强化的财政文档智能:在税务合规中的引用、可解释知识检索

Akhil Chandra Shanivendra

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种引用强化的RAG框架,用于财政文档智能,强调可解释性和可审计性,通过源优先的摄入策略和引用强制机制提升税务合规中的引用准确性与解释性。

Comments 22 pages, 3 figures. Applied AI systems paper focused on citation-enforced RAG and abstention for fiscal document intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08309 2026-03-17 cs.CV cs.AI cs.LG 62%

Concept-Guided Fine-Tuning: Steering ViTs away from Spurious Correlations to Improve Robustness

基于概念引导的微调:引导ViT远离虚假相关性以提高鲁棒性

Yehonatan Elisha, Oren Barkan, Noam Koenigstein

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种引导模型推理至概念层面语义的微调框架,通过优化内部相关性映射对齐空间 grounded 的概念掩码,提升模型在分布偏移下的鲁棒性。

Comments CVPR 2026 ; Project page: https://yonisgit.github.io/concept-ft/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00823 2026-03-17 cs.CL cs.AI 62%

A Comprehensive Evaluation of LLM Unlearning Robustness under Multi-Turn Interaction

大语言模型多轮交互下LLM去学习鲁棒性综合评估

Ruihao Pan, Suhang Wang

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文研究多轮交互环境下LLM去学习的稳定性,发现静态评估可能高估实际效果,强调需确保交互场景下的稳定遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13691 2026-03-17 cs.CL cs.AI 62%

QuarkMedBench: A Real-World Scenario Driven Benchmark for Evaluating Large Language Models

QuarkMedBench: 一个基于现实场景的基准测试,用于评估大型语言模型

Yao Wu, Kangping Yin, Liang Dong, Zhenxin Ma, Shuting Xu, Xuehai Wang, Yuxuan Jiang, Tingting Yu, Yunqing Hong, Jiayi Liu, Rianzhe Huang, Shuxin Zhao, Haiping Hu, Wen Shang, Jian Xu, Guanjun Jiang

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 QuarkMedBench通过构建大规模医疗数据集和自动评分框架,评估LLM在真实医疗查询中的表现,揭示传统考试指标的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13563 2026-03-17 cs.LG cs.AI 62%

MR-GNF: Multi-Resolution Graph Neural Forecasting on Ellipsoidal Meshes for Efficient Regional Weather Prediction

MR-GNF:基于椭球网格的多分辨率图神经预测用于高效区域天气预测

Andrii Shchur, Inna Skarga-Bandurova

机构 * Kyiv School of Economics(基輔經濟學院) Oxford Brookes University(氧化橋學院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 MR-GNF通过多尺度图神经网络实现高效区域天气预测,利用椭球网格结构在1.6M参数内捕捉三维结构,提供稳定6至24小时预报,成本低于传统数值天气预报。

Comments Accepted to the AAAI2026 workshop on AI for Environmental Science (AAAI2026 AI4ES). Discussion version available on OpenReview. Code available at https://github.com/AndriiShchur/MR-GNF

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03231 2026-03-17 cs.NI cs.AI cs.LG 62%

NetArena: Dynamic Benchmarks for AI Agents in Network Automation

NetArena:网络自动化中AI代理的动态基准测试

Yajie Zhou, Jiajun Ruan, Eric S. Wang, Sadjad Fouladi, Francis Y. Yan, Kevin Hsieh, Zaoxing Liu

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 NetArena通过动态生成基准测试框架提升网络自动化中AI代理的可靠性,减少置信区间重叠,揭示更细致的行为特征,并支持SFT和RL微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13168 2026-03-16 cs.AI cs.CL cs.IR 62%

Developing and evaluating a chatbot to support maternal health care

开发和评估一个支持产科保健的聊天机器人

Smriti Jha, Vidhi Jain, Jianyu Xu, Grace Liu, Sowmya Ramesh, Jitender Nagpal, Gretchen Chapman, Benjamin Bellows, Siddhartha Goyal, Aarti Singh, Bryan Wilder

机构 * Carnegie Mellon University(卡内基梅隆大学) Population Council Institute(人口理事会研究所) Sitaram Bhartia Institute of Science and Research(西塔拉姆·巴提亚科学与研究研究所) Nivi, Inc.(Nivi公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文开发了一个印度产科保健聊天机器人,结合分阶段分诊、混合检索和证据引导生成,通过多方法评估验证了多语言噪声环境下医疗助手的可靠性。

Comments 17 pages; submitted to IJCAI 2026 AI and Social Good Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06862 2026-03-16 cs.CR cs.AI cs.CL 62%

Supporting Artifact Evaluation with LLMs: A Study with Published Security Research Papers

通过大语言模型支持人工验证:一篇发表的安全研究论文研究

David Heye, Karl Kindermann, Robin Decker, Johannes Lohmöller, Anastasiia Belova, Sandra Geisler, Klaus Wehrle, Jan Pennekamp

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文研究利用大语言模型提升人工验证效率,通过文本复现评分、自动沙箱环境准备和方法缺陷评估,提高复现准确率和执行环境设置率,推动安全领域研究的可持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05880 2026-03-16 cs.CL cs.AI 62%

Large language models show fragile cognitive reasoning about human emotions

大型语言模型在人类情感认知推理中的脆弱性

Sree Bhattacharyya, Evgenii Kuriabov, Lucas Craig, Tharun Dilliraj, Reginald B. Adams,, Jia Li, James Z. Wang

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨大型语言模型是否能通过认知维度而非标签进行情感推理,提出CoRE基准测试,发现模型在情感认知结构上有系统性关系,但与人类判断存在偏差且在不同上下文中不稳定。

Comments Under Review, a version was presented at WiML Workshop @ NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17188 2026-03-16 cs.CL cs.AI cs.IR 62%

Towards AI Search Paradigm

迈向人工智能搜索范式

Yuchen Li, Hengyi Cai, Rui Kong, Xinran Chen, Jiamin Chen, Jun Yang, Haojie Zhang, Jiayi Li, Jiayi Wu, Yiqun Chen, Changle Qu, Wenwen Ye, Lixin Su, Xinyu Ma, Lingyong Yan, Long Xia, Daiting Shi, Junfeng Wang, Xiangyu Zhao, Jiashu Zhao, Haoyi Xiong, Shuaiqiang Wang, Dawei Yin

机构 * Baidu Search(百度搜索)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出AI搜索范式,通过四个LLM驱动代理动态适应各类信息需求,结合任务规划、工具集成和高效推理方法,构建可信赖、适应性强的下一代搜索系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12349 2026-03-16 cs.LG cs.AI q-bio.QM stat.ML 62%

Budget-Sensitive Discovery Scoring: A Formally Verified Framework for Evaluating AI-Guided Scientific Selection

预算敏感的发现评分:一种用于评估AI引导的科学选择的正式验证框架

Abhinaba Basu, Pavan Chakraborty

机构 * Indian Institute of Information Technology Allahabad (IIITA)(印度阿瓦德理工学院信息学院(IIITA)) National Institute of Electronics & Information Technology (NIELIT)(国家电子与信息科技研究所(NIELIT))

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出BSDS评分,通过正式验证方法评估AI引导的科学选择策略,证明LLMs在药物发现中无额外价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03633 2026-03-16 cs.CV cs.AI cs.LG 62%

From Video to EEG: Adapting Joint Embedding Predictive Architecture to Uncover Saptiotemporal Dynamics in Brain Signal Analysis

从视频到EEG:适应联合嵌入预测架构以揭示脑信号分析中的空间时间动态

Amirabbas Hojjati, Lu Li, Ibrahim Hameed, Anis Yazidi, Pedro G. Lind, Rabindra Khadka

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出EEG-VJEPA,通过将EEG视为视频序列,利用联合嵌入和自适应掩码学习空间时间表示,提升分类准确率并提供可解释的嵌入,适用于实际临床场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18675 2026-03-13 cs.CV cs.AI cs.CL 62%

ReasonMap: Towards Fine-Grained Visual Reasoning from Transit Maps

ReasonMap:迈向基于交通地图的细粒度视觉推理

Sicheng Feng, Song Wang, Shuyi Ouyang, Lingdong Kong, Zikai Song, Jianke Zhu, Huan Wang, Xinchao Wang

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 ReasonMap是一个针对交通地图的细粒度视觉推理基准,通过评估16种MLLMs揭示开源与闭源模型在推理性能上的差异,并强调视觉支撑对高性能的重要性。

Comments CVPR 2026, website: https://fscdc.github.io/ReasonMap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11342 2026-03-13 cs.CL cs.AI 62%

Evaluating Explainable AI Attribution Methods in Neural Machine Translation via Attention-Guided Knowledge Distillation

通过注意力引导的知识蒸馏评估神经机器翻译中的可解释AI归因方法

Aria Nourbakhsh, Salima Lamsiyah, Adelaide Danilov, Christoph Schommer

机构 * Department of Computer Science, University of Luxembourg(卢森堡大学计算机科学系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文通过注意力引导的知识蒸馏评估神经机器翻译中的可解释AI归因方法,发现注意力、值零化和层梯度×激活方法在BLEU指标上表现最佳,而其他梯度方法效果较弱。

Comments 37 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11142 2026-03-13 cs.LG cs.AI cs.CV 62%

Attention Gathers, MLPs Compose: A Causal Analysis of an Action-Outcome Circuit in VideoViT

注意力汇聚,MLP组成:视频ViT中一个动作-结果回路的因果分析

Sai V R Chereddy

机构 * Sai V R Chereddy

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文通过因果分析揭示视频ViT中动作-结果回路的机理,发现注意力头负责收集证据,MLP块负责生成成功信号,展示了模型处理人类动作结果的核心计算模式。

Comments Accepted at the AAAI 2026 Workshop on Deployable AI (DAI). Non-archival. Code and custom dataset available upon request

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20900 2026-03-13 cs.SD cs.CL cs.LG eess.AS 62%

Text-only adaptation in LLM-based ASR through text denoising

基于文本去噪的LLM语音识别领域适应

Andrés Carofilis, Sergio Burdisso, Esaú Villatoro-Tello, Shashi Kumar, Kadri Hacioglu, Srikanth Madikeri, Pradeep Rangappa, Manjunath K E, Petr Motlicek, Shankar Venkatesan, Andreas Stolcke

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过文本去噪方法实现LLM语音识别领域适应,有效保持跨模态对齐并提升性能,实测在两个数据集上达到22.1%的相对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10745 2026-03-13 cs.AI cs.CV cs.LG cs.MA cs.MM 62%

Agentic Design Review System

代理设计评审系统

Sayan Nag, K J Joseph, Koustava Goswami, Vlad I Morariu, Balaji Vasan Srinivasan

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AgenticDRS系统,通过多个代理协作分析设计,结合图匹配和提示扩展方法,实现高效的设计评估与反馈生成。

Comments Project Page: https://sayannag.github.io/AgenticDRS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10303 2026-03-12 cs.CL cs.AI 62%

Is this Idea Novel? An Automated Benchmark for Judgment of Research Ideas

这个想法是否新颖?一种自动化的判断研究想法新颖性的基准

Tim Schopf, Michael Färber

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RINoBench基准,用于评估研究想法新颖性判断,发现LLM生成的推理与人类相似但判断不准确。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05941 2026-03-12 cs.LG cs.AI 62%

Comparative Analysis of Modern Machine Learning Models for Retail Sales Forecasting

现代机器学习模型在零售销售预测中的比较分析

Luka Hobor, Mario Brcic, Lidija Polutnik, Ante Kapetanovic

机构 * Faculty of Electrical Engineering and Computing, University of Zagreb(Zagreb大学电气工程与计算学院) It From Bit d.o.o.(It From Bit公司) Babson College(巴布森学院) mStart Plus d.o.o.(mStart Plus公司)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文比较了现代机器学习模型在零售销售预测中的表现,发现基于树的集成方法在特定条件下表现更优。

Comments 12 total pages, 12 pages article

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09691 2026-03-11 cs.CL cs.AI 62%

ESAinsTOD: A Unified End-to-End Schema-Aware Instruction-Tuning Framework for Task-Oriented Dialog Modeling

ESAinsTOD: 一种统一的端到端模式感知指令微调框架用于任务导向对话建模

Dechuan Teng, Chunlin Lu, Libo Qin, Wanxiang Che

机构 * Research Center for Social Computing and Information Retrieval, Harbin Institute of Technology(社会科学与信息检索研究中心,哈尔滨工业大学) School of Computer Science and Engineering, Central South University(计算机科学与工程学院,中南大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 ESAinsTOD提出一种统一的端到端模式感知指令微调框架,提升任务导向对话建模的性能与泛化能力。

Comments Published at International Journal of Machine Learning and Cybernetics (IJMLC)

Journal ref Int. J. Mach. Learn. & Cyber. 17, 127 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06758 2026-03-11 cs.LG cs.AI 62%

Enhancing SHAP Explainability for Diagnostic and Prognostic ML Models in Alzheimer Disease

增强阿尔茨海默病诊断和预后ML模型的SHAP可解释性

Pablo Guillén, Enrique Frias-Martinez

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出多级框架提升AD诊断预后模型SHAP解释的稳健性和一致性,通过整合相干性、稳定性与跨任务一致性验证解释的可靠性。

Journal ref CMC 1546-2226 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08736 2026-03-11 cs.DC cs.AI cs.LG cs.SY eess.SY 62%

Autonomous Edge-Deployed AI Agents for Electric Vehicle Charging Infrastructure Management

自主边缘部署AI代理用于电动汽车充电基础设施管理

Mohammed Cherifi

机构 * Hyperion Consulting(超离子咨询)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Auralink SDC架构,通过边缘部署的专用AI代理实现电动汽车充电基础设施的自主管理,实现高准确率的事故修复与快速响应。

Comments 27 pages, 10 figures (TikZ), 27 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08578 2026-03-10 cs.LG cs.CL 62%

Drift-to-Action Controllers: Budgeted Interventions with Online Risk Certificates

漂移到行动控制器:具有在线风险证书的预算干预

Ismail Lamaakal, Chaymae Yahyati, Khalid El Makkaoui, Ibrahim Ouahbi, Yassine Maleh

机构 * Multidisciplinary Faculty of Nador(多学科纳多 faculty) Mohammed First University(穆罕默德第一大学) Laboratory LaSTI(LaSTI 实验室) Sultan Moulay Slimane University(苏丹·穆莱·斯利曼大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG

AI总结 Drift2Act通过在线风险证书实现预算干预,有效应对分布漂移,减少安全违规并提高恢复速度。

Comments Published as a conference paper at CAO Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08429 2026-03-10 cs.CL cs.AI cs.IR 62%

One Model Is Enough: Native Retrieval Embeddings from LLM Agent Hidden States

一个模型就足够:从LLM代理隐藏状态中获取原生检索嵌入

Bo Jiang

机构 * Temple University(特拉华大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过轻量级投影头使LLM代理具备原生检索能力,无需额外嵌入模型,保留97%检索质量并在QReCC基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06604 2026-03-10 cs.LG cs.CL 62%

Know When You're Wrong: Aligning Confidence with Correctness for LLM Error Detection

知何时错误:将置信度与正确性对齐以用于LLM错误检测

Xie Xiaohu, Liu Xiaohu, Yao Benjamin

机构 * Alexa AI, Amazon, Seattle, WA, USA(Alexa AI,亚马逊,西雅图,华盛顿州)

专题命中 安全评测 :DPO(abstract);分类 cs.CL、cs.LG

AI总结 本文提出归一化置信度分数和自我评估框架,通过SFT提升LLM置信度可靠性,减少校准误差,提升错误检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06583 2026-03-10 cs.HC cs.CY cs.LG 62%

XInsight: Integrative Stage-Consistent Psychological Counseling Support Agents for Digital Well-Being

XInsight:集成化阶段一致的心理咨询支持代理用于数字福祉

Fei Wang, Jiangnan Yang, Junjie Chen, Yuxin Liu, Kun Li, Yanyan Wei, Dan Guo, Meng Wang

机构 * Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) Anhui University(安徽大学) United Arab Emirates University(阿联酋大学) Intelligent Interconnected Systems Laboratory of Anhui Province (HFUT)(安徽省智能互联系统实验室(HFUT))

专题命中 安全评测 :alignment(abstract);分类 cs.CY、cs.LG

AI总结 XInsight是一种集成化多代理框架,通过阶段一致的工作流程和统一循环,提升网络应用中数字福祉的心理支持效果。

Comments Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15735 2026-03-09 cs.AI cs.LG stat.ML 62%

ContextBench: Modifying Contexts for Targeted Latent Activation

ContextBench: 为定向激活潜在特征修改上下文

Robert Graham, Edward Stevinson, Leo Richter, Alexander Chia, Joseph Miller, Joseph Isaac Bloom

机构 * Imperial College London(帝国理工学院伦敦校区) University College London(伦敦大学学院) University of Oxford(牛津大学) UK AI Security Institute(英国人工智能安全研究所)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 ContextBench通过上下文修改方法提升语言模型触发特定潜在特征的能力,结合LLM辅助和扩散模型实现最佳平衡效果。

Comments Published at ICLR 2026

Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04413 2026-03-09 cs.CL cs.AI 62%

Simulating Meaning, Nevermore! Introducing ICR: A Semiotic-Hermeneutic Metric for Evaluating Meaning in LLM Text Summaries

模拟意义,永不再来!引入ICR:一种用于评估LLM文本摘要中意义的象征-解释学度量标准

Natalie Perez, Sreyoshi Bhaduri, Aman Chadha

机构 * University of Hawai‘i(夏威夷大学) Private Corporation(私营公司) Amazon GenAI(亚马逊生成人工智能)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ICR度量标准,用于评估LLM生成文本摘要中的意义,通过归纳内容分析和反思主题分析,超越词法相似性度量,评估语义准确性和意义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏