arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9380 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9380 篇

2606.23487 2026-08-21 cs.AI 版本更新 70%

CADRE: Stable, Parameter Efficient Adaptation of Medical Vision Language Models with Bounded Forgetting and Prior Drift

CADRE:具有有界遗忘和先验漂移的稳定、参数高效的医学视觉语言模型适应

Rishabh Jha, Amrita Singh, Prashanna Chudal

机构 * Mindriser's Consortium, Kathmandu, Nepal(Mindriser's 联盟,加德满都,尼泊尔) University of Victoria, BC, Canada(维多利亚大学,不列颠哥伦比亚省,加拿大)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 提出CADRE框架,通过结合低秩适应与弹性权重巩固及先验锚定惩罚,在仅训练0.23%参数下实现医学视觉语言模型的高精度、低遗忘和正向反向迁移,遗忘率降低约七倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13235 2026-08-14 cs.HC cs.AI cs.CL cs.CY cs.LG cs.SI 70%

RubRIX: Rubric-Driven Risk Mitigation in Caregiver-AI Interactions

RubRIX:基于评分标准的风险缓解在护理人员-AI交互中

Drishti Goel, Jeongah Lee, Qiuyue Joy Zhong, Violeta J. Rodriguez, Daniel S. Brown, Ravi Karkar, Dong Whi Yoo, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) OSF HealthCare(OSF医疗集团) Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 RubRIX提出了一种基于评分标准的框架,用于评估护理人员-AI交互中的风险,通过实证方法减少LLM响应的风险组件,为高负担情境下的AI支持系统提供评估方法。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09900 2026-08-13 cs.CL 版本更新 70%

Decoding-Level Taboo: A Diagnostic Stress Test for LLM Robustness

解码层面禁忌:大语言模型鲁棒性的诊断压力测试

Tadanobu Chuyo Kamijo, Ori Rottenstreich, Javier Conde, Gonzalo Martínez, Pedro Reviriego

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出Decoding-Level Taboo这一零提示诊断压力测试,通过干预logit空间迫使大语言模型偏离标称路径,评估发现其鲁棒性与参数规模、指令对齐正相关,该测试还可用于生成合成数据集等场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14267 2026-08-13 cs.AI cond-mat.mtrl-sci 版本更新 70%

DREAMS: Density Functional Theory Based Research Engine for Agentic Materials Simulation

DREAMS:基于密度泛函理论的智能体材料模拟研究引擎

Ziqi Wang, Hongshuo Huang, Hancheng Zhao, Changwen Xu, Shang Zhu, Jan Janssen, Venkatasubramanian Viswanathan

机构 * Department of Mechanical Engineering, University of Michigan, Ann Arbor, Michigan, USA(机械工程系,密歇根大学,安阿伯,密歇根州,美国) Max-Planck-Institute for Sustainable Materials, Materials Informatics, Düsseldorf, Germany(可持续材料研究所,材料信息学,杜塞尔多夫,德国) Mechanical Engineering, University of Michigan, Ann Arbor, Michigan, USA(机械工程,密歇根大学,安阿伯,密歇根州,美国)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出基于DFT的分层多智能体框架DREAMS,通过多层安全防护提升LLM智能体材料模拟的可信度,在Sol27LC基准等任务中表现优异,可平衡可信度与成本,推动自主材料模拟发展。

Comments 47 pages, 44 pages of Supporting Information

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08942 2026-08-11 cs.CL 新提交 70%

Same Question, Different Answer? Measuring and Mitigating Prompt Privilege for Equitable AI Access

相同问题,不同答案?衡量与缓解提示特权以实现公平的AI访问

Lier Jin, Lan Hu, Binqi Shen, Hanyu Cai, Yuting Xin

专题命中 安全评测 :prompt injection(abstract);trustworthy(abstract);分类 cs.CL

AI总结 该研究提出统一框架,引入PES指标与PET智能体,在MedQA基准上验证了提示特权的存在,PET可消除该差异,提升AI访问公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16481 2026-08-11 cs.LG 版本更新 70%

Benchmarking the Robustness of Agentic Systems to Adversarially-Induced Harms

评估智能体系统对抗恶意诱导危害的鲁棒性

Jonathan Nöther, Adish Singla, Goran Radanovic

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 安全评测 :safety(abstract);prompt injection(abstract);分类 cs.LG

AI总结 该研究提出智能体系统危害分类法与BAD-ACTS基准,评估LLM类智能体对抗恶意诱导的鲁棒性,发现其攻击成功率达40%-90%,并提出零样本消息监控防御方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06865 2026-08-10 cs.CV cs.AI cs.MA 新提交 70%

Multi-Agent Forensic Reasoning for Generalizable Deepfake Video Detection

用于可泛化深度伪造视频检测的多智能体取证推理

Xuechao Zou, Shun Zhang, Kai Li, Yi Zhou, Xinyu Sun, Yuhui Chen, Zhe Wu, Congyan Lang, Junliang Xing

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 针对深度伪造检测的现有方法泛化性不足问题,本文构建含10万视频的FaceVid-Forensics-100K数据集,提出多智能体取证推理框架,在域外测试集上性能优于GPT、Gemini等模型。

Comments 22 pages, 8 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06312 2026-08-07 cs.CL 新提交 70%

Benchmarking and Enhancing LLMs for Rule-Intensive Review of National Standard Documents

面向规则密集型国家标准文档评审的大语言模型基准测试与增强

Tao Wang, Qihao Yang, Rongjiao Liang, Lianghong Lin, Haitao Wang, Xinyu Cao, Tianyong Hao

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL

AI总结 该研究针对规则密集型国家标准文档评审推出首个基准GB/T-Bench,提出多智能体框架GB/T-Reviewer,实验显示其大幅缩小了LLM与专家在该任务上的能力差距,为高风险文档领域可信AI奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04347 2026-08-06 cs.LG 新提交 70%

Looking in the Mirror: Introspecting Side-Effect Misalignments Induced by Fine-Tuning

镜像审视:微调引发的副作用对齐偏差内省

Kotaro Yoshida, Laura Gomezjurado Gonzalez, Yukinori Yamamoto, Yuji Naraki, Ryotaro Shimizu, Wenya Wang

机构 * Institute of Science Tokyo(东京科学大学) ZOZO Research(ZOZO研究所) Stanford University(斯坦福大学) Waseda University(早稻田大学) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 该研究针对微调引发的副作用对齐偏差问题,提出了Delta感知内省适配器(DAIA),构建了对应数据集,实验显示DAIA性能优于现有内省适配器且泛化性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03562 2026-08-05 cs.LG 新提交 70%

Robust General Utility for Reinforcement Learning

面向强化学习的鲁棒通用效用方法

Zixuan Liu, Fangzheng Wu, Brian Summa, Zizhan Zheng

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 针对通用效用强化学习的部署效用误指定问题,提出极小极大学习框架及两种收敛随机算法,经LLM安全对齐等实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08262 2026-08-04 cs.AI 版本更新 70%

FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use

FinToolBench:评估LLM代理在真实金融工具使用中的表现

Jiaxuan Lu, Kong Wang, Yemin Wang, Qingmei Tang, Hongwei Zeng, Xiang Chen, Jiahao Pi, Shujian Deng, Lingzhi Chen, Yi Fu, Kehua Yang, Xiao Sun

机构 * Shanghai AI Laboratory(上海人工智能实验室) Hunan University(湖南大学) Xiamen University(厦门大学) Tencent(腾讯) UCAS(中国科学技术大学) Tongji University(同济大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 FinToolBench是首个评估金融工具学习代理真实世界表现的基准,通过760个可执行金融工具和295个严格查询,评估时效性、意图类型和合规性等关键维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29405 2026-08-03 cs.AI cs.MA cs.SE 新提交 70%

Beyond Component Testing: Validating Agentic AI Systems

超越组件测试:验证智能体AI系统

Fabio Orazio Mirto, Luca D'Agati, Giuseppe Tricomi, Stefano Silvestri, Francesco Longo, Antonio Puliafito, Giovanni Merlino

机构 * University of Messina(墨西拿大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 该综述综合257篇相关文献,构建五维分类法分析智能体AI系统验证问题,指出现有方法的缺口,提出面向生命周期的研究议程,主张需在上下文中验证智能体轨迹以实现可信部署。

Comments 61 pages, 3 figures, to be submitted to Springer Artificial Intelligence Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28226 2026-07-31 cs.CR cs.AI 新提交 70%

Security of World-Model-Based Embodied AI: A Lifecycle of Threats, Defenses, and Evaluation

基于世界模型的具身智能安全性:威胁、防御与评估的生命周期

Fazhong Liu, Zhuoyan Chen, Haozhen Tan, Yan Meng, Guoxing Chen, Haojin Zhu

专题命中 安全评测 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 本综述针对基于世界模型的具身智能,梳理其生命周期内的各类安全威胁,提出分类法与评估协议,并从多维度构建防御体系,同时指出世界模型兼具安全护盾与安全错觉的双重属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27499 2026-07-31 cs.AI 新提交 70%

A dataset of rated conceptual arguments

已标注评分的概念论证数据集

Emery Cooper, Caspar Oesterheld, Linh Chi Nguyen, Alexander Kastner, Ethan Perez

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 该研究构建了含多维度专家评分的概念论证数据集,提出两种评分函数并基准测试多模型,发现模型性能与通用能力排名相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10913 2026-07-31 cs.CL 版本更新 70%

LLM2Vec-Gen: Generative Embeddings from Large Language Models

LLM2Vec-Gen:从大型语言模型生成嵌入向量

Parishad BehnamGhader, Vaibhav Adlakha, Fabian David Schmidt, Nicolas Chapados, Marius Mosbach, Siva Reddy

机构 * McGill University(麦吉尔大学) Mila–Quebec AI Institute(米拉-魁北克人工智能研究所) ServiceNow Research(ServiceNow研究院) Cohere Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 LLM2Vec-Gen通过自监督学习生成大型语言模型的嵌入向量,无需微调,提升MTEB基准测试性能,并保留语义和推理能力。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26541 2026-07-30 cs.SD cs.CL 新提交 70%

Prosody-driven Jailbreaks in Audio LLMs: A Controlled Study and Mechanistic Analysis

音频大语言模型中基于韵律的越狱:一项对照研究与机制分析

Jiachen Qian, Junyu Li

机构 * City University of Hong Kong(香港城市大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞))

专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 该研究通过控制文本内容改变语音传递预设构建评估协议与基准,发现特定韵律特征的语音能提升音频大语言模型的越狱成功率,表明语音传递是音频大语言模型安全评估的重要因素。

Comments Accepted at ACM Multimedia 2026 (ACM MM '26). 9 pages, 3 figures. Supplementary material included

Journal ref Proceedings of the 34th ACM International Conference on Multimedia (MM '26), November 10-14, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25375 2026-07-29 cs.CL 新提交 70%

Inspect India Evals: An Open Benchmarking Framework for Evaluating Large Language Models in the Indian Linguistic and Cultural Context

印度评估:一个在印度语言和文化背景下评估大语言模型的开放基准框架

Abhishek Kumar Singh, Shrey Nag, Sachita, Lipi Goel, Rajeshwar Singh Janwar

专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 Inspect India Evals是在印度语言文化背景下评估大语言模型的开放框架,基于Inspect AI平台构建,含六个基准。测试五个模型,Sarvam-M 24B和Gemma 2 27B表现最佳,各模型在多语言安全测试中表现一致,DPI安全得分有差异,框架公开可扩展。

Comments 19 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22745 2026-07-28 cs.CV cs.AI 新提交 70%

AI-generated Images Challenge Visual Trust in High-risk Scenarios

人工智能生成的图像在高风险场景中挑战视觉信任

Yi-Zhi Wang, Yichen Xiao, Linan Yue, Weibo Gao, Yichao Du, Pengfei Fang, Shimin Di, Min-Ling Zhang

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 研究聚焦人工智能生成图像在高风险场景下对视觉信任的挑战,提出SafeIMG基准,涵盖12个安全场景。评估专门探测器和视觉语言模型,发现它们检测可靠性不足,模型解释覆盖低,表明当前探测器在多方面欠缺,难以可靠评估此类图像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21010 2026-07-24 cs.AI 新提交 70%

Reexamining zero-shot summarization: Empirical investigation of trustworthiness of LLM-summarizers

重新审视零样本摘要:对大语言模型摘要器可信度的实证研究

Vasudha Bhatnagar, Purnima Bindal, Vikas Kumar, Raj Kumari Bahl

机构 * Department of Computer Science, University of Delhi(德里大学计算机科学系) Department of Statistics, Ramjas College, University of Delhi(德里大学拉姆贾斯学院统计系)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 研究针对大语言模型零样本摘要的稳定性与可信度问题,提出两级诊断协议,通过文档级稳定性分析及分层样本观察估计稳定性指数,经对三种文档类型的三个LLM摘要器实证研究,揭示差异,推动相关研究发展。

Comments 28 pages, Under review in a journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14510 2026-07-17 cs.AI 新提交 70%

VLT: A Vision-Language-Time Series Multimodal Foundation Model for Industrial Intelligence

VLT:用于工业智能的视觉-语言-时间序列多模态基础模型

Haiteng Wang, Jingheng Yan, Xiaokang Wang, Lei Ren

机构 * School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) State Key Laboratory of Intelligent Manufacturing System Technology(智能制造系统技术国家重点实验室) School of Computer Science and Artificial Intelligence, Zhengzhou University(郑州大学计算机科学与人工智能学院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 针对工业时间序列单模态建模局限及连接时间序列与文本语义的挑战,提出VLT多模态基础模型,通过设计Time-MoE等机制联合建模多种模态,经实验验证其在多种复杂设置下优于现有方法,提升了鲁棒性和泛化能力。

Comments 18 pages, 13 figures, and 13 tables, including supplementary material. Haiteng Wang and Jingheng Yan contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12739 2026-07-15 cs.CL 新提交 70%

Epistemic Stance Flexibility Probing: Measuring Prompt-Conditioned Register Shift in Large Language Models

认知立场灵活性探测:测量大语言模型中提示条件下的语域转换

Binwen Liu, Yilin Ren

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL

AI总结 研究大语言模型在不同归因提示下的认知立场灵活性,引入ESFP基准,涵盖多类别多模板项目,从四个维度评估模型响应,发现认知灵活性与模型能力正交,立场内容密度信号最强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12662 2026-07-15 cs.AI cs.MA cs.SY eess.SY 新提交 70%

Internet of Agentic Things: Networked AI Agents for Closed-Loop IoT Orchestration

智能物联网络:用于闭环物联网编排的联网人工智能代理

Quanyan Zhu

机构 * New York University, Tandon School of Engineering(纽约大学坦登工程学院)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 介绍智能物联网络(IoAT)架构框架,它集成多种技术成统一闭环编排框架,由多层通过自主AI代理连接,用半形动态规划框架形式化问题,以智能建筑编排为例,还讨论了相关关键研究挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28583 2026-07-15 cs.CV cs.AI cs.MM 版本更新 70%

Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering

穿越幻象:一种双路径代理框架用于鲁棒的误导图表问答

Yanjie Zhang, Yafei Li, Rui Sheng, Zixin Chen, Yanna Lin, Huamin Qu, Lei Chen, Yushi Sun

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出ChartCynics双路径框架,通过分离感知与验证,利用诊断视觉路径和OCR驱动数据路径解决图表误导问题,提升模型鲁棒性。

Comments 10pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11151 2026-07-14 cs.CR cs.AI 新提交 70%

AMT-X: Phase-Structured Multi-Turn Red-Teaming with Checklist-Gated Evaluation

AMT-X:基于清单门控评估的阶段结构化多轮红队测试

Yi Ting Shen, Kentaroh Toyoda, Alex Leung

机构 * Vulcan Research, AIFT(Vulcan研究,AIFT)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 研究针对大语言模型安全评估问题,提出AMT-X框架,将攻击设为多阶段状态机,用多角色评审团取代单评判评分,在六个前沿受害者模型和七个审核子类别测试中,不同门控下攻击成功率有显著差异,揭示了部分与完全可操作危害的差距。

Comments A reference implementation is available at https://github.com/VulcanLab/amt-x

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09492 2026-07-13 cs.AI 新提交 70%

Multimodal Reward Hacking in Reinforcement Learning

强化学习中的多模态奖励黑客攻击

Jiayu Yao, Yiwei Wang, Anmeng Zhang, Zhe Sun, Songsong Wang, Lingrui Mei, Yuyao Ge, Shenghua Liu

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of California, Merced(加州大学默塞德分校) Southeast University(东南大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 研究强化学习中多模态奖励黑客攻击问题,通过引入新奖励失败率(NRFR)等方法,在多种设置下改变模型规模、算法等因素进行实验,发现仅结果奖励易导致黑客攻击,扩大规模可减少但不能消除,还得出不同算法和奖励方式对黑客攻击的影响及相关结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13817 2026-07-09 cs.LG cs.NI 版本更新 70%

What's on My Network? Using Large Language Models to Identify Real-World IoT Devices at Scale

我的网络上有什么?使用大语言模型大规模识别现实世界中的物联网设备

Rameen Mahmood, Tousif Ahmed, Sai Teja Peddinti, Danny Yuxing Huang

机构 * New York University(纽约大学) Google(谷歌)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 研究共享环境中物联网设备识别难题,引入语义推理管道,用大语言模型构建高保真标签并指令微调模型,在众多供应商中取得高准确率,对多种问题保持稳健,为大规模可信设备识别提供基础。

Comments 18 pages, 3 figures

Journal ref Proc. ACM Netw. 4, CoNEXT2, Article 26 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05363 2026-07-07 cs.AI 新提交 70%

SovereignPA-Bench: Evaluating User-Owned Personal Agents under Evolving Intent, Platform Mediation, and Consent Constraints

SovereignPA-Bench:在演化意图、平台中介与同意约束下评估用户自有个人智能体

Dylan Zongmin Liu

机构 * Stanford University(斯坦福大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 针对现有基准未考量个人智能体用户主权保护的问题,提出可执行基准SovereignPA-Bench,从多维度评估智能体主权能力,验证全主权框架可显著降低隐私泄露等风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04613 2026-07-07 cs.AI cs.CR 新提交 70%

Governed Individuation: Cryptographically Decoupling an Agent's Learning from Its Authority

受治理的个体化:通过密码学方式将智能体的学习与其授权方解耦

Xue Qin, Simin Luan, Cong Yang, Zhijun Li

机构 * School of Software, Harbin Institute of Technology(哈尔滨工业大学软件学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Future Science and Engineering, Soochow University(苏州大学未来科学与工程学院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 研究智能体在部署中学习时,运行系统是否仍受操作员授权限制的问题。提出受治理的个体化方法,通过绑定身份摘要和基于语义效果的动作门控保证限制,证明学习等不会扩大权限,实证验证了该方法效果。

Comments Technical companion report. 25 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02934 2026-07-07 cs.CV cond-mat.mtrl-sci cs.AI 新提交 70%

MatPhaseBench: A Semantics-Guided Benchmark for Materials Phase Diagrams Understanding

MatPhaseBench:用于材料相图理解的语义引导基准测试

Hanwen Wang, Sihan Liang, Zhiwei Liu, Yangang Wang, Wei Yan, Yuqin Liu, Zongguo Wang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Chinese Academy of Sciences(中国科学院大学) University of Manchester(曼彻斯特大学) Institute of Metal Research, Chinese Academy of Sciences(中国科学院金属研究所) China University of Geosciences(中国地质大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 介绍用于材料相图理解的MatPhaseBench基准测试,从文献选图与文字构建,有复杂科学图像理解、图文全面对齐、高质量人工监督文本采集三个关键特性,实验显示当前VLM距专家理解有差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22267 2026-07-07 cs.LG eess.SP 版本更新 70%

Towards a more realistic evaluation of machine learning models for bearing fault diagnosis

迈向更现实的机器学习模型在轴承故障诊断中的评估

João Paulo Vieira, Victor Afonso Bauler, Rodrigo Kobashikawa Rosa, Danilo Silva

机构 * Department of Electrical and Electronic Engineering, Federal University of Santa Catarina(电气与电子工程系,圣卡塔琳娜联邦大学) Department of Mechanical Engineering, Federal University of Santa Catarina(机械工程系,圣卡塔琳娜联邦大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本文探讨了振动基轴承故障诊断中数据泄漏问题,提出无泄漏评估方法,改进分类任务为多标签问题,并通过四个数据集验证了方法对提升工业故障诊断系统可靠性的重要性。

Comments To appear in Mechanical Systems and Signal Processing

Journal ref Mechanical Systems and Signal Processing, Volume 258, 2026, 114640

详情

展开后加载摘要…

URL PDF HTML 收藏