arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9378 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9378 篇

2605.18423 2026-05-19 cs.RO cs.CY 70%

REBAR: Reference Ethical Benchmark for Autonomy Readiness

REBAR:自主性准备的参考伦理基准

Jonathan Diller, David Barnes, Rebekah Bogdanoff, Rhett Collier, Roddy Collins, Keith Fieldhouse, Yonatan Gefen, Cameron Johnson, Anuriha Kodali, Brad Kriel, Varun Murali, James Niehaus, Mish Sukharev, Joseph VanPelt, Anthony Hoogs, Vijay Kumar, Arslan Basharat

机构 * University of Pennsylvania(宾夕法尼亚大学) David Barnes, LLC(大卫·巴恩斯公司) Kitware, Inc.(Kitware公司) Duality Robotics, Inc.(Duality机器人公司) Texas A&M University(德克萨斯大学) Charles River Analytics(查尔斯河分析公司)

专题命中 安全评测 :safety(abstract);red teaming(abstract);分类 cs.CY

AI总结 本文提出REBAR框架,通过严谨测试提供可计算的自主性准备等级,以量化伦理性能并解决现有伦理AI框架的不足。

Comments To be presented at the 2026 Workshop on Robot Ethics - Ethical, Legal and User Perspectives in Robotics and Automation (WOROBET)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17453 2026-05-19 cs.CR cs.CL 70%

Trust No Tool: Evaluating and Defending LLM Agents under Untrusted Tool Feedback

勿信工具:在不可信工具反馈下评估和防御LLM代理

Lecheng Yan, Ruizhe Li, Xicheng Han, Wenxi Li, Binwu Wang, Longyue Wang, Chenyang Lyu, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) University of Science and Technology of China(中国科学技术大学) University of Birmingham(伯明翰大学) Zhejiang University(浙江大学) East China Normal University(华东师范大学) Alibaba Group(阿里巴巴集团)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL

AI总结 本研究探讨了在不可信工具反馈环境下评估和防御LLM代理的问题,提出了一种新的失败模式'认知中毒',并介绍了TRUST-Bench基准、GuardedJoint惩罚指标和VISTA-Guard框架,展示了轨迹感知的最终动作评分在安全与效用权衡中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16996 2026-05-19 cs.CL 70%

Evaluation Drift in LLM Personality Induction: Are We Moving the Goalpost?

LLM个性诱导中的评估漂移:我们是否在移动目标?

Prateek Rajput, Yewei Song, Iyiola E. Olatunji, Jacques Klein, Tegawendé F. Bissyandé

机构 * University of Luxembourg(卢森堡大学)

专题命中 安全评测 :DPO(abstract,abstract_cn);分类 cs.CL

AI总结 本文研究了大型语言模型在诱导人类样性格时的稳定性问题,通过微调长格式论文来诱导性格,并发现尽管微调减少了问卷评分的方差,但完整五维性格的准确性仍接近随机,表明无指导的论文缺乏表达忠实性格所需的线索。

Comments 14 pages, 8 main pages, 5 figures, 4 main page figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12702 2026-05-14 cs.AI cs.HC 70%

DisaBench: A Participatory Evaluation Framework for Disability Harms in Language Models

DisaBench:一种评估语言模型残疾危害的参与性评估框架

Eugenia Kim, Ioana Tanase, Christina Mallon

机构 * Microsoft(微软)

专题命中 安全评测 :safety(abstract);red teaming(abstract);分类 cs.AI

AI总结 DisaBench通过与残障人士和红队专家共同制定的十二类残疾危害分类,评估语言模型对残疾相关的危害,揭示了残疾类型对危害率的影响、术语驱动的危害具有文化及时间绑定性以及标准安全评估无法识别细微危害的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11595 2026-05-13 cs.AI 70%

Native Explainability for Bayesian Confidence Propagation Neural Networks: A Framework for Trusted Brain-Like AI

为贝叶斯置信传播神经网络构建原生可解释性:一种可信类脑AI的框架

Georgios Makridis, Georgios Fatouros, John Soldatos, George Katsis, Dimosthenis Kyriazis

机构 * CC BY-NC-SA 4.0

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出一种针对贝叶斯置信传播神经网络的可解释性框架,通过定义新的XAI分类法和解释原语,提升模型透明度和边缘设备部署可行性,同时探讨其在工业物联网中的应用前景。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11276 2026-05-13 cs.CV cs.AI 70%

Generative AI for Visualizing Highway Construction Hazards Through Synthetic Images and Temporal Sequences

生成AI用于通过合成图像和时间序列可视化公路施工危险

Trevor Neece, Mason Smetana, Lev Khazanovich

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出利用生成AI从OSHA严重伤害报告中生成合成图像和时间序列,以可视化公路施工危险,通过CLIP检索和专家评估验证了其教育价值和真实性,为安全培训提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10779 2026-05-12 cs.CR cs.CL 70%

LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments

LITMUS:在真实操作系统环境中评估LLM代理行为越狱的基准测试

Chiyu Zhang, Huiqin Yang, Bendong Jiang, Xiaolei Zhang, Yiran Zhao, Ruyi Chen, Lu Zhou, Xiaogang Xu, Jiafei Wu, Liming Fang, Zhe Liu

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Zhejiang University(浙江大学)

专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 LITMUS通过语义-物理双重验证机制和操作系统级状态回滚,解决现有基准测试在物理层危害评估和测试隔离上的不足,揭示LLM代理在行为安全方面的缺陷和漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10721 2026-05-12 physics.soc-ph cs.CL cs.MA 70%

Conformity Generates Collective Misalignment in AI Agents Societies

一致性在AI代理社会中产生集体偏离

Giordano De Marzo, Alessandro Bellina, Claudio Castellano, Viola Priesemann, David Garcia

机构 * University of Konstanz(康斯坦茨大学) Sony Computer Science Laboratories - Rome(索尼计算机科学实验室-罗马) Sapienza University of Rome(罗马大学) Max Planck Institute for Dynamics and Self-Organization(马克斯·普朗克动态与自组织研究所) Institute for the Dynamics of Complex Systems, University of Gottingen(复杂系统动力学研究所,哥廷根大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 研究探讨了个体对齐的AI代理群体在一致性动态下可能陷入长期偏离状态的现象,揭示了集体安全性的不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10365 2026-05-12 cs.AI 70%

Agent-ValueBench: A Comprehensive Benchmark for Evaluating Agent Values

Agent-ValueBench: 一个全面的评估代理价值观的基准

Haonan Dong, Qiguan Feng, Kehan Jiang, Haoran Ye, Xin Zhang, Guojie Song

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Peking University School of Software and Microelectronics(北京大学软件与微电子学院) Peking University School of Psychological and Cognitive Sciences(北京大学心理与认知科学学院) Key Laboratory of Machine Perception (Ministry of Education), Peking University(北京大学机器感知重点实验室)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出Agent-ValueBench,首个专门评估代理价值观的基准,包含394个环境和4335个价值冲突任务,揭示代理价值观与基础LLM的差异及Harness和技能对价值观的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12090 2026-05-12 cs.CL 70%

ChatbotManip: A Dataset to Facilitate Evaluation and Oversight of Manipulative Chatbot Behaviour

ChatbotManip:一个用于评估和监督操纵性聊天机器人行为的数据库

Jack Contro, Simrat Deol, Yulan He, Martim Brandão

机构 * King’s College London(伦敦国王学院)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL

AI总结 本文介绍ChatbotManip数据集,用于研究聊天机器人中的操纵行为。通过模拟对话展示聊天机器人操纵策略,揭示LLM在指令下具有操纵性,且小型模型在检测操纵方面表现接近大模型,但尚不适用于实际监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08960 2026-05-12 cond-mat.mtrl-sci cs.LG physics.chem-ph physics.comp-ph 70%

CrystalREPA: Transferring Physical Priors from Universal MLIPs to Crystal Generative Models

CrystalREPA: 从通用机器学习 interatomic 势能中转移物理先验到晶体生成模型

Chengqian Zhang, Yucheng Jin, Duo Zhang, Tiejun Li, Han Wang

机构 * AI for Science Institute, Beijing, China(人工智能科学研究院,北京,中国) Center for Data Science, Peking University, Beijing, China(数据科学中心,北京大学,北京,中国) LMAM and School of Mathematical Sciences, Peking University, Beijing, China(LMAM与数学科学学院,北京大学,北京,中国) Center for Machine Learning Research, Peking University, Beijing, China(机器学习研究中心,北京大学,北京,中国) National Key Laboratory of Computational Physics, Institute of Applied Physics and Computational Mathematics, Beijing, China(国家计算物理重点实验室,应用物理与计算数学研究所,北京,中国) HEDPS, CAPT, College of Engineering, Peking University, Beijing, China(HEDPS、CAPT、工程学院,北京大学,北京,中国)

专题命中 安全评测 :alignment(abstract,abstract_cn);分类 cs.LG

AI总结 CrystalREPA 通过在训练时对齐生成编码器的原子隐藏状态与冻结的 MLIP 表示,转移稳定性感知的原子先验,提升生成晶体的热力学稳定性、结构有效性及结构保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08480 2026-05-12 cs.AI 70%

AI-Care: A Conversational Agentic System for Task Coordination in Alzheimer's Disease Care

AI-Care:一种用于阿尔茨海默病护理的任务协调对话代理系统

Preyash Yadav, Michelle Cohn, Priyanka Koppolu, Hritvik Agarwal, Amey Gohil, Tejas Patil, Sasha Pimento, Alyssa Weakley

机构 * Department of Computer Science(计算机科学系) Department of Linguistics(语言学系) Department of Neurology(神经病学系) University of California, Davis(加州大学戴维斯分校)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 AI-Care通过自然语言交互降低阿尔茨海默病患者使用数字工具的认知负担,通过语音优先聊天机器人实现日程提醒和待办事项管理,采用状态化 orchestration 方法确保安全性和准确性。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20798 2026-05-12 cs.AI 70%

A Benchmark for Evaluating Outcome-Driven Constraint Violations in Autonomous AI Agents

一个评估自主AI代理结果驱动约束违反的基准

Miles Q. Li, Benjamin C. M. Fung, Martin Weiss, Pulei Xiong, Khalil Al-Hussaeni, Claude Fachkha

机构 * McGill University(麦吉尔大学) Tiptree Advanced Systems Corporation(蒂普里高级系统公司) Polytechnique Montréal(蒙特利尔理工学院) National Research Council Canada(加拿大国家研究委员会) Rochester Institute of Technology(罗切斯特理工学院) University of Dubai(迪拜大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出一个包含40个场景的基准,用于评估自主AI代理在追求目标优化时出现的结果驱动约束违反问题,发现多数模型存在25%以上的偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06439 2026-05-08 cs.CY cs.CV cs.ET 70%

From Review to Design: Ethical Multimodal Driver Monitoring Systems for Risk Mitigation, Incident Response, and Accountability in Automated Vehicles

从评审到设计:面向风险缓解、事故响应和问责的伦理多模态驾驶员监控系统

Bilal Khana, Waseem Shariff, Rory Coyne, Muhammad Ali Farooq, Peter Corcoran

机构 * C3I Imaging Lab, School of Engineering, University of Galway(Galway大学工程学院C3I成像实验室) Royal College of Surgeons in Ireland(爱尔兰皇家外科医师学院)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CY

AI总结 本文提出针对自动驾驶车辆中多模态驾驶员监控系统的设计框架,解决伦理和法律挑战,强调透明、可信和以人为本的设计方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04378 2026-05-08 cs.LG cs.CV stat.ML 70%

Aligned explanations in neural networks

神经网络中的对齐解释

Corentin Lobet, Francesca Chiaromonte

机构 * Institute of Economics and L’EMbEDS, Sant’Anna School of Advanced Studies(经济学研究所和L’EMbEDS,圣安娜高级研究院) Dept. of Statistics and Huck Institutes of the Life Sciences, Penn State University(统计系和生命科学学院,宾夕法尼亚州立大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本文提出PiNets,一种伪线性架构,通过实例级线性模型实现解释与预测的对齐,验证了其在图像分类和分割任务中解释的忠实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17573 2026-05-08 cs.AI 70%

Beyond Static Snapshots: A Grounded Evaluation Framework for Language Models at the Agentic Frontier

超越静态快照:语言模型在代理前沿的 grounded 评估框架

Jazmia Henry

机构 * University of Oxford(牛津大学)

专题命中 安全评测 :RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出 grounded continuous evaluation 框架,通过 deterministic verifier 和 CPU 更新 LoRA adapters,解决 reward hacking 和硬件限制问题,并在多个架构和领域验证其有效性。

Comments Submitted for consideration to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01647 2026-05-05 cs.CL 70%

Beyond Perplexity: Character Distribution Signatures and the MDTA Benchmark for AI Text Detection

超越困惑度:字符分布签名与AI文本检测的MDTA基准

Priyadarshan Narayanasamy, Swastik Agrawal, Klint Faber, Fardina Fathmiul Alam

机构 * University of Maryland, College Park(马里兰大学学院市分校)

专题命中 安全评测 :RLHF(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出基于字符分布签名的AI文本检测方法,通过MDTA基准验证其有效性,显示与困惑度方法低相关性,并在特定领域取得显著提升。

Comments 11 figures, 10 tables, 24 pages, Under Review at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01100 2026-05-05 cs.AI 70%

A Knowledge-Driven LLM-Based Decision-Support System for Explainable Defect Analysis and Mitigation Guidance in Laser Powder Bed Fusion

基于知识的LLM决策支持系统:用于激光粉末床融合的可解释缺陷分析与缓解指导

Basit Mahmud Shahriar, Md Habibor Rahman

机构 * Department of Mechanical Engineering, University of Massachusetts Dartmouth(达特茅斯大学机械工程系)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出一种整合结构化缺陷知识与LLM推理的知识驱动决策支持系统,用于制造业中激光粉末床融合的可解释缺陷诊断与缓解指导。系统基于包含27种已知缺陷类型的知识库,支持模糊自然语言查询、文献支持的缺陷解释及基于编码工艺知识的缺陷原因和缓解策略指导。

Comments 28 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00468 2026-05-04 cs.CL 70%

ReLay: Personalized LLM-Generated Plain-Language Summaries for Better Understanding, but at What Cost?

ReLay:为更好的理解而定制的LLM生成的通俗摘要,但代价是什么?

Joey Chan, Yikun Han, Jingyuan Chen, Samuel Fang, Lauren D. Gryboski, Alexandra Lee, Sheel Tanna, Qingqing Zhu, Zhiyong Lu, Lucy Lu Wang, Yue Guo

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Virginia(弗吉尼亚大学) University of Colorado Anschutz(科罗拉多大学安舒茨分校) Johns Hopkins University(约翰霍普金斯大学) University of Chicago Pritzker School of Medicine(芝加哥大学普ritzker法学院) National Library of Medicine, National Institutes of Health(国家医学图书馆,国家卫生研究院) University of Washington(华盛顿大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL

AI总结 ReLay研究通过评估五种LLM在两种个性化方法中的表现,探讨了个性化通俗摘要对理解提升与安全性的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27132 2026-05-01 cs.AI 70%

TRUST: A Framework for Decentralized AI Service v.0.1

TRUST:一种去中心化AI服务框架v.0.1

Yu-Chao Huang, Zhen Tan, Mohan Zhang, Pingzhi Li, Zhuo Zhang, Tianlong Chen

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 TRUST框架通过去中心化方法解决高风险领域中大型推理模型和多智能体系统可靠性验证的问题,采用HDAG、DAAN协议和多层共识机制,提升透明性、鲁棒性和隐私保护,实现安全且可问责的AI部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17469 2026-05-01 cs.CL cs.HC 70%

Cross-Lingual Sentiment Misalignment: Auditing Multilingual Language Models for Inversion Risk, Dialectal Representation, and Affective Stability

跨语言情感不一致:审计多语言语言模型以检测反向风险、方言表示和情感稳定性

Nusrat Jahan Lia, Shubhashis Roy Dipta

机构 * Institute of Information Technology University of Dhaka(达卡大学信息科技学院) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文通过控制基准框架评估多语言Transformer模型在平行孟加拉语-英语句子对上的表现,揭示了模型在情感反向、同理心不对称和方言表示中的问题,提出需引入情感稳定性指标以提升跨语言可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20191 2026-04-29 cs.CV cs.AI cs.RO 70%

From Scene to Object: Text-Guided Dual-Gaze Prediction

从场景到物体:文本引导的双目预测

Zehong Ke, Yanbo Jiang, Jinhao Li, Zhiyuan Liu, Yiqian Tu, Qingwen Meng, Heye Huang, Jianqiang Wang

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院) Cho Chun Shik Graduate School of Mobility, Korea Advanced Institute of Science and Technology(Cho Chun Shik 移动研究生院,韩国科学技术院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出双分支 gaze 预测框架,通过构建物体级数据集和改进模型架构,实现精准物体级注意力预测,提升语义推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24153 2026-04-28 cs.AI 70%

Right-to-Act: A Pre-Execution Non-Compensatory Decision Protocol for AI Systems

有权行动:一种预执行非补偿性决策协议用于AI系统

Gadi Lavi

机构 * Independent Researcher(独立研究者) DECIMAG

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文提出Right-to-Act协议,一种预执行非补偿性决策层,用于评估AI生成决策是否可被执行,通过严格约束防止错误决策,提升AI系统的可控性。

Comments 14 pages, 3 figures. Introduces a pre-execution decision protocol for AI systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22136 2026-04-27 cs.CR cs.LG 70%

Sovereign Agentic Loops: Decoupling AI Reasoning from Execution in Real-World Systems

主权代理循环:在现实系统中解耦AI推理与执行

Jun He, Deying Yu

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文提出Sovereign Agentic Loops,通过解耦AI推理与执行,提升系统安全性,实验显示其有效阻止93%的危险意图。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15037 2026-04-23 cs.SE cs.AI 70%

CircuChain: Disentangling Competence and Compliance in LLM Circuit Analysis

CircuChain: 解构LLM电路分析中的能力与合规性

Mayank Ravishankara

机构 * Independent Researcher(独立研究员) San Francisco, CA, USA(美国加州旧金山)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 CircuChain通过设计控制/陷阱问题对,评估LLM在电路分析中遵循指令与物理推理能力的差异,揭示模型能力与约束对齐的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19016 2026-04-22 cs.CL 70%

AlignCultura: Towards Culturally Aligned Large Language Models?

AlignCultura: 向文化对齐的大语言模型迈进?

Gautam Siddharth Kashyap, Mark Dras, Usman Naseem

机构 * School of Computing, Macquarie University, Australia(麦考瑞大学计算机学院,澳大利亚)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL

AI总结 本文提出AlignCultura框架,通过构建HHH-English数据集和评估不同模型的文化对齐能力,提升输出的尊重性和文化多样性。

Comments Accepted at ACL Mains 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15332 2026-04-20 cs.HC cs.AI cs.CV cs.SE 70%

Automating Crash Diagram Generation Using Vision-Language Models: A Case Study on Multi-Lane Roundabouts

利用视觉-语言模型自动化生成碰撞图:多车道环形交叉口的案例研究

Xiao Lu, Hao Zhen, Jidong J. Yang

机构 * Smart Mobility and Infrastructure Lab, College of Engineering University of Georgia Athens(智能移动与基础设施实验室,工程学院,佐治亚大学亚特兰大分校)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文研究利用视觉-语言模型自动化生成碰撞图,针对多车道环形交叉口这一挑战性案例,提出三步提示框架和10项评估指标,发现GPT-4o在空间推理和数据对齐方面表现最佳,为生成式AI在工程可视化中的应用奠定基础。

Comments 16 pages, 5 figures, 3 tables

Journal ref Applied Computing and Intelligence, 2026, 6(1): 38-57

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05991 2026-04-16 cs.AI 70%

3D Instruction Ambiguity Detection

三维指令歧义检测

Jiayu Ding, Haoran Tang, Hongbo Jin, Wei Gao, Ge Li

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出三维指令歧义检测任务,构建了大规模基准Ambi3D,发现现有3D大语言模型难以判断指令歧义,提出AmbiVer框架解决该问题,提升具身AI的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06921 2026-04-16 cs.CR cs.AI 70%

Neuro-Symbolic AI for Cybersecurity: State of the Art, Challenges, and Opportunities

神经符号AI在网络安全中的应用:现状、挑战与机遇

Safayat Bin Hakim, Muhammad Adil, Alvaro Velasquez, Shouhuai Xu, Houbing Herbert Song

机构 * Department of Information Systems, University of Maryland, Baltimore County(信息系统系,马里兰大学巴尔的摩分校) Department of Computer Science and Engineering, University at Buffalo(计算机科学与工程系,布法罗大学) Department of Computer Science, University of Colorado Boulder(计算机科学系,科罗拉多大学博尔德分校) Laboratory for Cybersecurity Dynamics, Department of Computer Science, University of Colorado Colorado Springs(网络安全动力实验室,科罗拉多大学科罗拉多斯普林斯分校)

专题命中 安全评测 :alignment(abstract,abstract_cn);分类 cs.AI

AI总结 本文综述了神经符号AI在网络安全中的应用,分析了103篇文献,指出多智能体和结构化集成架构在复杂场景中表现更优,因果推理能提升防御能力,知识引导学习提高效率和可解释性,但评估标准化和人机协作仍是挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11548 2026-04-14 cs.AI 70%

SemaClaw: A Step Towards General-Purpose Personal AI Agents through Harness Engineering

SemaClaw:通过Harness工程迈向通用个人AI代理的一步

Ningyan Zhu, Huacan Wang, Jie Zhou, Feiyu Chen, Shuo Zhang, Ge Chen, Chen Liu, Jiarou Wu, Wangyi Chen, Xiaofeng Mou, Yi Xu

机构 * Midea AIRC(美的AIRC)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 SemaClaw通过Harness工程推动个人AI代理发展,提出DAG-based两阶段混合代理团队编排方法、PermissionBridge行为安全系统、三级上下文管理架构和代理维基技能,提升AI代理的可控性与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏