arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-18 至 2026-08-18 共收录 144 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 51 篇

2608.14903 2026-08-18 cs.AI 新提交 57%

Frontier AI Forecasting Has a Measurement Problem: An Audit of Progress Evidence

前沿AI预测存在测量问题:对进展证据的审计

Fabricio F Costa

机构 * AIx4All, LLC(AIx4All有限责任公司) HCLTech(HCLTech公司) Stanley Manne Children’s Research Institute(斯坦利·曼恩儿童研究所) Ann & Robert H. Lurie Children’s Hospital of Chicago(安与罗伯特·H·卢里芝加哥儿童医院) Northwestern University Feinberg School of Medicine(西北大学费恩伯格医学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文审计前沿AI预测的测量问题,构建含多类元素的冻结记录,发现训练计算量、METR horizon等关键数据缺失,基准更迭存在断点,来源高度集中,提出需明确版本化测量系统的预测主张。

Comments 16 pages, 6 figures, 1 table. Evidence cutoff: 12 August 2026. Ancillary code and data included. Preprint; comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14711 2026-08-18 cs.AI 新提交 57%

Beyond Pass@k: Measuring Reliability and Security of Agentic Code Generation

超越Pass@k:衡量智能体代码生成的可靠性与安全性

Jiajun Jiang, Sharon Zheng, Natan Vidra, Spurthi Setty

机构 * Stevens Institute of Technology(史蒂文斯理工学院) Cornell University(康奈尔大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 该研究指出AI编码智能体基准误用Pass@k指标,提出正确的Reliability@k及安全调整版,通过实验验证误用指标的偏差,还在SWE-bench试点中发现真实场景下的核心问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14694 2026-08-18 cs.AI cs.NI eess.SP 新提交 57%

A Comprehensive Survey of Wireless Foundation Models for AI-Native 6G Networks

面向AI原生6G网络的无线基础模型综合综述

Naveed Khan, Besan Al Sbeihi, Maryam Alshehhi, Nasir Saeed

机构 * College of Engineering, United Arab Emirates University(阿联酋大学工程学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 该综述针对无线基础模型(WFMs)的设计、学习与部署展开统一梳理,明确其概念与分类,综述相关架构、方法及应用,分析关键挑战并展望未来方向,为AI原生6G网络智能系统研发提供参考。

Comments 28 Pages, submitted to IEEE Communications Surveys and Tutorials

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14651 2026-08-18 cs.AI cs.HC 新提交 57%

Evaluating Multimodal LLMs across Text and Audio Modalities for Accessible Disaster Assistance

评估面向无障碍灾害援助的跨文本与音频模态多模态大语言模型

Anuridhi Gupta, Samara Mansoor, Hemant Purohit

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文评估了开放权重多模态大语言模型在灾害援助场景下跨文本与音频模态的响应一致性,发现其存在模态依赖的不公平性,为构建公平的灾害沟通AI工具提供了设计建议。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15282 2026-08-18 cs.LG cs.CV physics.bio-ph 新提交 57%

Earth Observation Foundation Models for Terrestrial Ecohydrology: From Representation Learning to Process Inference

面向陆地生态水文学的地球观测基础模型:从表示学习到过程推理

Yi Yu, Jian Peng, Yucheng Lin, Trevor F. Keenan, Thomas F. A. Bishop

机构 * The University of Sydney(悉尼大学) Helmholtz Centre for Environmental Research–UFZ(亥姆霍兹环境研究中心) Leipzig University(莱比锡大学) City University of Hong Kong(香港城市大学) University of California, Berkeley(加州大学伯克利分校) Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 该研究构建框架分析EOFM在生态水文学中的应用,发现其与生态水文学需求存在不匹配,推动建立过程感知框架以支撑对水、能量与碳耦合动态的可信监测与解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23982 2026-08-18 cs.MA cs.AI 版本更新 57%

Moral Hazard in Multi-Agent Language Models

多智能体语言模型中的道德风险

Dane Malenfant

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究多智能体语言模型中的道德风险,引入对话道德风险游戏,评估七个模型并分解行为,用多种优化机制更新,发现效果异质,强调应报告机制级行为而非仅团队成功。

Comments New frontier baselines, new open weight inference baselines

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10745 2026-08-18 cs.CL 版本更新 57%

The First ChineseBabyLM Challenge: training data-efficient and cognitively plausible language models for Chinese

首个中文BabyLM挑战:训练数据高效且认知合理的中文语言模型

Siyuan Song, Zhiheng Qian, Yunhao Zhang, Linyang He, Xiaozhe Ji, Yingxin Lin, Hongao Zhu, Chongtian Shao, Chuhan Lang, Luan Li, Rui Wang, Renfen Hu, Shaonan Wang, Hai Hu

机构 * Princeton University(普林斯顿大学) Shanghai Jiao Tong University(上海交通大学) Chinese Academy of Sciences(中国科学院) Columbia University(哥伦比亚大学) Beijing Normal University(北京师范大学) Tsinghua University(清华大学) University of California San Diego(加利福尼亚大学圣地亚哥分校) The Hong Kong Polytechnic University(香港理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 首个中文BabyLM挑战将在2026年自然语言处理与中文计算会议举办,要求用1亿中文词元从头训练语言模型,在自然语言理解、认知对齐和汉字知识三轨道评估,不限分词器、模型架构和训练轮数。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18094 2026-08-18 cs.CV cs.AI cs.DB 版本更新 57%

OODBench: Out-of-Distribution Benchmark for Large Vision-Language Models

OODBench: 用于大型视觉-语言模型的分布外基准

Ling Lin, Yang Bai, Heng Su, Congcong Zhu, Yaoxing Wang, Yang Zhou, Huazhu Fu, Jingrun Chen

机构 * University of Science and Technology of China Suzhou Institute for Advanced Research, USTC Key Laboratory of the Ministry of Education for Mathematical Foundations Unmanned System Research Institute, Northwestern Polytechnical University

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 OODBench提出了一种自动化方法,用于构建评估大型视觉-语言模型处理分布外数据能力的基准,并展示了当前模型在面对此类数据时的性能下降。

Comments 54 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22415 2026-08-18 cs.CV cs.AI 版本更新 57%

Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models

多模态大语言模型中用于视觉归因的证据重组与预测上下文残差化

Jiawei Liang, Jianjie Huang, Xianghao Jiao, Siyuan Liang, Shiming Liu, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Zhongguancun Academy(中关村学院) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Department of Mechanical Engineering, Imperial College London(伦敦帝国理工学院机械工程系)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究多模态大语言模型token级视觉证据难检查问题,提出基于证据重组和预测上下文残差化的ERCR框架,经实验验证该框架能改善目标token视觉证据、减轻上下文干扰,为视觉证据检查提供实用改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16199 2026-08-18 cs.NI 新提交 50%

SbDN: Source-based TSN-Grade Deterministic Networking using Commodity Switches

SbDN:使用商用交换机的基于源的TSN级确定性网络

Mohammadparsa Karimi, Majid Nabi, Andrew Nelson, Kees Goossens, Twan Basten

专题命中 安全评测 :safety(abstract)

AI总结 该研究提出基于源的多智能体架构SbDN,用商用交换机实现TSN级确定性网络,通过TNP和TP两种方法保证时间关键流的端到端延迟,成本更低且调度时间短。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15087 2026-08-18 cs.NI 新提交 50%

Agentic AI-Enabled Solar-Powered High-Altitude Platforms for Sustainable SAGINs

智能体人工智能赋能的太阳能驱动高空平台用于可持续空天地一体化网络(SAGINs)

Haoxiang Luo, Bang Huang, Mohamed-Slim Alouini

专题命中 安全评测 :trustworthy(abstract)

AI总结 本研究针对SAGINs的耦合能源需求,提出原生适用于HAP的智能体AI框架,经灾难案例验证,可提升能源效率等性能,为SAGINs可持续发展提供关键方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14835 2026-08-18 cs.CV 新提交 50%

OvDSGG: End-to-End Open-Vocabulary Dynamic Scene Graph Generation

OvDSGG:端到端开放词汇动态场景图生成

John Helsby, Yi Yang, Bodo Rosenhahn, Michael Ying Yang

机构 * Meta University of Bath(巴斯大学) Leibniz Universität Hannover(汉诺威莱布尼茨大学)

专题命中 安全评测 :alignment(abstract)

AI总结 OvDSGG是首个开放词汇DSGG的端到端框架,通过空间主干、时间主干及相关模块实现开放词汇识别,在开放词汇指标上显著优于基线,封闭集性能仍具竞争力,且构建了对应基准并公开代码。

Comments ECCVW'26 CONTEXTUS

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23312 2026-08-18 cs.IR 版本更新 50%

From IR to RecSys: Evaluating LLM-based Judges in Cranfield-style Recommendation Collections

LLM-judges是否能在 Cranfield 风格的推荐系统评估中与人类相关性一致?

Gustavo Penha, Aleksandr V. Petrov, Claudia Hauff, Enrico Palumbo, Ali Vardasbi, Edoardo D'Amico, Francesco Fabbri, Alice Wang, Praveen Chandar, Henrik Lindstrom, Hugues Bouchard, Mounia Lalmas

专题命中 安全评测 :alignment(abstract)

AI总结 本文探讨了LLM是否能作为自动评判者解决推荐系统评估的可扩展性问题,通过实验发现LLM与人类在排序一致性上表现良好,具有实际应用价值。

Comments v2 paper accepted at the RecSys'26 Unified Search & Recommendation Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 10 篇

2608.14611 2026-08-18 cs.CY 新提交 88%

The 2026 Singapore Consensus on Global AI Safety Research Priorities

2026年新加坡全球AI安全研究优先事项共识

Stephen Casper, Oskar Galeev, Yoshua Bengio, Mohan Kankanhalli, Lee Wan Sie, Tegan Maharaj, Chris Meserole, Luke Ong, Stuart Russell, Dawn Song, Max Tegmark, Brian Tse, Xue Lan, Andrew Yao, Zhang Ya-Qin, Zhou Bowen, Imane Bello, Kwan Yee Ng, Vanessa Wilfred, Erica Liaw, Lee Chein Inn, Lin Wanxuan, Ng En Qi, Jonathan Lee, José Villalobos, Abhishek Aggarwal, Adam Gleave, Alan Chan, Alex Leung, Alvin Kwock, Anthony Tung, Arisa Siong, Arthur Tea, Ben Bucknall, Benjamin Weinstein-Raun, He Bing Sheng, Liu Bo, Bryan Kian Hsiang Low, Chris Ngo, Clement Neo, Cyrus Hodes, Dan Hendrycks, Daniel Ross, Liu Dapeng, Denise Wong, Djordje Zikelic, Elham Tabassi, Fabien Le Voyer, Fazl Barez, Gabriel Nicholas, Henry Papadatos, Jaan Tallinn, James Petrie, Xu Jia, Shao Jing, Jonathan Barry, Julia Chen, Sun Jun, Karson Elmgren, Kat Lyness, Katherine Lee, Kristy Loke, Lee Kwee Geak, Leslie Teo, Meng Ling Yu, Lisa Soder, Madhulika Srikumar, Malcolm Murray, Mark Brakel, Mark Nitzberg, Mary Phuong, Matthew Jagielski, Max Fenkell, Miro Plueckebaum, Kim Myuhng Joo, Hu Naying, Neil Davison, Nicolas Miailhe, Niki Iliadis, Nur Syahidah Sahrom, Ong Chen Hui, Pradeep Varakantham, Rebecca Finlay, Renata Dwan, Robert Opp, Rumman Chowdhury, Saad Siddiqui, Sabina Nong, Sam Ramadori, Sami Jawhar, Samuel Boger, Sara Hooker, Ying Shao Wei, Sebastian Hallensleben, Shinyuk Kang, Sophie Toura, Sreejith Balakrishnan, Stephanie Kasaon, Stephen Clare, Summer Yue, Sunny Yuqing Sun, Supheakmungkol Sarin, Tian Tian, Tim Schreier, Tori Westerhoff, Urvashi Aneja, Wayne Tee, Lu Wei, Xu Wei, Zhang Wenxuan, Hu Xia, Yang Xiaofang, Pan Xudong, Xiao Yajun, Yifan Jia, Tan Yong Khiam, Yuejin Du, Yuma Kurihara, Tan Zhi Xuan, Sören Mindermann

专题命中 AI治理与伦理 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY

AI总结 该研究基于第二届AI安全国际科学交流成果,发布2026年新加坡全球AI安全研究优先事项共识,聚焦技术AI安全、社会韧性及自主AI智能体风险管理,为全球AI安全研究提供方向。

Comments Available at https://aisafetypriorities.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16081 2026-08-18 cs.CV 新提交 78%

SafeGesture: Evaluating Fine-Grained Hand Gesture Understanding in Vision-Language Models through Scenario-Conditioned Safety Interpretation

SafeGesture:通过场景条件安全解释评估视觉语言模型的细粒度手势理解能力

Taegang Kim, Saleh Afroogh, Junfeng Jiao

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Urban Information Lab, The University of Texas at Austin(德克萨斯大学奥斯汀分校城市信息实验室)

专题命中 AI治理与伦理 :safety(title,abstract)

AI总结 本文提出SafeGesture基准,评估5款视觉语言模型的细粒度手势安全理解能力,发现模型存在感知与推理脱节,瓶颈为场景条件安全推理而非手势识别。

Comments 14 pages, 22 tables, 2 figures. Code and benchmark resources available at https://github.com/The-Responsible-AI-Initiative/SafeGesture

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16710 2026-08-18 cs.LG 新提交 77%

The Ethical Decision Head: Operationalizing Normative Ethics in Autonomous Vehicles via Reinforcement Learning from Human Feedback

伦理决策头:基于人类反馈的强化学习在自动驾驶中实现规范伦理

Thomas Mbrice, Ammar Ali, Sami Mian, Khai Hern Low, Eric Chen, Arshia Aghajani, Wolf Schäfer, Amin Shirangi

机构 * Stony Brook University(石溪大学)

专题命中 AI治理与伦理 :RLHF(abstract,abstract_cn);safety(abstract);分类 cs.LG

AI总结 本文提出伦理决策头(EDH)框架,结合PPO与人类偏好奖励模型,在CARLA仿真中训练自动驾驶智能体,发现人类对自动驾驶伦理的理论规定与实践奖励存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14565 2026-08-18 cs.AI 新提交 77%

Position: AI Lock-In Is in Progress, and We Must Be Prepared

立场:AI锁定正在发生,我们必须做好准备

Jaeho Kim, Seokhyun Lee, Jieun Lee, Changhee Lee

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 该研究指出AI锁定是被低估的AI安全风险,分析其在个体、社会、国家层面的形成与升级机制,提出需提前应对以维护自主权与国家安全。

Comments ICML 2026 Position Track Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15424 2026-08-18 cs.MA cs.AI cs.LG 新提交 62%

ETHOS: Towards a Modular Ethics Framework for Clinical Multi-Agent Systems

ETHOS:面向临床多智能体系统的模块化伦理框架

Rakesh Sharma, Sydney Pugh, Cameron Beeche, Pankhuri Singhal, Rachel Wu, Margaret Eby, Jeffrey Duda, James Gee, Kyra O'Brien, Hersh Sagreiya, Marina Serper, Victoria Gershuni, Angela Bradbury, Anurag Verma, Eric Eaton, Kevin B. Johnson, Walter Witschey

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.LG

AI总结 ETHOS是可与现有临床多智能体系统集成的模块化伦理框架,通过分层治理提升决策可靠性,将AI伦理原则转化为可部署的安全保障。

Comments Preprint of an article submitted for consideration in Pacific Symposium on Biocomputing \textcopyright\ 2027 World Scientific Publishing Company. \url{https://psb.stanford.edu/}

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00235 2026-08-18 physics.soc-ph cs.AI cs.CY cs.MA 62%

Civilizational Metamaterials: Engineering Coordination Under Capability Gradients and Structural Turbulence

文明超材料:能力梯度与结构湍流下的协调工程

David Orban

机构 * Independent Researcher(独立研究者)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 受超材料物理学启发,提出将治理从规范性学科转变为工程学科的正式框架,通过有效协调系数模型预测自愈与自失稳相变,并设计可检验假设与实验方案。

Comments 19 pages, 4 figures. Accepted for presentation at AGI-26 (Springer LNAI, forthcoming). v2 corrects the sign of the synergy term in the constitutive law (Eq. 2) and reformulates H3 as a threshold-crossing claim, per peer review

Journal ref Artificial General Intelligence. AGI 2026. Lecture Notes in Computer Science, vol 16855, pp. 118-136. Springer, Cham (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03222 2026-08-18 cs.CY cs.AI cs.HC 版本更新 62%

The Fake Friend Dilemma: Relational Trust and the Political Economy of Conversational AI

虚假朋友困境:信任与对话AI的政治经济学

Jacob Erickson

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文提出虚假朋友困境框架,探讨拟人化AI如何通过隐蔽手段影响用户自主权,分析其在信任与政治经济学中的作用。

Comments Manuscript under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16394 2026-08-18 cs.AI cs.IR 新提交 57%

Think Inside the Chunk: RegulaRAG for Regulation-Compliant Scenario Generation using LLMs: A Case Study of UN Regulation No. 152

在块内思考:使用大语言模型生成符合法规的场景的RegulaRAG——以联合国第152号法规为例

Vahid Zolfaghari, Nenad Petrovic, AndrÉ Schamschurko, Alois Knoll

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 针对LLMs难以结合冗长分层标准的问题,提出RegulaRAG流水线,经实验其在UN R152数据集上元分数最高且鲁棒性强,优于基线系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15354 2026-08-18 cs.AI 新提交 57%

Incoherent by Design? On the Moral Self-Consistency of LLMs

天生不连贯?大型语言模型的道德自我一致性研究

Pegah Nokhiz, Aravinda Kanchana Ruwanpathirana, Helen Nissenbaum

机构 * Cornell University(康奈尔大学) Cornell Tech(康奈尔科技学院) Nanyang Technological University(南洋理工大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本研究针对GPT、Mistral、Llama等LLM,在义务论等三大伦理框架下,发现其道德推理存在最高78%的矛盾率,内部不连贯是AI对齐的必要前提。

Comments 88 pages; pages 16 to 88 are the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04306 2026-08-18 cs.MA 版本更新 50%

Organizational Control Layer: Governance Infrastructure at the Execution Boundary of LLM Agent Systems

组织控制层:LLM代理系统执行边界的治理基础设施

Tianyu Shi, Yang Mo, Yiou Liu, Zhuonan Hao, Yin Wang, Wenzhuo Hu, Nan Yu, Meng Zhou, Jiangbo Yu

专题命中 AI治理与伦理 :safety(abstract)

AI总结 针对LLM代理在执行边界产生的动作治理问题,提出组织控制层(OCL),通过策略执行和升级机制拦截生成动作,在不修改底层LLM生成器的情况下将不安全执行从88%降至接近零,同时将有效成功率从12%提升至96%。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 31 篇

2608.13741 2026-08-18 cs.CL cs.LG 版本更新 84%

GALA: Generation-Aware Cross-Modal Alignment for Text-to-Time-Series Synthesis

GALA:面向文本到时间序列合成的生成感知跨模态对齐

Haochen Zhang, Gengwei Zhang, Laura Yao, Nicholas Konz, Tianlong Chen

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究针对文本到时间序列合成中条件表示与信号模态不匹配的问题,提出GALA两阶段跨模态对齐方法,在TSFragment-600K数据集上实现SOTA,打破了生成器内部文本编码器的保真度与贴合度权衡。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07195 2026-08-18 cs.CL cs.AI 版本更新 81%

Adapting LLMs to Time Series Forecasting via Temporal Heterogeneity Modeling and Representation Alignment

通过时间异质性建模与表示对齐将大语言模型(LLMs)适配到时间序列预测任务

Yanru Sun, Emadeldeen Eldele, Zongxia Xie, Yucheng Wang, Wenzhe Niu, Qinghua Hu, Chee Keong Kwoh, Min Wu

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出TALON框架,通过异构时间编码器建模时间异质性、表示对齐模块弥合模态差距,在7个真实世界基准上较SOTA方法平均MSE提升最高11%,实现高效且高性能的LLM时间序列预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16407 2026-08-18 cs.IR cs.LG 新提交 79%

POI Recommendation with LLM-Augmented Multi-Graph Learning and Contrastive Alignment

结合大语言模型增强多图学习与对比对齐的兴趣点推荐

Burak Tamer, Wolfram Höpken, Zehui Wang

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 该研究针对POI推荐的物品冷启动问题,提出LLM-MGCL模型,结合语义、地理与交互多图及对比学习,在Yelp数据集上显著优于基线模型,缓解了冷启动问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15698 2026-08-18 cs.CV cs.IR 新提交 78%

ConceptFormer: Learning Adaptive Latent Concepts for Query-Document Alignment in Visual Document Retrieval

ConceptFormer:学习自适应潜在概念以实现视觉文档检索中的查询-文档对齐

Peng Chunyi, Xu Zhipeng, Yan Yukun, Liu Zhenghao, Yu Shi, Mei Sen, Sun Yubo, Zhang Yongheng, Zhou Jie, Gu Yu, Yu Ge, Sun Maosong

机构 * Northeastern University(东北大学) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 其他安全 :alignment(title,abstract)

AI总结 针对视觉文档检索中现有监督信号的局限,本文提出ConceptFormer框架,以自适应潜在概念为中间表示衔接语义鸿沟,在基准测试中较最强基线实现了16.7%、22.1%的NDCG@10相对提升,性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15456 2026-08-18 cs.CV 新提交 78%

AlignJEPA: Predictive Vision-Language Alignment for Remote Sensing Foundation Models

AlignJEPA:面向遥感基础模型的预测性视觉-语言对齐

Md Aminur Hossain, Omkumar Vaghasiya, Rajeev Ranjan Dwivedi, Vinod Kurmi, Biplab Banerjee

机构 * Space Applications Centre, ISRO(印度空间研究组织空间应用中心) Indian Institute of Science Education and Research (IISER) Bhopal(印度科学教育与研究学院(博帕尔)) Indian Institute of Technology Bombay(印度理工学院孟买分校)

专题命中 其他安全 :alignment(title,abstract)

AI总结 该研究针对遥感基础模型与自然语言对齐不足的问题,提出受JEPA启发的AlignJEPA框架,采用轻量级预测对齐网络,结合语义预测与双向对比检索,实现了参数高效的视觉-语言对齐。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16834 2026-08-18 cs.CL cs.AI 新提交 73%

Model Hypnosis: Strong control of AI via additive subliminal effects

模型催眠:通过叠加阈下效应对AI进行强控制

Enric Boix-Adsera, Benedict Tessler

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 该研究发现AI模型普遍存在模型催眠现象,可通过组合提示中微弱无关线索强控制模型行为,该现象跨模型家族且具迁移性,对AI安全与可解释性构成挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16041 2026-08-18 cs.RO 新提交 71%

ScenarioCharacterization: A Modular Toolkit for Characterizing Safety across Trajectory Datasets

ScenarioCharacterization:用于刻画轨迹数据集安全性的模块化工具包

Ingrid Navarro, Yutong Duan, Jonathan Francis, Jean Oh

机构 * Robotics Institute, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机学院机器人研究所) Stack AV Bosch Center for Artificial Intelligence(博世人工智能中心)

专题命中 其他安全 :safety(title)

AI总结 本文提出开源模块化框架ScenarioCharacterization,可自动刻画轨迹数据集的驾驶场景安全性,适配多数据集,在Waymo等数据集上验证,支持下游应用。

Comments 9 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏