arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-23 至 2026-01-23 共收录 43 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 4 篇

2406.12205 2026-01-23 cs.LG cs.AI cs.IT math.IT math.ST stat.ML stat.TH 82%

On the Exponential Convergence for Offline RLHF with Pairwise Comparisons

关于通过成对比较进行离线RLHF的指数收敛性

Zhirui Chen, Vincent Y. F. Tan

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.AI、cs.LG;alignment(comments)

AI总结 本文提出了一种在离线RLHF中通过成对比较实现指数收敛的算法RL-LOW,并推导了实例依赖的下界。

Comments Accepted as an oral presentation at AAAI 2026 (AI Alignment Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15120 2026-01-23 cs.AI 57%

Emerging from Ground: Addressing Intent Deviation in Tool-Using Agents via Deriving Real Calls into Virtual Trajectories

从地面崛起:通过推导真实调用为虚拟轨迹来解决工具使用代理中的意图偏差

Qian Xiong, Yuekai Huang, Bo Yang, Yujia Zheng, Tianhao Li, Ziyou Jiang, Zhiyuan Chang, Zhaoyang Li, Huanxiang Feng, Mingyang Li

机构 * Beijing Forestry University(北京林业大学) State Key Laboratory of Complex System Modeling and Simulation Technology(复杂系统建模与仿真技术国家重点实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Duke University(杜克大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 RISE通过推导真实调用为虚拟轨迹,解决工具使用代理中的意图偏差问题,提升任务完成和意图对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14727 2026-01-23 stat.ME 50%

Recent advances in the Bradley--Terry Model: theory, algorithms, and applications

布莱德利-蒂尔模型近期进展:理论、算法与应用

Shuxing Fang, Ruijian Han, Yuanhang Luo, Yiming Xu

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文综述了布莱德利-蒂尔模型的最新理论、算法及应用,探讨了大规模场景下的统计推断和计算方法,并指出了未来研究的方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17915 2026-01-23 cs.MA 50%

DISPATCH -- Decentralized Informed Spatial Planning and Assignment of Tasks for Cooperative Heterogeneous Agents

DISPATCH -- 分布式知情空间规划与任务分配以实现协作异构代理

Yao Liu, Sampad Mohanty, Elizabeth Ondula, Bhaskar Krishnamachari

专题命中 偏好对齐 :alignment(abstract)

AI总结 DISPATCH提出两种算法,通过整合公平性和效率,在分布式环境下实现异构代理任务分配的公平与效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 2 篇

2601.15412 2026-01-23 cs.HC cs.AI cs.CY 84%

A Checklist for Trustworthy, Safe, and User-Friendly Mental Health Chatbots

可信、安全且用户友好的心理健康聊天机器人清单

Shreya Haran, Samiha Thatikonda, Dong Whi Yoo, Koustuv Saha

机构 * University of Illinois Urbana-Champaign, Urbana, United States(伊利诺伊大学厄巴纳-香槟分校) Indiana University Indianapolis, Indianapolis, United States(印第安纳大学印第安纳波利斯分校)

专题命中 安全训练 :trustworthy(title,abstract);safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出了一套操作清单,旨在指导开发更可信、安全且用户友好的心理健康聊天机器人,以促进伦理和有效的设计实践。

Journal ref In 28th International Conference on Human-Computer Interaction, Springer LNCS, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16921 2026-01-23 cs.CL 77%

Being Kind Isn't Always Being Safe: Diagnosing Affective Hallucination in LLMs

善良并不总是安全:诊断大语言模型中的情感幻觉

Sewon Kim, Jiwon Kim, Seungwoo Shin, Hyejin Chung, Daeun Moon, Yejin Kwon, Hyunsoo Yoon

机构 * Department of Industrial Engineering, Yonsei University(工业工程系,延世大学)

专题命中 安全训练 :alignment(abstract);DPO(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出AHaBench和AHaPairs用于诊断LLM中的情感幻觉问题,通过DPO优化减少虚假社会存在感,提升模型的心理安全性和事实可靠性。

Comments EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 4 篇

2601.15698 2026-01-23 cs.CV cs.AI 85%

Beyond Visual Safety: Jailbreaking Multimodal Large Language Models for Harmful Image Generation via Semantic-Agnostic Inputs

超越视觉安全:通过语义无关输入对多模态大语言模型进行有害图像生成的劫持

Mingyu Yu, Lana Liu, Zhehao Zhao, Wei Wang, Sujuan Qin

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(网络与交换技术国家重点实验室,北京邮电大学) School of Cyberspace Security, Beijing University of Posts and Telecommunications(网络安全学院,北京邮电大学)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出BVS框架,通过语义无关输入对多模态大语言模型进行有害图像生成的劫持,揭示其视觉安全边界的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01747 2026-01-23 cs.CR cs.AI cs.CV cs.LG 73%

Crafting Adversarial Inputs for Large Vision-Language Models Using Black-Box Optimization

为大型视觉-语言模型设计对抗输入使用黑盒优化

Jiwei Guan, Haibo Jin, Haohan Wang

机构 * School of Computing, Macquarie University(麦考瑞大学计算机学院) School of Information Sciences, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校信息科学学院)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于零阶优化的黑盒劫持攻击方法,针对大型视觉-语言模型实现高成功率的对抗性攻击,揭示了当前模型安全机制的不足。

Comments EACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15331 2026-01-23 cs.CL cs.AI cs.CR cs.LG 67%

RECAP: A Resource-Efficient Method for Adversarial Prompting in Large Language Models

RECAP:一种资源高效的对抗性提示方法用于大型语言模型

Rishit Chugh

机构 * Rishit Chugh(独立研究者)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RECAP提出一种无需重新训练的高效对抗性提示方法,通过匹配预训练对抗性提示数据库,降低计算成本并提升攻击成功率。

Comments Code for RECAP is available at: https://github.com/R-C101/RECAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15786 2026-01-23 cs.CE 50%

Endowing Molecular Language with Geometry Perception via Modality Compensation for High-Throughput Quantum Hamiltonian Prediction

通过模态补偿赋予分子语言几何感知能力以实现高通量量子哈密顿量预测

Zhenzhong Wang, Yongjie Hou, Chenggong Huang, Yuxuan Du, Dacheng Tao, Min Jiang

专题命中 越狱攻击 :alignment(abstract)

AI总结 通过模态补偿赋予分子语言几何感知能力,利用 SMILES 实现高通量量子哈密顿量预测,提高计算效率与数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 1 篇

2601.15528 2026-01-23 cs.DC cs.CR 50%

Securing LLM-as-a-Service for Small Businesses: An Industry Case Study of a Distributed Chatbot Deployment Platform

为中小企业保障LLM即服务的安全性:一个分布式聊天机器人部署平台的行业案例研究

Jiazhu Xie, Bowen Li, Heyu Fu, Chong Gao, Ziqi Xu, Fengling Han

专题命中 提示注入 :prompt injection(abstract)

AI总结 本文提出一个开源多租户平台,帮助中小企业低成本安全部署定制LLM聊天机器人,通过分布式集群和加密网络实现资源池化与隔离,同时集成防提示注入攻击机制。

Comments Accepted by AISC 2026

Journal ref Australasian Information Security Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 4 篇

2601.12471 2026-01-23 cs.CL cs.AI 73%

Knowing When to Abstain: Medical LLMs Under Clinical Uncertainty

知何时退避:医疗大语言模型在临床不确定性中的表现

Sravanthi Machcha, Sushrita Yerra, Sahil Gupta, Aishwarya Sahoo, Sharmin Sultana, Hong Yu, Zonghai Yao

机构 * Manning College of Information and Computer Sciences, UMass Amherst, MA, USA(马萨诸塞大学阿姆赫斯特曼宁信息与计算机科学学院) Center for Healthcare Organization and Implementation Research, VA Bedford Health Care(医疗组织与实施研究中心) Miner School of Computer and Information Sciences, UMass Lowell, MA, USA(米纳尔计算机与信息科学学院)

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MedAbstain基准,探讨医疗LLM在临床不确定性中的退避能力,发现显式退避选项能显著提升安全性,而模型规模和提示方法效果有限。

Comments Equal contribution for the first two authors; To appear in proceedings of the Main Conference of the European Chapter of the Association for Computational Linguistics (EACL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15745 2026-01-23 cs.CL 57%

Hallucination Mitigating for Medical Report Generation

缓解医疗报告生成中的幻觉

Ruoqing Zhao, Runze Xia, Piji Li

机构 * College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) MIIT Key Laboratory of Pattern Analysis and Machine Intelligence(信息产业部模式分析与机器智能重点实验室) The Key Laboratory of Brain-Machine Intelligence Technology, Ministry of Education(教育部脑机智能技术重点实验室)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 KERM框架通过知识检索、净化模块和细粒度奖励,有效缓解医疗报告生成中的幻觉问题,提升报告质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15707 2026-01-23 cs.RO 50%

D-Optimality-Guided Reinforcement Learning for Efficient Open-Loop Calibration of a 3-DOF Ankle Rehabilitation Robot

基于D-最优性的强化学习用于3-自由度踝关节康复机器人高效开环校准

Qifan Hu, Branko Celler, Weidong Mu, Steven W. Su

机构 * Affiliated Provincial Hospital, Shandong First Medical University(山东第一医科大学附属省立医院) Faculty of Engineering, University of New South Wales(新南威尔士大学工程学院) Faculty of Engineering and IT, University of Technology Sydney(悉尼大学技术与信息工程学院)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出基于D-最优性的强化学习方法,用于高效校准三自由度踝关节康复机器人,提升校准效率和参数估计的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25856 2026-01-23 cs.CV 50%

PatchEAD: Unifying Industrial Visual Prompting Frameworks for Patch-Exclusive Anomaly Detection

PatchEAD: 统一工业视觉提示框架用于补丁专属异常检测

Po-Han Huang, Jeng-Lin Li, Po-Hsuan Huang, Ming-Ching Chang, Wei-Chao Chen

机构 * Inventec Corporation(Inventec公司) University at Albany, State University of New York(纽约州立大学阿尔巴尼分校)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 PatchEAD提出统一的补丁聚焦框架,实现无需训练的工业异常检测,兼容多种基础模型并提升补丁相似性鲁棒性。

Comments 10 pages, 5 figures. WACV 2026 (Accepted)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 17 篇

2601.15714 2026-01-23 cs.LG cs.AI cs.CL 85%

Even GPT-5.2 Can't Count to Five: The Case for Zero-Error Horizons in Trustworthy LLMs

即使GPT-5.2也无法数到五:可信大语言模型中的零误差视野案例

Ryoma Sato

机构 * National Institute of Informatics(国家信息研究所)

专题命中 安全评测 :trustworthy(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出零误差视野(ZEH)用于评估可信大语言模型的无错误解决范围,通过分析GPT-5.2和Qwen2.5发现其在简单任务上的错误,揭示算法能力的涌现特性,并提出降低计算成本的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13137 2026-01-23 cs.CL 79%

Adversarial Alignment: Ensuring Value Consistency in Large Language Models for Sensitive Domains

对抗对齐:确保大型语言模型在敏感领域中的价值一致性

Yuan Gao, Zhigang Liu, Xinyu Yao, Bo Chen, Xiaobing Zhao

机构 * School of Information Engineering, Minzu University of China(中国民族大学信息工程学院) National Language Resource Monitoring and Research Center of Minority Languages(少数民族语言资源监测与研究中心)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出对抗对齐框架,通过持续预训练、指令微调和对抗训练提升大型语言模型在敏感领域中的价值一致性,实验表明其优于现有主流模型。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15211 2026-01-23 cs.AI stat.AP 79%

Embracing Ambiguity: Bayesian Nonparametrics and Stakeholder Participation for Ambiguity-Aware Safety Evaluation

拥抱模糊性:基于贝叶斯非参数方法和利益相关者参与的模糊性感知安全评估

Yanan Long

专题命中 安全评测 :safety(title);trustworthy(abstract);分类 cs.AI

AI总结 本文提出了一种基于贝叶斯非参数方法和利益相关者参与的框架,用于模糊性感知的安全评估,通过量化尾部风险和整合利益相关者偏好提升生成模型的可信度。

Comments AAAI 2026 workshop MURE

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15706 2026-01-23 cs.AI 70%

Improving Methodologies for LLM Evaluations Across Global Languages

提升跨全球语言的LLM评估方法

Akriti Vij, Benjamin Chua, Darshini Ramiah, En Qi Ng, Mahran Morsidi, Naga Nikshith Gangarapu, Sharmini Johnson, Vanessa Wilfred, Vikneswaran Kumaran, Wan Sie Lee, Wenzhuo Yang, Yongsen Zheng, Bill Black, Boming Xia, Frank Sun, Hao Zhang, Qinghua Lu, Suyu Ma, Yue Liu, Chi-kiu Lo, Fatemeh Azadi, Isar Nejadgholi, Sowmya Vajjala, Agnes Delaborde, Nicolas Rolin, Tom Seimandi, Akiko Murakami, Haruto Ishi, Satoshi Sekine, Takayuki Semitsu, Tasuku Sasaki, Angela Kinuthia, Jean Wangari, Michael Michie, Stephanie Kasaon, Hankyul Baek, Jaewon Noh, Kihyuk Nam, Sang Seo, Sungpil Shin, Taewhi Lee, Yongsu Kim, Daisy Newbold-Harrop, Jessica Wang, Mahmoud Ghanem, Vy Hong

专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本研究通过多语言评估活动,探讨了不同语言环境下LLM安全行为的差异,并提出了改进多语言安全评估的方法论建议。

Comments Author names have been organised by country, and in alphabetical order within countries

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15429 2026-01-23 cs.CL 70%

Domain-Specific Knowledge Graphs in RAG-Enhanced Healthcare LLMs

在增强医疗LLM中的领域特定知识图谱

Sydney Anuyah, Mehedi Mahmud Kaushik, Hao Dai, Rakesh Shiradkar, Arjan Durresi, Sunandan Chakraborty

机构 * Luddy School of Informatics, Computing, and Engineering, Indiana University, Indianapolis, IN, USA(信息学、计算与工程学院,印第安纳大学,印第安纳波利斯,IN,USA) School of Medicine, Indiana University, Indianapolis, IN, USA(医学学院,印第安纳大学,印第安纳波利斯,IN,USA) Department of Biomedical Engineering and Informatics, Indiana University, Indianapolis, IN, USA(生物医学工程与信息学系,印第安纳大学,印第安纳波利斯,IN,USA)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL

AI总结 该研究探讨了在医疗LLM中利用领域特定知识图谱提升检索增强生成的效果,发现精准匹配的图谱检索优于随意联合,且模型大小和温度对性能影响各异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05867 2026-01-23 cs.CR cs.CL 70%

Can LLM Infer Risk Information From MCP Server System Logs?

LLM能否从MCP服务器系统日志中推断风险信息?

Jiayi Fu, Yuansen Zhang, Yinggui Wang

机构 * Southern University of Science and Technology(南方科技大学)

专题命中 安全评测 :safety(abstract);prompt injection(abstract);分类 cs.CL

AI总结 本文提出首个评估LLM从MCP服务器系统日志中识别安全风险的合成基准,通过训练不同模型展示强化学习在提升LLM安全性能中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15511 2026-01-23 cs.CL cs.CY 62%

AdversaRiskQA: An Adversarial Factuality Benchmark for High-Risk Domains

AdversaRiskQA: 面向高风险领域的对抗事实性基准

Adam Szelestey, Sofie van Engelen, Tianhao Huang, Justin Snelders, Qintao Zeng, Songgaojun Deng

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 AdversaRiskQA是一个面向高风险领域的对抗事实性基准,通过评估LLM在不同领域和难度下的事实性表现,揭示模型弱点并提升高风险应用的可靠性。

Comments 13 pages, 4 figures, and 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15816 2026-01-23 eess.SY cs.AI cs.SY 57%

Virtual Traffic Police: Large Language Model-Augmented Traffic Signal Control for Unforeseen Incidents

虚拟交通警察:基于大语言模型的交通信号控制用于突发事件

Shiqi Wei, Qiqing Wang, Kaidi Yang

机构 * Department of Civil and Environmental Engineering, National University of Singapore(环境与土木工程系,新加坡国立大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出一种基于大语言模型的交通信号控制框架,通过虚拟交通警察代理实时调整信号控制器参数,提升应对突发事件的效率和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15721 2026-01-23 cs.IR cs.AI 57%

CoNRec: Context-Discerning Negative Recommendation with LLMs

CoNRec:基于大语言模型的上下文辨识负向推荐

Xinda Chen, Jiawei Wu, Yishuang Liu, Jialin Zhu, Shuwen Xiao, Junjun Zheng, Xiangheng Kong, Yuning Jiang

机构 * Alibaba Inc.(阿里巴巴公司) Fudan University(复旦大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 CoNRec提出了一种基于大语言模型的负向反馈建模框架,通过上下文辨识模块和渐进式训练方法,提升对用户负向偏好的建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15558 2026-01-23 cs.CL 57%

From Generation to Collaboration: Using LLMs to Edit for Empathy in Healthcare

从生成到协作:利用LLMs编辑以增强医疗中的同理心

Man Luo, Bahareh Harandizadeh, Amara Tariq, Halim Abbas, Umar Ghaffar, Christopher J Warren, Segun O. Kolade, Haidar M. Abdul-Muhsin

机构 * Science team(科学团队) Abridge Mayo Clinic(梅奥诊所) Department of AI & Informatics(人工智能与信息学部门) Urology Department(泌尿科部门)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 本研究利用LLMs作为编辑工具,通过优化医生书面回应增强医疗中的同理心,同时保持事实准确性,提出新的评估指标并验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15533 2026-01-23 cs.AI 57%

From Generative Engines to Actionable Simulators: The Imperative of Physical Grounding in World Models

从生成引擎到可操作模拟器:世界模型中物理基础的必要性

Zhikang Chen, Tingting Zhu

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出将世界模型重新定义为可操作模拟器,强调因果结构和约束意识,以提升医疗决策中的反事实推理和长期预见能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15476 2026-01-23 cs.AI cs.PF 57%

Reliability by design: quantifying and eliminating fabrication risk in LLMs. From generative to consultative AI: a comparative analysis in the legal domain and lessons for high-stakes knowledge bases

可靠性设计:量化并消除大语言模型中的制造风险。从生成式到咨询式AI:法律领域中的比较分析及对高风险知识库的启示

Alex Dantart

机构 * Humanizing Internet

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出通过减少幻觉提升大语言模型在法律领域的可靠性,引入两种可靠性指标,并展示先进的 RAG 系统有效降低伪造事实率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24257 2026-01-23 cs.CR cs.LG 57%

VeriLLM: A Lightweight Framework for Publicly Verifiable Decentralized Inference

VeriLLM:一种轻量级的公开可验证去中心化推理框架

Ke Wang, Zishuo Zhao, Xinyuan Song, Zelin Li, Libin Xia, Chris Tong, Bill Shi, Wenjie Qu, Eric Yang, Lynn Ai

机构 * University of Illinois Urbana-Champaign, Gradient(伊利诺伊大学厄巴纳-香槟分校,Gradient) Emory University(埃默里大学) Ohio State University(俄亥俄州立大学) Peking University(北京大学) National University of Singapore(新加坡国立大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 VeriLLM通过轻量级经验重跑和链上检查实现公开可验证的去中心化LLM推理,提高效率与安全性,减少验证成本。

Comments 18 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17914 2026-01-23 cs.CL 57%

Vision-Language Models Align with Human Neural Representations in Concept Processing

视觉-语言模型在概念处理中与人类神经表征对齐

Anna Bavaresco, Marianne de Heer Kloots, Sandro Pezzelle, Raquel Fernández

机构 * Institute for Logic, Language and Computation University of Amsterdam(逻辑、语言与计算研究所 阿姆斯特丹大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本研究发现视觉-语言模型在概念处理中能与人类神经表征对齐,揭示了不同架构在脑部响应中的差异。

Comments Accepted to EACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15780 2026-01-23 cs.CV 50%

Assessing Situational and Spatial Awareness of VLMs with Synthetically Generated Video

通过合成视频评估VLMs的情境与空间意识

Pascal Benschop, Justin Dauwels, Jan van Gemert

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出一个合成基准,评估VLMs在区分暴力与无害活动、跨视角角色绑定及细粒度轨迹对齐方面的性能,发现其表现仅略高于随机水平,且稳定颜色线索仅部分缓解了问题。

详情

展开后加载摘要…

URL PDF HTML 收藏