arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-27 至 2026-08-27 共收录 46 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 6 篇

2608.24988 2026-08-27 cs.CL cs.AI cs.LG 新提交 86%

Does Fine-Tuning Undo Activation Steering? Behavioural Recovery Without Weight-Edit Reversal

微调会撤销激活引导吗?无需权重编辑反转的行为恢复

Philipp E. Glass, Allan Tucker, Yongmin Li, Alina Miron

机构 * Brunel University of London(布鲁内尔伦敦大学)

专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究语言模型嵌入的激活引导在SFT、RLHF微调后的稳定性,发现其机制耐久但功能脆弱,需下游训练后重新验证行为。

Comments Accepted at EMNLP 2026 Main. Earlier version at ICLR 2026 Re^4-Align Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25200 2026-08-27 cs.LG cs.AI cs.CL 新提交 82%

Learning Mixtures of Plackett-Luce Models for Multi-Objective Alignment

学习用于多目标对齐的Plackett-Luce模型混合

Dongyue Li, Ziniu Zhang, Lu Wang, Hongyang R. Zhang

机构 * Northeastern University(东北大学) University of Michigan(密歇根大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对异质偏好下多向排序的模型混合问题,提出MoPLEx算法,通过扩充排序并结合梯度估计与期望最大化,在偏好优化任务上显著优于基线方法。

Comments 19 pages; To appear in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24899 2026-08-27 cs.HC cs.AI cs.CY 新提交 81%

aipsy-judge: A Specialized, Psychologist-Corrected Local Judge for the Psychological Safety of Conversational AI

aipsy-judge:一种针对对话式AI心理安全性的、经心理学家校正的专用本地评判器

Michael Keeman, Anastasia Keeman

专题命中 偏好对齐 :safety(title,abstract);分类 cs.AI、cs.CY

AI总结 本研究发现LLM作为评判器评估对话式AI心理安全性存在缺陷,提出经心理学家校正的本地模型aipsy-judge-1.0,其危机检测等性能优于前沿模型,且评分更忠实、数据可本地留存。

Comments 24 pages, 3 figures, 6 tables. Model available at this https URL (https://huggingface.co/keidolabs/aipsy-judge-1.0) (Apache-2.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25350 2026-08-27 cs.LG cs.RO 新提交 70%

Beyond Pairwise Feedback: Listwise Vision-Language Supervision for Preference-Based Reward Learning

超越成对反馈:用于基于偏好的奖励学习的列表式视觉-语言监督

Srivalli Katkuri, Maxwell Kawada, Juan Wachs

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 本研究提出首个结合视觉-语言模型生成偏好与普拉科特-卢斯模型的列表式奖励学习框架,在Meta-World操纵任务中,其表现与基线相当且更灵活,最佳配置达86%平均成功率。

Comments 13 pages, 10 figures. Srivalli Katkuri and Maxwell Kawada contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25824 2026-08-27 cs.CL 新提交 57%

Localize-Then-Decide Guarantees for LLM Judgments

LLM判断的“先定位后决策”保证

Xinyu Li, Yi Zhou, Guanqun Cao, Zeyu Fu, Tianjin Huang, Gaojie Jin

机构 * University of Exeter(埃克塞特大学) Cardiff University(卡迪夫大学) University of the West of England(西英格兰大学) University of Macau(澳门大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 针对LLM作为评估者时候选响应增多导致置信度假设失效的问题,提出“先定位后决策”框架,结合共形预测与校准规则,提升保证成功率与覆盖率。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026. Code: this https URL (https://github.com/llm2409/Localize-Then-Decide)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25452 2026-08-27 cs.CV cs.AI 新提交 57%

VGA-BenchV2: An Expanded Unified Benchmark and Multi-Model Framework for Evaluating Video Aesthetics and Generation Quality

VGA-BenchV2:用于评估视频美学与生成质量的扩展统一基准及多模型框架

Longteng Jiang, DanDan Zheng, Qianqian Qiao, Heng Huang, Huaye Wang, Yihang Bo, Bao Peng, Jingdong Chen, Jun Zhou, Xin Jin

机构 * Ant Group(蚂蚁集团) Beijing Film Academy(北京电影学院) Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 该研究提出扩展的视频评估基准VGA-BenchV2,构建混合评估器架构,并将其作为奖励模型优化视频生成器,实现从基准到模型优化的闭环,提升视频的美学质量与人类偏好对齐性。

Comments IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 4 篇

2608.24889 2026-08-27 cs.AI 新提交 79%

Reliable LLM-Powered Decision Engines for Large-Scale Supply Chain Operations: Architecture, Safety, and Performance Guarantees

面向大规模供应链运营的可靠大语言模型驱动决策引擎:架构、安全性与性能保证

Nirmal Kumar Jingar

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 针对大规模供应链的不确定性等挑战,提出结合LLM与优化等的LLM-DE架构,实现更智能、安全、可扩展的供应链决策,为下一代智能供应链提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25390 2026-08-27 cs.LG cs.AI cs.CR 新提交 62%

Refusal geometry reflects refusal training: diverse refusal prefixes can raise stable rank and weaken refusal vector ablation attacks

弃权几何反映弃权训练:多样的弃权前缀可提升稳定秩并削弱弃权向量消融攻击

Andrey Labunets

机构 * UC San Diego(加州大学圣迭戈分校)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本研究以OLMo-2-0425-1B-Instruct为对象,揭示弃权几何与弃权训练的关联,发现多样弃权起始可提升梯度稳定秩,削弱弃权向量消融攻击,为提升AI模型弃权鲁棒性提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25477 2026-08-27 cs.NI cs.LG 新提交 57%

AERIS: Offline Policy Improvement for Multi-UAV Integrated Sensing and Communication

AERIS:面向多无人机集成感知与通信的离线策略改进

Ziyuan Wang, Yifan Sui, Wei Wei, Wenjie Xin, Zekai Zhang, Xiangwang Hou, Xiao-Ping (Steven) Zhang

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 针对多无人机集成感知与通信的控制问题,提出离线策略改进框架AERIS及STAR-CRDT算法,在保障安全的同时显著提升ISAC性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25091 2026-08-27 cs.AI cs.CR 新提交 57%

Auto-Policy, not Auto-Skill: Compiled Agent Skills for the Physical World

自动策略,而非自动技能:面向物理世界的编译智能体技能

Zhonghao Zhan, Hamed Haddadi

机构 * Imperial College London(帝国理工学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文针对恶意智能体技能造成物理伤害的问题,提出位于技能制品内部的类型化权限层Edge Skillguard,可高效拒绝借用权限请求,验证了其在多场景下的防护效果。

Comments Presented at the 1st Workshop on Agent Skills (Agent Skills '26), ACM CAIS 2026, San Jose, May 26, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 4 篇

2608.26008 2026-08-27 cs.CR cs.CL 新提交 83%

A Self-Evolving Multi-Agent Framework Defense against LLM Jailbreak Attacks

一种针对LLM越狱攻击的自进化多智能体框架防御方法

Tongyan Hu, Bryan Hooi

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL

AI总结 该研究针对LLM越狱攻击提出一种基于规则记忆的自进化多智能体防御框架,无需参数更新,可降低攻击成功率且保留良性效用,适用于两类LLM模型。

Comments 8 pages (main), with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25817 2026-08-27 cs.CR 新提交 75%

SkillShield: Prompt-Space Security Skills for LLM Coding Agents

SkillShield:面向LLM编码智能体的提示空间安全技能

Xiaodong Wu, Zhimin Zhao, Qi Li, Xiangman Li, Yu Shi, Bram Adams, Jianbing Ni

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 SkillShield是一种系统提示防御机制,通过离线合成安全技能注入系统提示,可有效降低LLM编码智能体的恶意软件生成成功率,在多项实验中表现优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26049 2026-08-27 cs.CR cs.AR 新提交 50%

RTLGuard: A Lightweight Teacher-Student Defense for Poisoned RTL Code Generation Models

RTLGuard:一种针对中毒RTL代码生成模型的轻量级师生防御方法

Mahshid Rezakhani, Kimia Azar, Hadi Kamali

专题命中 越狱攻击 :alignment(abstract)

AI总结 RTLGuard是一种轻量级师生防御方法,通过小规模干净教师模型、复合师生目标及特征对齐等,降低中毒RTL代码生成模型的攻击成功率,同时保留代码功能正确性与可综合性。

Comments 8 pages, 4 figures, 7 tables. Accepted at the IEEE/ACM International Conference on Computer-Aided Design (ICCAD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25697 2026-08-27 cs.CR 新提交 50%

LMSM: LLM Security Framework Inspired by Linux Security Modules

LMSM:受Linux安全模块启发的大语言模型安全框架

XiuYu Zhang, Bonan Ruan, Junfeng Fang, An Zhang, Tat-Seng Chua, Zhenkai Liang

专题命中 越狱攻击 :safety(abstract)

AI总结 该研究提出受Linux安全模块启发的LMSM框架,通过分离调解与策略实现LLM安全,在Qwen3-4B上可降低攻击成功率,同时保持较高吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与事实性 3 篇

2608.25251 2026-08-27 cs.CV cs.AI 新提交 79%

What Do Medical Vision-Language Models Learn in Radiology? Transfer, Alignment, and Source-Proxy Leakage Under Distribution Shift

医学视觉-语言模型在放射学中学到了什么?分布偏移下的迁移、对齐与源代理泄露

Ayoub Louaye Bouaziz, Lokmane Chebouba, Yassine Himeur

机构 * University of Constantine(康斯坦丁大学) University of Dubai(迪拜大学) University of Western Brittany(西布列塔尼大学)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.AI

AI总结 本研究针对医学视觉-语言模型在分布偏移下的失效问题,探究其跨数据集迁移、多模态对齐及源代理泄露特性,发现表观能力掩盖相关失效模式,推动对该类模型的压力测试评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25487 2026-08-27 cs.CL cs.IR 新提交 70%

ReliableRAG: Combating Misinformation in Retrieval-Augmented Generation via Reliability-Guided Reasoning Chains

ReliableRAG:通过可靠性引导推理链对抗检索增强生成中的错误信息

Jinpu Jiang, Xuan Wu, Wenhao Song, Bo Yang, You Zhou, Hongwei Ge, Heow Pueh Lee, Yanchun Liang, Chunguo Wu

机构 * College of Software, Jilin University(吉林大学软件学院) College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education, College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院 教育部符号计算与知识工程重点实验室) College of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院) National University of Singapore(新加坡国立大学) School of Computer Science, Zhuhai College of Science and Technology(珠海科技学院计算机学院)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL

AI总结 ReliableRAG是首个通过细粒度评估三元组缓解多跳问答中欺骗性错误信息的可靠性驱动框架,可提升RAG系统的事实可靠性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25653 2026-08-27 cs.CV 新提交 50%

Towards Purified Multi-Label Test-Time Adaptation of Vision-Language Models

面向视觉-语言模型的纯化多标签测试时自适应方法

Yiwen Liang, Hui Chen, Yizhe Xiong, Mengyao Lyu, Yuhan Cao, Zijia Lin, Shuaicheng Niu, Sicheng Zhao, Jungong Han, Guiguang Ding

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) University of Washington(华盛顿大学)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 针对视觉-语言模型多标签测试时自适应的缓存方法PuRF,通过区域与缓存纯化解决现有方法的偏差与校准问题,在五项数据集上使ViT-B/32的mAP提升4.05%,性能优于现有最优方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 隐私与版权 1 篇

2608.25727 2026-08-27 cs.LG cs.CR 新提交 57%

Are LLM-Enhanced GNNs Privacy-Safe?

增强型大型语言模型的图神经网络是否具备隐私安全性?

Longzhu He, Zelang Wen, Chaozhuo Li, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.LG

AI总结 本文通过5阶段统一框架评估LLM增强型GNNs的隐私风险,发现其隐私脆弱性高于浅层文本基线,差分隐私可部分缓解风险但会导致效用下降,凸显了该领域的隐私-效用权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 18 篇

2608.25490 2026-08-27 cs.CR cs.AI cs.MM 新提交 85%

MMJailBench: A Factorized Benchmark for Disentangling Multimodal Jailbreak Vulnerabilities

MMJailBench:用于解耦多模态越狱漏洞的因子化基准

Tianshi Wang, Jingsong Wang, Yafei Huang, Fengling Li, Xin Li, Lei Zhu

专题命中 安全评测 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 研究人员推出MMJailBench因子化基准,对16个MLLMs评估后揭示其越狱漏洞特征异质且依赖模型,明确提示框架等关键影响因素,开发出模块化多模态越狱评估套件用于高效审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25460 2026-08-27 cs.AI cs.LG 新提交 81%

Training Alignment Auditors via Reinforcement Learning

通过强化学习训练对齐审计员

Paul Rosu, Rowan Wang

机构 * Anthropic

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究用强化学习训练LLM审计员,通过成对奖励等优化提升审计质量与真实性,误报率低于1%,且审计能力可跨框架泛化。

Comments 82 pages, 15 figures. Code, prompts, and evaluation data are available at this https URL (https://github.com/paulrosu11/training-auditing-agents-public)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25429 2026-08-27 cs.AI cs.LG 新提交 81%

Distance Is Not Enough: Forget-Retain Alignment Gap Predicts LLM Relearning Robustness

距离并不足够:遗忘-保留对齐间隙可预测大语言模型的再学习鲁棒性

Yi Chen, Hanna Hsieh, Shuhong Liu, Chuanbo Hua, Zihan Ma, Kun Wang, Joo-Young Kim

机构 * The University of Tokyo(东京大学) KAIST(韩国科学技术院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出FRAG预测器,基于权重选择性而非距离,结合FRP方法提升LLM再学习鲁棒性,揭示权重选择性对鲁棒性的解释力优于单独距离。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25667 2026-08-27 cs.CR cs.AI 新提交 79%

AI Slop and Hallucinations in Vulnerability Assessment: A Survey on Reasoning Failures and Trustworthy Mitigation

漏洞评估中的AI垃圾内容与幻觉:关于推理失败及可信缓解措施的综述

Junchen Ding, Jialiang Dong, Yichen Zhu, Yi Liu, Gelei Deng, Willy Susilo, Siqi Ma, Yuekang Li

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 本综述针对LLMs用于漏洞评估时产生的AI垃圾内容与幻觉问题,分析其源于专家演绎推理与LLMs自回归生成的差距,提出神经符号验证等缓解方案及CVE-Bench等评估工具,为AI驱动的安全分诊系统提供路线图。

Comments Accepted to SiMLA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25711 2026-08-27 cs.CR 新提交 78%

Reassembling Distributed Risk: Trajectory-Conditioned Action Generation for Multi-Turn Agent Safety

重构分布式风险:面向多轮智能体安全的轨迹条件动作生成

Yanbo Dai, Zhenlan Ji, Zongjie Li, Shuai Wang

专题命中 安全评测 :safety(title,abstract)

AI总结 针对多轮分解攻击下使用工具的LLM智能体的安全风险,提出生成时防御方法ReDiR,通过轨迹级安全条件整合跨轮安全信息,将攻击成功率降至8%以下,可迁移且开销低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24937 2026-08-27 cs.LG cs.AI 新提交 73%

Multi-Modal Anomaly Detection: A Survey

多模态异常检测:一项综述

Xudong Mou, Zexin Wu, Chuan Luo, Shiru Chen, Xudong Liu, Chunming Hu, Renyu Yang

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) School of Software, Beihang University(北京航空航天大学软件学院) Shandong Inspur Intelligent Production Technology Co., Ltd(山东浪潮智能生产技术有限公司)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 该综述从假设驱动视角梳理多模态异常检测(MMAD),划分两种互补方法范式,探讨基础模型对MMAD的重塑,汇总基准与评估协议并指出未来方向。

Comments Accepted for publication in IEEE Transactions on Big Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24913 2026-08-27 cs.HC cs.SE 新提交 71%

From Blind Edits to Verified Repair: Building Trustworthy User-Side LLM Agents for Web Accessibility

从盲编辑到经验证的修复:构建可信的用户端大语言模型智能体以实现网页可访问性

Lily Bundgaard Wanscher, Markus Heidemann Lorensen, Mohammed Ammad Shafiq, Mahyar Tourchi Moghaddam, Mina Alipour

专题命中 安全评测 :trustworthy(title)

AI总结 本研究构建了用户端LLM智能体的三个核心模块,通过双条件协议诊断盲编辑的缺陷,再结合验证修复工具实现了网页可访问性的可信修复,相关资源已公开。

Comments Accepted to be presented at ICME 2026 (5-9 October, Napoli, Italy) and to be published in ICMI companion proceedings by ACM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24931 2026-08-27 eess.IV cs.AI cs.CV cs.LG 新提交 62%

Modality Contribution Score - A Per-Patient Framework for Quantifying the Relative Diagnostic Contribution of Structural MRI and Amyloid PET in Alzheimer's Disease

模态贡献分数——一种用于量化阿尔茨海默病中结构MRI与淀粉样PET相对诊断贡献的患者专属框架

Dawa Chyophel Lepcha, Aaliya Ali, Sophie A. Martin, Deepika Koundal, Pierrick Coupe, Shabbir Syed-Abdul

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出患者专属框架MCNet与MCS,量化AD中结构MRI与淀粉样PET的相对诊断贡献,在ADNI-3与OASIS-3队列中验证了其分期性能、单调梯度及跨队列泛化性,为痴呆护理可信AI奠定基础。

Comments 15 pages, 7 figures, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26105 2026-08-27 cs.CV cs.AI cs.LG cs.MM cs.RO 新提交 62%

VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning

VBVR-Pro:用于原生视觉推理的可扩展且可验证工具套件

Junxiang Xu, Ruisi Wang, Fanyi Pu, Maijunxian Wang, Ran Ji, Tongxi Zhou, Chenyang Gu, Jing Zuo, Hongcan Xiao, Yimeng Geng, Wanqi Yin, Wei Chen, Oscar Qian, Zhengan Yan, Ziqi Huang, Haiwen Diao, Liang Pan, Bo Li, Xiangyu Fan, Dezhi Luo, Fengyuan Yu, Zehong Zhao, Qingying Gao, Tinghui Zhu, Yilan Zhang, Jingqi Tong, Pinyuan Feng, Zhengze Jiang, Letian Wang, Ziyu Guo, Renrui Zhang, Jieneng Chen, Sonia Joseph, Constantin Venhoff, Saman Motamed, Mengyue Yang, Chandra Sripada, Alan Yuille, Philip Torr, Lvmin Zhang, Vikash Kumar, Daniel Khashabi, Nikolaus Kriegeskorte, Raphaël Millière, Vincent C. Müller, Anyi Rao, Quan Wang, Ziwei Liu, Dahua Lin, Lei Yang, Hokin Deng, Zhongang Cai

机构 * Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) University of California, San Diego(加州大学圣地亚哥分校) The University of Tokyo(东京大学) The Chinese University of Hong Kong(香港中文大学) University of Michigan(密歇根大学) Johns Hopkins University(约翰霍普金斯大学) University of California, Davis(加州大学戴维斯分校) University of California, Los Angeles(加州大学洛杉矶分校) Carnegie Mellon University(卡内基梅隆大学) Columbia University(哥伦比亚大学) University of Toronto(多伦多大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出VBVR-Pro,一个可扩展可验证的原生视觉推理闭环测试平台,含300个生成任务、确定性评分器及多生成器机制研究,训练模型在多视觉推理基准上迁移性强,发布全部相关资源。

Comments Homepage: this https URL (https://video-reason.com/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25569 2026-08-27 cs.CL cs.AI 新提交 62%

Controllable Affective Generation via Latent Vector Steering

基于潜在向量调控的可控情感生成

Xixian Yong, Siyuan Chang, Yingying Zhang, Xian Wu, Xiao Zhou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Tencent Jarvis Lab(腾讯Jarvis实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型对齐后情感响应平淡的问题,提出轻量框架EmoVec,通过调控潜在向量实现可控情感生成,实验验证其能提升情感显著性且保留语义等特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26000 2026-08-27 eess.SP cs.LG q-bio.QM 新提交 57%

CardioFusion-AI: Robust ECG--PPG Fusion for Multimodal Physiological Monitoring Under Signal Degradation

CardioFusion-AI:信号退化下用于多模态生理监测的鲁棒心电图-光电容积脉搏波融合方法

Navaneetha Krishnan Kamalakannan, Janakiraman Kamalakannan

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 本研究提出 CardioFusion-AI 框架,通过信号处理前端与自适应融合策略,在多模态生理信号退化场景下实现鲁棒监测,验证了其在不同退化条件下的性能表现。

Comments 7 pages, 4 figures. Under review at IEEE Journal of Biomedical and Health Informatics. Code: this https URL (https://github.com/ka-cyber/CardioFusion-AI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25561 2026-08-27 cs.CL 新提交 57%

EgoArgus: Benchmarking VLMs as Situational Assistants for Modality-Grounded User Supports

EgoArgus:将视觉语言模型(VLM)作为模态接地用户支持情境助手的基准测试

Yu-Chien Tang, Yu-Hsiang Liu, An-Zi Yen

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 研究针对当前VLMs作为日常助手的模态仲裁难题,构建人工标注数据集EgoArgus,发现现有VLMs仍难胜任该任务,且现有偏差缓解方法效果有限,为部署提供了参考。

Comments Accepted by EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏