Participatory Moral AI Is Not Neutral: The Invisible Hand of Developers
参与式道德人工智能并非中立:开发者的隐形之手
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
AI总结 该研究发现,道德AI偏好征集流程中的特征范围、投票者构成、问题措辞三项关键选择会显著影响AI决策,仅靠投票汇总无法实现公平透明的AI,需对流程各阶段审计披露。
Comments 35 pages, 11 Figures
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
参与式道德人工智能并非中立:开发者的隐形之手
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
AI总结 该研究发现,道德AI偏好征集流程中的特征范围、投票者构成、问题措辞三项关键选择会显著影响AI决策,仅靠投票汇总无法实现公平透明的AI,需对流程各阶段审计披露。
Comments 35 pages, 11 Figures
基于视觉语言模型的图像传输个性化数字语义通信
专题命中 偏好对齐 :alignment(abstract)
AI总结 针对现有语义通信方案忽略接收端依赖语义的问题,提出整合VLM与LDM的PDSC框架,构建容量受限的个性化语义率失真问题,实验证实其在带宽受限场景下的源语义一致性与个性化表现优于CDDM、MoS等基线。
Comments Accepted by IEEE GLOBECOM 2026
AI安全训练数据集中的语言特定缺口
专题命中 安全训练 :safety(title,abstract);AI safety(title);jailbreak(abstract);分类 cs.CY、cs.LG
AI总结 该研究审计多语言AI安全训练数据集的语言缺口,发现其与资源层级不完全相关,豪萨语翻译质量未达阈值,非洲语言缺乏特定危害类别覆盖,提出切片级审计方法及建议。
Tripwire:通过统计验证的安全神经元触发对齐后的拒绝行为
专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI
AI总结 本文提出无需训练的Tripwire防御方法,通过统计验证安全神经元触发对齐拒绝,将攻击成功率降至最高2.0%,MT-Bench实用性下降仅0.5%-5.3%,为最优防御之一。
条件 regime 验证:安全分类器适配与监控的正确性估计
专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出 Regime-Conditional Verification(RCV),通过轻量级封装器适配安全分类器,在不重新训练的情况下提升策略遵守度,可检测分布偏移并仅在必要时微调,在多分类器、数据集及部署场景中表现优异。
Comments 16 pages including technical appendix, 6 figures
智能体事务:面向ACID兼容的智能体系统
专题命中 安全训练 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究提出ACID兼容的智能体事务框架,开发对应数据智能体,在基准测试中较含Claude Code的现有智能体提升10.6%,为构建可信可扩展AI智能体开辟新方向。
通过危险信息合成包络确保城市移动中的安全物理人工智能
机构 * Xortech DOO
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 针对异构机器人城市部署的安全挑战,提出结合危险分析与运行时执行的统一框架,通过跨层安全转换保障物理AI的城市移动安全。
Comments The 2026 International Conference on Control, Robotics Engineering and Technology (CRET 2026), https://www.cret.net/
微调Qwen3-27B实现C到Rust代码翻译:预训练、调试感知监督微调与任务特定监督微调的三阶段课程
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本研究针对C到Rust代码翻译任务,对Qwen3-27B采用三阶段微调课程,结合SACTOR框架评估后,其性能优于基线模型及其他LLM。
PROVE:基于可验证证据的无训练提示词恢复
专题命中 越狱攻击 :alignment(abstract)
AI总结 该研究提出无训练的黑盒提示词反转攻击PROVE,通过可验证场景描述重建提示词,在多数据集上优于基线方法,可用于版权保护相关研究。
Agentao:面向使用工具的大语言模型智能体的受管控本地优先运行时
机构 * The Third Research Institute of the Ministry of Public Security(公安部第三研究所) ; Bureau of Science and Technology Information Ministry of Public Security of the People’s Republic of China(中华人民共和国公安部科技信息局) ; School of Information and Cyber Security People’s Public Security University of China(中国人民公安大学信息与网络安全学院)
专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.AI
AI总结 针对工具使用型LLM智能体的安全管控需求,提出Agentao运行时,通过分层架构分离动作提案与授权执行,将权限等构建为显式抽象,提升智能体可管控性与可检查性。
Comments The code is publicly available at Github. We are conducting testing and analysis of this framework, and will provide experimental results and examples in future versions
放大并不意味着具有预测性:思考模型中的推理行为
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Stanford University(斯坦福大学)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究揭示思考模型存在“放大-提升差距”,即面向推理的训练放大了与正确性关联弱的推理行为,却未放大高提升值的关键行为,推动了过程级推理目标的研究。
Comments Published in COLM 2026
代理验证的大语言用户体验微模拟:一种用于早期决策支持的工件优先协议
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI
AI总结 该研究提出代理验证的LLM驱动UX微模拟流程,通过代理语料库验证模拟结果,结合多指标对比基线、消融实验分析智能体策略,提供可复现的早期UX决策支持方案。
Comments 27 pages, 5 figures, 15 tables
AlignFace:具有可解释概念关系的人类对齐人脸相似度度量
专题命中 隐私与版权 :alignment(abstract);分类 cs.AI
AI总结 本研究针对人脸生成模型评估中现有度量未实现认知对齐的问题,提出AlignFace度量,结合VLM、CA、CBM、GAM等技术,利用FACETS数据集,提升了与人类亚群感知的对齐度。
Comments 10 pages, 10 figures, 2 tables, ACM MM 26
面向健康与福祉的移动及可穿戴传感器融合对话智能体设计
专题命中 隐私与版权 :safety(abstract)
AI总结 本教程面向健康领域,旨在教授参与者使用WSDWAS工具,将可穿戴传感器数据与LLM驱动的对话智能体结合,实现从被动监测到可操作福祉对话的转变。
Comments 6 pages, 3 figures. Accepted as a Tutorial at the 28th International Conference on Mobile Human-Computer Interaction (MobileHCI '26)
Journal ref In 28th International Conference on Mobile Human-Computer Interaction (MobileHCI '26), August 31-September 03, 2026, Swansea, United Kingdom
人类与人工智能——促进可信且可理解的协作
专题命中 安全评测 :trustworthy(title)
AI总结 该研究围绕人类与AI的可信可理解协作,通过在线调查分析12个可解释性与可控性相关方面,发现二者受普遍重视但意见分散,受个人视角等多因素影响。
Comments Comments: 19 pages, dual-language (English and German)
MINT:一种用于交易数据的通用零样本预测器
机构 * Visa Inc.(维萨公司)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 该研究提出通用零样本预测框架MINT,通过轻量级嵌入注入等技术连接交易序列编码器与LLM,在交易预测问答任务中性能领先且资源消耗更低,证实紧凑交易嵌入更具优势。
面向基于原则的监管的LLM作为评判者的四轴可信度基准
专题命中 安全评测 :分类 cs.CL、cs.AI、cs.CY;trustworthy(comments)
AI总结 本文提出面向基于原则监管的LLM评判者的四轴可信度基准,发布Principle-Bench并引入Ceca评估器,发现无方法在所有四轴占优,部署级LLM评判者需报告对抗性欺骗与事后校准等指标。
Comments 7 pages, 3 figures. Accepted at the KDD 2026 Workshop on Secure and Trustworthy Large Language Models (SeT-LLM), poster
AgentRewind:面向长 horizon LLM 智能体的可恢复执行框架
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 AgentRewind 是面向长周期 LLM 智能体的运行时恢复框架,通过记录检查点支持状态回退,结合自建基准 MettleBench 实验,可提升智能体任务成功率与清单进度。
Comments 19 pages, 5 figures
Polaris:用于对话式企业分析的多智能体系统
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 该研究提出名为Polaris的多智能体框架,通过动态任务协调(DTC)层与ReAct风格智能体结合,实现对话式企业分析,在结构化企业数据集上验证了其高语义保真度与答案相关性,为大规模可信端到端商业智能提供了新方案。
语言模型能否理解毫米波数据?基于毫米波雷达的人类理解任务对大语言模型进行基准测试
机构 * DGIST(大邱庆北科学技术院) ; KAIST(韩国科学技术院) ; InnoCORE LLM
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 本研究针对毫米波数据与大语言模型融合的研究空白,构建首个毫米波人类感知基准mmWave-QA,评估LLMs在该任务上的零样本推理潜力与视觉退化下的鲁棒性,为相关研究奠定基础。
Comments Accepted to CVPR 2026 Findings
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026
基于内容的游戏玩法视频旁白:利用视觉语言模型
机构 * University of Washington(华盛顿大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 该研究提出一种基于内容的游戏玩法视频旁白系统,利用视觉语言模型等技术生成电竞风格解说,无需游戏专用工具,支持本地化语音,还发布了可复现基线。
Comments https://mathewvarghese.space/ai-powered-game-commentary-auto-narrating-gameplay-videos-with-gpt-4o/
手术内窥镜视频的时间视觉语言模型的鲁棒性研究
机构 * Indian Institute of Technology Delhi(印度理工学院德里分校) ; Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) ; Birmingham City University(伯明翰城市大学) ; University Hospitals Birmingham(伯明翰大学医院) ; Khalifa University(哈利法大学) ; German Cancer Research Center (DKFZ)(德国癌症研究中心)
专题命中 安全评测 :alignment(abstract)
AI总结 该研究针对手术内窥镜视频的时间视觉语言模型,构建Endo-C6基准测试其鲁棒性,提出RobustEndoCLIP,可提升模型在内窥镜损坏下的性能与鲁棒性。
Comments Accepted to MICCAI 2026
超越简化:用于阅读障碍友好型教育文本中保真视觉可访问性的DFT-GEN
专题命中 安全评测 :safety(abstract)
AI总结 本研究针对阅读障碍人群的教育文本,提出DFT-GEN框架,通过专属可访问性层兼顾信息保真与视觉可访问性,在双语考试条目上取得显著效果。
Comments Preprint. Code available at https://github.com/MorrisYUJQ/DFT-GEN
用于多智能体自主飞行器避障的时间屏障框架
专题命中 安全评测 :safety(abstract)
AI总结 该研究针对多自主飞行器避障问题,提出对抗性碰撞时间嵌入控制屏障函数的aTTC-CBF方法,经仿真验证其在提升航路点推进速度的同时降低了碰撞率。
PPOM:用于基于CLIP的通用视觉-语言提示调优的补丁网格相位边缘化
机构 * Shanghai University(上海大学) ; University of Technology Sydney(悉尼科技大学)
专题命中 AI治理与伦理 :alignment(abstract)
AI总结 本研究针对基于CLIP的视觉-语言提示调优对补丁网格对齐敏感的问题,提出无训练的PPOM算子,通过边缘化相位偏移提升宿主性能,无需重新训练。
CForce:通过一致性强制提升扩散大语言模型(dLLMs)的并行解码性能
机构 * Shanghai Jiao Tong University(上海交通大学) ; Ant Group(蚂蚁集团)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出CForce方法,通过一致性强制提升dLLMs的并行解码性能,在LLaDA模型上实验证实其在高并行解码预算下可优化速度-质量权衡。
通过激活引导剪枝实现跨模型规模的无训练知识迁移
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出激活剪枝融合框架APM,通过激活引导选择源模型的显著组件并注入目标模型,无需训练和显式语义对齐,在16个基准上将3B目标模型平均准确率从55.5%提升至60.6%。
Comments 9 pages, 3 figures, and 7 tables
MedMix:模态异质性下的专业化一致联邦稀疏混合专家模型
机构 * KAIST(韩国科学技术院) ; NTU Singapore(新加坡南洋理工大学)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 针对联邦多模态医疗AI的客户端与样本级模态异质性问题,提出MedMix框架,通过模态上下文感知路由、共识引导路由对齐与客户端自适应专家聚合,在多模态医疗数据集上取得最优平均F1值,严重异质性下提升显著。
MedPlex:用于临床基础医学分割的深度视觉-语言协同适配
机构 * Wayne State University(韦恩州立大学) ; Henry Ford Health(亨利福特医疗集团) ; Institute for AI and Data Science Wayne State University(韦恩州立大学人工智能与数据科学研究院)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 MedPlex是一种端到端VLM框架,通过双向融合和两级概念对齐,实现医学图像分割的视觉-语言协同适配,在CT、MR的多类医学分割任务中达到最优性能。
Comments Accepted By BMVC-2026
脓毒症治疗的依从性如何?一种专家指导的神经符号管道用于生成临床依从性见解
机构 * The University of Alabama(阿拉巴马大学)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 该研究针对脓毒症治疗依从性验证问题,提出专家指导的神经符号管道,结合大语言模型语义规范化与Sugeno模糊推理系统,在MIMIC-IV数据集上揭示了抗生素时机等关键依从性问题及相关临床差异。
Comments This has been submitted and accepted in NeSy 2026 (https://2026.nesyconf.org/)