Structured Prompt Optimization for Few-Shot Text Classification via Semantic Alignment in Latent Space
通过潜在空间语义对齐的结构化提示优化实现少样本文本分类
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL
AI总结 本文提出通过潜在空间语义对齐的结构化提示优化方法,解决少样本文本分类中的语义冲突和标签模糊问题,提升分类性能和跨任务适用性。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
通过潜在空间语义对齐的结构化提示优化实现少样本文本分类
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL
AI总结 本文提出通过潜在空间语义对齐的结构化提示优化方法,解决少样本文本分类中的语义冲突和标签模糊问题,提升分类性能和跨任务适用性。
ForesightSafety Bench: 面向安全人工智能的前沿风险评估与治理框架
机构 * Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院) ; Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室) ; BrainCog Lab, Institute of Automation, Chinese Academy of Sciences(脑认知实验室,中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Long-term AI(长期人工智能)
专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY
AI总结 本文提出ForesightSafety Bench框架,通过94个细化风险维度系统评估前沿AI安全风险,揭示多领域安全漏洞。
通过跨模态对齐增强CLIP鲁棒性
机构 * University of Science and Technology of China(中国科学技术大学) ; Nanyang Technological University(南洋理工大学)
专题命中 安全评测 :alignment(title,abstract)
AI总结 COLA通过跨模态对齐提升CLIP对抗鲁棒性,有效缓解对抗扰动导致的特征不一致问题,提升零样本分类性能。
Comments NeurIPS 2025 Spotlight
超越准确性:对幻觉医疗建议的风险敏感评估
机构 * ASU(亚利桑那州立大学)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种风险敏感的评估框架,用于评估医疗建议中的幻觉风险,通过量化风险性语言来识别高风险、低支撑的失败模式。
DUET:基于高效上下文化教师的蒸馏式大语言模型去学习
机构 * George Mason University(乔治·玛森大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 DUET通过结合上下文化和蒸馏方法,实现高效大语言模型去学习,提升遗忘控制与数据效率。
OPTIAGENT:一种基于物理的代理框架用于自动光学设计
机构 * Zhejiang University(浙江大学) ; INSAIT, Sofia University(INSAIT,索菲亚大学)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 OPTIAGENT通过结合LLM与物理驱动的优化方法,首次实现了无需专业光学知识即可自动设计光学系统,提升了光学设计的自动化水平和精度。
DRL-ORA: 带在线风险适应的分布式强化学习
机构 * London Business School(伦敦商学院) ; The University of Hong Kong(香港大学) ; City University of Hong Kong(城市大学)
专题命中 安全评测 :safety(abstract);分类 cs.LG
AI总结 DRL-ORA通过动态调整风险水平,在安全关键任务中提升强化学习的效率和可靠性。
统一的生成与理解模型能否在不同输出模态间保持语义等价性?
机构 * Tencent Youtu Lab(腾讯云图实验室) ; Xiamen University(厦门大学) ; Computing Lab, Department of Artificial Intelligence, School of Informatics(计算实验室,人工智能系,信息学院)
专题命中 安全评测 :alignment(abstract)
AI总结 本研究探讨统一生成与理解模型在不同输出模态间保持语义等价性的能力,发现其在视觉回答任务中存在性能下降问题,原因在于跨模态语义对齐的失效。
Comments Equal contribution by Jie Li
Q-Save:迈向生成视频评估的评分与归因
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 安全评测 :alignment(abstract)
AI总结 Q-Save提出一个统一的生成视频评估模型和数据集,通过三阶段训练策略实现质量评分与归因生成,提升AIGV质量预测的准确性和可解释性。
Comments 20 pages, 11 figures