arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-23 至 2025-12-23 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 5 篇

2507.04453 2025-12-23 cs.LG 83%

ESSA: Evolutionary Strategies for Scalable Alignment

ESSA:可扩展对齐的进化策略

Daria Korotyshova, Boris Shaposhnikov, Alexey Malakhov, Alexey Khokhulin, Nikita Surnachev, Kirill Ovcharenko, George Bredis, Alexey Gorbatovski, Viacheslav Sinii, Daniil Gavrilov

机构 * T-Tech

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.LG

AI总结 ESSA通过进化策略实现大规模LLM对齐,无需梯度优化,提升模型准确率并减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19632 2025-12-23 cs.CV 71%

Generative diffusion models for agricultural AI: plant image generation, indoor-to-outdoor translation, and expert preference alignment

生成扩散模型在农业AI中的应用:植物图像生成、室内外转换以及专家偏好对齐

Da Tan, Michael Beck, Christopher P. Bidinosti, Robert H. Gulden, Christopher J. Henry

机构 * University of Manitoba(曼尼托巴大学) University of Winnipeg(温哥华大学)

专题命中 偏好对齐 :alignment(title)

AI总结 本文提出基于扩散模型的生成方法,通过合成植物图像、室内外转换和专家偏好对齐,提升农业AI的数据效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11712 2025-12-23 cs.AI 70%

Mitigating Hallucination Through Theory-Consistent Symmetric Multimodal Preference Optimization

通过理论一致的对称多模态偏好优化缓解幻觉

Wenqi Liu, Xuemeng Song, Jiaxi Li, Yinwei Wei, Na Zheng, Jianhua Yin, Liqiang Nie

机构 * Shandong University(山东大学) Southern University of Science and Technology(南方科技大学) University of Georgia(佐治亚大学) National University of Singapore(新加坡国立大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.AI

AI总结 SymMPO通过理论一致的对称多模态偏好优化方法,有效缓解多模态大语言模型中的幻觉问题。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18014 2025-12-23 cs.CL cs.AI cs.LG 67%

ReGal: A First Look at PPO-based Legal AI for Judgment Prediction and Summarization in India

ReGal:基于PPO的法律AI在印度判决预测和摘要中的初步探索

Shubham Kumar Nigam, Tanuj Tyagi, Siddharth Shukla, Aditya Kumar Guru, Balaramamahanthi Deepak Patnaik, Danush Khanna, Noel Shallum, Kripabandhu Ghosh, Arnab Bhattacharya

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ReGal通过PPO结合多任务指令微调与强化学习,探索法律AI在印度判决预测和摘要中的应用,揭示了强化学习在法律文本中的挑战与潜力。

Comments Accepted in AILaw @ AAAI 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19479 2025-12-23 cs.CV 50%

Emotion-Director: Bridging Affective Shortcut in Emotion-Oriented Image Generation

情绪导演:在情绪导向图像生成中弥合情感捷径

Guoli Jia, Junyao Hu, Xinwei Long, Kai Tian, Kaiyan Zhang, KaiKai Zhao, Ning Ding, Bowen Zhou

机构 * Tsinghua University(清华大学) The Hong Kong Polytechnic University(香港理工大学) China Unicom(中国联合通信) Shanghai Artificial Intelligence Lab(上海人工智能实验室)

专题命中 偏好对齐 :DPO(abstract)

AI总结 Emotion-Director通过跨模态协作框架,结合MC-Diffusion和MC-Agent,提升情绪导向图像生成的准确性和表现力。

详情

展开后加载摘要…

URL PDF HTML 收藏