arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-15 至 2025-12-15 共收录 3 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 3 篇

2511.06682 2025-12-15 cs.CL cs.AI 89%

Textual Self-attention Network: Test-Time Preference Optimization through Textual Gradient-based Attention

文本自注意力网络:通过基于文本的梯度注意力进行测试时偏好优化

Shibing Mo, Haoyang Ruan, Kai Wu, Jing Liu

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出TSAN,一种无需参数更新的测试时偏好优化方法,通过文本梯度空间实现多候选响应的系统分析与综合,提升输出质量。

Comments AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07606 2025-12-15 cs.RO 67%

In-situ Value-aligned Human-Robot Interactions with Physical Constraints

原位价值对齐的人机交互与物理约束

Hongtao Li, Ziyuan Jiao, Xiaofeng Liu, Hangxin Liu, Zilong Zheng

机构 * College of Artificial Intelligence and Automation, Hohai University(人工智能与自动化学院,河海大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract)

AI总结 本研究提出结合人类偏好与物理约束的框架,通过ICLHF方法实现任务计划生成与约束平衡,提升人机交互的效率与适应性。

Comments 8 pages, 7 figures. Accepted by IROS 2025

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13171 2025-12-15 cs.RO cs.AI 57%

Aligning Humans and Robots via Reinforcement Learning from Implicit Human Feedback

通过隐式人类反馈进行人与机器人对齐的强化学习

Suzie Kim, Hye-Bin Shin, Seong-Whan Lee

机构 * Department of Artificial Intelligence, Korea University(人工智能系,韩国大学) Department of Brain and Cognitive Engineering, Korea University(脑科学与认知工程系,韩国大学)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI

AI总结 通过隐式人类反馈的强化学习方法,利用脑电图信号提升机器人与人类的对齐能力。

Comments Accepted to IEEE Int. Conf. Syst., Man, Cybern. (SMC) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏