arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Massachusetts Institute of Technology(麻省理工学院)

2026-08-26 至 2026-08-26 共收录 2
2512.12895 2026-08-26 cs.LG 版本更新

Wait, Wait, Wait... Why Do Reasoning Models Loop?

等等,等等,等等……为什么推理模型会循环?

Charilaos Pipis, Shivam Garg, Vasilis Kontonis, Vaishnavi Shrivastava, Akshay Krishnamurthy, Dimitris Papailiopoulos

机构 * MIT(麻省理工学院) Microsoft Research(微软研究院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 研究揭示了推理模型循环的原因,指出学习中的错误是关键因素,并提出温度调节和训练干预可减少循环现象。

Comments Published as Spotlight at ICML 2026. Code: this https URL (https://github.com/microsoft/llm-looping)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17538 2026-08-26 cs.CV 版本更新

Three-Stream Temporal-Shift Attention Network Based on Self-Knowledge Distillation for Micro-Expression Recognition

基于自知识蒸馏的三流时域移位注意力网络用于微表情识别

Guanghao Zhu, Lin Liu, Yuhao Hu, Haixin Sun, Fang Liu, Xiaohui Du, Ruqian Hao, Juanxiu Liu, Yong Liu, Jing Zhang

机构 * MOEMIL Laboratory, School of Optoelectronic Science and Engineering, University of Electronic Science and Technology of China, Chengdu, 611731, China(电子科学与技术大学光电科学与工程学院) School of Optoelectronic Science and Engineering, University of Electronic Science and Technology of China(电子科学与技术大学光电科学与工程学院) UESTC-MIT Joint Institute of Intelligent Microtechnique, Yibin, 644000, China(UESTC-MIT智能微技术联合研究所)

AI总结 该研究针对微表情强度低、公开数据集规模小的问题,提出基于自知识蒸馏的三流时域移位注意力网络,经5个公开微表情数据集验证,性能优于现有方法且达到新的最优。

详情

展开后加载摘要…

URL PDF HTML 收藏