arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-25 至 2025-12-25 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 6 篇

2502.00903 2025-12-25 cs.CL cs.AI cs.CY cs.SI 67%

Embracing Dialectic Intersubjectivity: Coordination of Different Perspectives in Content Analysis with LLM Persona Simulation

拥抱辩证的主体间性:利用LLM人格模拟协调内容分析中的不同视角

Taewoo Kang, Kjerstin Thorson, Tai-Quan Peng, Dan Hiaeshutter-Rice, Sanguk Lee, Stuart Soroka

机构 * Department of Media and Information(媒体与信息系) Michigan State University(密歇根州立大学) College of Liberal Arts(人文学院) Colorado State University(科罗拉多州立大学) Department of Communication(传播系) Department of Advertising and Public Relations(广告与公共关系系) Department of Communication Studies(传播学系) Texas Christian University(德克萨斯 Christian 大学) Departments of Communication and Political Science(传播与政治学系) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文通过LLM人格模拟协调内容分析中的不同视角,探讨了党派偏见对编码结果的影响,并提升了AI驱动的社会科学研究的严谨性。

Journal ref Social Science Computer Review, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14582 2025-12-25 cs.CL 57%

Can Pruning Improve Reasoning? Revisiting Long-CoT Compression with Capability in Mind for Better Reasoning

剪枝能否提升推理?基于能力对齐的Long-Cot压缩以获得更好的推理

Shangziqi Zhao, Jiahao Yuan, Jinyang Wu, Zhenglin Wang, Guisong Yang, Usman Naseem

机构 * XJTU(西安交通大学) ECNU(华东师范大学) THU(清华大学) SEU(上海师范大学) USST(上海师范大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出Prune-on-Logic框架,通过结构感知剪枝提升Long-CoT推理效率,发现验证剪枝在保持准确性的同时减少令牌使用,揭示剪枝与模型容量对齐的重要性。

Comments 19 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20623 2025-12-25 cs.AI 57%

BitRL-Light: 1-bit LLM Agents with Deep Reinforcement Learning for Energy-Efficient Smart Home Lighting Optimization

BitRL-Light: 1位LLM代理结合深度强化学习用于节能智能家庭照明优化

Ravi Gupta, Shabista Haider

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 BitRL-Light利用1位量化LLM与深度强化学习,在边缘设备上实现智能家庭照明优化,达到显著能耗降低和高用户满意度。

Comments Presented as poster in IPCCC 2025 at Austin

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21045 2025-12-25 math.HO 50%

Synthetic Fluency and Epistemic Offloading in Undergraduate Mathematics in the Age of AI

人工智能时代本科生数学中的合成流畅性与认知卸载

Siyuan Wang, Qing Xia, Qiong Ye

专题命中 其他安全 :alignment(abstract)

AI总结 本研究探讨了AI时代本科生数学学习中认知卸载现象,发现作业与考试表现的对齐性下降,揭示了评估实践需重新思考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21028 2025-12-25 cs.SE 50%

Artificial or Just Artful? Do LLMs Bend the Rules in Programming?

人工还是艺术?LLMs在编程中是否会打破规则?

Oussama Ben Sghaier, Kevin Delcourt, Houari Sahraoui

专题命中 其他安全 :alignment(abstract)

AI总结 本文研究了LLMs在不同提示条件下如何调整代码生成策略,发现测试可见性显著影响性能,测试驱动的细化成为主要适应策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20892 2025-12-25 cs.CV 50%

Beyond Weight Adaptation: Feature-Space Domain Injection for Cross-Modal Ship Re-Identification

超越权重适应:基于特征空间的域注入用于跨模态船舶重识别

Tingfeng Xian, Wenlve Zhou, Zhiheng Zhou, Zhelin Li

机构 * School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息学院) Key Laboratory of Big Data and Intelligent Robot, Ministry of Education, South China University of Technology(大数据与智能机器人教育部重点实验室)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出基于特征空间的域注入方法,解决跨模态船舶重识别中的模态差异问题,通过轻量级模型提升性能,实现SOTA效果。

详情

展开后加载摘要…

URL PDF HTML 收藏