Beyond Sycophancy: Structured Resistance and Compliance in LLM Moral Reasoning
超越谄媚:大语言模型道德推理中的结构化抵抗与顺从
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 研究大语言模型道德推理中超越谄媚的结构化抵抗与顺从,通过三项研究揭示其判断修正沿与人类社会心理学现象平行的三个维度结构化,为区分建设性信念修正与谄媚顺从提供原则基础,助力道德交互更好对齐。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
超越谄媚:大语言模型道德推理中的结构化抵抗与顺从
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 研究大语言模型道德推理中超越谄媚的结构化抵抗与顺从,通过三项研究揭示其判断修正沿与人类社会心理学现象平行的三个维度结构化,为区分建设性信念修正与谄媚顺从提供原则基础,助力道德交互更好对齐。
相同危险目标,相反建议:直接暴露与多智能体调解
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 研究通过测试发现,语言模型直接面对危险目标和经智能体转换传递指令时表现不同,存在行为反向转变及组合安全漏洞,高性能模型可用于特定自动化工作流程的用户端组件,却未明确其内部机制。
Comments 21 pages; welcome comments
用于指令微调的统一道德价值数据集
机构 * RWTH Aachen(亚琛工业大学) ; University of Bonn(波恩大学) ; Lamarr Institute for Machine Learning and Artificial Intelligence(拉玛尔机器学习与人工智能研究所)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 针对大语言模型与人类价值观对齐问题,构建统一道德价值数据集用于指令微调,通过合并现有数据集并转换格式而成,实验表明其结合通用任务数据集训练可保持性能,为对齐研究提供资源。
Comments Accepted at the 4th International Workshop on Value Engineering in AI (VALE 2026), co-located with IJCAI-ECAI 2026
注意力退化、功能令牌锚定以及基于注意力的大语言模型干预的局限性
机构 * London Metropolitan University(伦敦城市大学) ; Islington College(伊斯灵顿学院) ; Kathmandu University(加德满都大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 研究探讨大语言模型中注意力退化问题,通过六个实验刻画其模式及功能令牌锚定特点,测试干预机制效果,发现平均注意力退化多为描述性,功能令牌作用于隐藏状态计算,为可解释性方法及推理优化提供启示。
Comments 19 pages, 2 figures, 10 tables
用于Ex-Fuzzy库的可解释模糊规则基回归扩展
专题命中 其他安全 :safety(abstract);分类 cs.LG
AI总结 研究针对安全关键等领域机器学习模型需可解释性的问题,为Ex-Fuzzy库提出回归扩展,采用基于模糊C均值聚类的目标感知分区初始化策略,在十个数据集上评估,高斯分区表现优,提供了透明且有竞争力的黑盒回归替代方案。
Journal ref IEEE International Conference on Fuzzy Systems (FUZZ-IEEE), IEEE World Congress on Computational Intelligence (WCCI), 2026
机器自我报告的双过程理论
专题命中 其他安全 :safety(abstract);分类 cs.CL
AI总结 研究针对语言模型自我报告缺乏有效方式的问题,提出双过程理论,通过角色设定和归因门控反映自我报告结构。经量表操作化及测试,发现训练后维度变化,表明其非固定属性,为语言模型自我报告研究提供新理论与方法。
机制很重要:知识图谱何时有助于强化学习
专题命中 其他安全 :safety(abstract);分类 cs.LG
AI总结 研究探讨知识图谱对强化学习的影响,通过对照研究改变任务、机制和质量,发现结构化KG在特定任务上提升样本效率,其价值与知识量有关,安全性取决于机制,为从业者使用KG指导RL提供具体指导。
D3VL:利用语言模型从3D时间序列数据和视频中理解驾驶场景
机构 * Bradley Department of Electrical and Computer Engineering, Virginia Tech(弗吉尼亚理工大学布拉德利电气与计算机工程系) ; Virginia Tech Transportation Institute(弗吉尼亚理工大学交通研究所) ; Sanghani Center for Artificial Intelligence and Data Analytics(桑哈尼人工智能与数据分析中心)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 本文针对自动驾驶中多模态大语言模型,提出D3VL框架,整合2D和3D时间序列数据,回答交通场景相关问题,在KITTI问答数据集上性能提升11%,并引入Waymo QA数据集扩展以评估模型在多样驾驶条件下处理3D和时间序列数据的能力。
Comments Accepted to IEEE IV 2026
大语言模型提出的问题正确吗?评估GPT生成的调查问卷作为衡量社会态度的工具
专题命中 其他安全 :alignment(abstract);分类 cs.CY
AI总结 研究对比GPT生成的调查问卷和既定调查基线在三个社会领域的情况,发现GPT生成的问卷与人工设计工具能捕捉相同主要态度划分,但有差异,适合探索性和大规模分析,可补充专家设计工具。
OntoBook:用于医学编码器预训练的基于本体的合成教科书
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 研究提出OntoBook方法,将医学本体结构转为预训练信号,经随机游走、大语言模型重述等三阶段,用生成文本训练法语编码器,在多基准测试中有显著改进,强调目标对齐必要,还发布了相关教科书与模型检查点。
Journal ref Proceedings of Knowledge Graphs and Large Language Models Workshop, May 2026, Palma de Mallorca, Spain
用于跨语言立场检测的基于理由引导的知识蒸馏
机构 * School of Foreign Studies, Hefei University of Technology(合肥工业大学外国语学院) ; School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院) ; Hefei Institute of Technology(合肥学院)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 针对跨语言立场检测中现有方法忽视推理过程及大语言模型存在局限性的问题,提出基于理由引导的知识蒸馏框架,用思维链提示引导大语言模型生成理由并提炼知识至学生模型,设计双路径蒸馏机制及对比学习策略,实验证明该方法优于基线。
Comments 23 pages, 7 figures, 3 tables
MAGE:通过智能多模态推理实现类人宏布局
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 研究针对工业物理设计流程中宏布局需大量人工优化的问题,提出MAGE框架。该框架通过多模态多智能体实现宏布局优化,结合多种规则与检查,引入量化类人性指标。实验表明其相比商业工具及基线有显著提升,且能转移到新布局设置。
Comments 16 pages
重新思考异构语言模型合并:加权模型平均视角
机构 * University of Science and Technology of China(中国科学技术大学) ; School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 研究异构语言模型合并问题,通过无训练的维度适配和比率控制插值,在联合式与交叉式合并中进行实验,结果表明简单参数平均结合轻量级适配和比率控制是强大基线,揭示直接加权融合的限制及对复杂方法的制约。
Comments 17 pages, 3 figures, 20 tables, preprint
用于预训练模型微调的自动编码器压缩并行分割学习
机构 * Eindhoven University of Technology(埃因霍温理工大学)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 针对资源受限边缘设备上大规模基础模型分布式微调的局限,提出AE-PSL框架,利用轻量级自动编码器压缩中间激活值和梯度,并引入两阶段对齐机制,提升通信效率与模型兼容性。
Comments Accepted to ECML-PKDD 2026, 4th Workshop on Advancements in Federated Learning (WAFL)
AlphaOracle:通过受人工工作流程启发的深度学习进行甲骨文破译
机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) ; School of Electronic Information Engineering, South China University of Technology(华南理工大学电子信息学院) ; Key Laboratory of Oracle Bone Inscriptions Information Processing, Anyang Normal University(安阳师范学院甲骨文信息处理重点实验室)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 针对约3000个未破译甲骨文字符的问题,提出受人工工作流程启发的AlphaOracle框架,经多阶段管道进行甲骨文破译,与专家解读高度一致,还能减少分析时间,为甲骨文及其他未破译文字研究提供参考。
Comments Accepted by The Innovation 2026
Journal ref The Innovation 7(11), 101462, 2026
机器学习中的表征概念:超越柏拉图与亚里士多德
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 探讨机器学习中表征概念,随着模型发展其从工程领域转向心理表征领域。评估《柏拉图式表征假说》中关于不同AI模型表征属性趋同由现实统一结构驱动的说法,借助心灵哲学观点审视,阐明关键、解释不足并给出研究方向。
Comments 8 pages. Accepted for oral presentation at ICML 2026
SurvCF(t):预测性维护多元时间序列数据中生存分析的反事实解释
专题命中 其他安全 :safety(abstract);分类 cs.LG
AI总结 针对预测性维护多元时间序列数据的生存分析,提出SurvCF(t)框架,通过识别资产运行历史变化增加预测寿命,将解释设为约束优化问题,经多基准评估,弥合生存预测与维护差距,实现可解释决策型AI。
Comments 10 pages, 3 figures
通过虚拟传感和物理信息学习连接电池设计与健康评估
专题命中 其他安全 :safety(abstract);分类 cs.LG
AI总结 研究针对锂离子电池健康监测与设计脱节问题,提出基于虚拟传感和物理信息学习的框架,能推断设计参数,嵌入机制降低预测误差,虚拟传感减少相关误差,建立反馈回路,助力电池设计与评估。
Comments 28 pages, 7 figures
立场:解释稳定性是模型与方法对的属性,而非模型本身的属性
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 该论文指出关于解释稳定性的断言需经交叉方法验证,以胸部X光实验为例,不同模型在不同归因方法下稳定性排名反转,说明解释稳定性是模型与方法对的属性,基于解释的断言应多方法验证并明确归因算子。
Comments Accepted Position Paper at ICML 2026. https://openreview.net/forum?id=9r8sSaYhos
Journal ref Forty-third International Conference on Machine Learning Position Paper Track, 2026
PhysAgent:用于物理上合理的视频生成的反射式智能体物理控制
机构 * Shanghai Jiao Tong University(上海交通大学) ; Cardiff University(卡迪夫大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 研究物理上合理的视频生成问题,提出PhysAgent反射式智能体框架,通过闭环设计及物理控制API,改善参数控制,实现复杂轨迹等,实验证明其能生成更合理视频,有更好提示对齐及泛化效果。
Comments For project page, see https://iapple233.github.io/PhysAgent
是什么让语言表征成为人类大脑中高级视觉感知的良好模型?
机构 * European Commission, Joint Research Centre (JRC)(欧盟委员会,联合研究中心 (JRC))
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 研究语言模型图像描述对人类大脑高级视觉感知的预测性,考虑六种字幕类型和五种语言模型,发现机器生成字幕表现优,文本嵌入器优于自回归语言模型,大脑预测性和行为一致性在中间网络深度达峰值,确立字幕嵌入为研究工具。
Comments Supplementary Materials in the public GitHub repository referenced in the paper
S1-Omni:用于科学理解、预测和生成的统一多模态推理模型
机构 * ScienceOne AI(科学一号人工智能) ; Wenge AI(文阁人工智能)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 研究针对科学人工智能模型能力分散问题,提出S1-Omni统一多模态推理模型,基于科学数据统一表示、知识对齐和解码三个核心组件,经训练和评估,在多基准测试中表现出色优于同类模型,为统一科学建模提供实用路径。
SeeSE3:视觉特征中3D空间的出现
机构 * Google DeepMind(谷歌DeepMind)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 研究视觉基础模型构建的表征与3D欧几里得空间内在属性的关系,提出从拓扑和几何角度评估的探测器,发现自监督视觉模型有相关潜在子空间,并基于此提出“潜在空间导航”技术用于视觉里程计和定位。
基于时间序列机器学习的事件发生时间模型预测肌萎缩侧索硬化症进展及医疗保健利用情况
机构 * Harrison College of Pharmacy, Auburn University(奥本大学哈里森药学院) ; Fisk University(菲斯克大学) ; Lewis Katz School of Medicine, Temple University(天普大学刘易斯·卡茨医学院) ; Emory University(埃默里大学) ; Barnett College of Public Health, Temple University(天普大学巴尼特公共卫生学院)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 研究针对ALS预测临床有意义事件的挑战,开发受数字孪生启发的事件发生时间框架,整合多源数据,经聚类、建模等确定功能域及预测因素,构建TTE模型,能生成个性化生存曲线,为ALS相关决策支持提供可行方法。
用于自主无人机群搜索和救援的智能三级学习架构
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 本文针对无人机群搜索和救援提出智能三级学习架构,集成三种学习机制,通过架构契约形式化,引入群体元认知,有进展函数和主整合定理,解决了现有分层强化学习方法的五个基本限制。
Comments 9 pages
通过原子运动生成音乐驱动的舞蹈
机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所) ; School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院) ; National Institute of Health Data Science, Peking University(北京大学健康数据科学研究所) ; State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) ; Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) ; School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 研究音乐驱动的舞蹈生成问题,提出结构感知框架,将编排建模为原子运动序列,经数据分割、聚类及大语言模型处理得到原子运动注释,设计两阶段生成框架,提升舞蹈生成的结构连贯性、节奏对齐和自然度,增强可解释性与可控编辑性。
用于交通管理的成本最优基础模型部署组合
机构 * Cornell University(康奈尔大学) ; University of California, Berkeley(加州大学伯克利分校) ; The Hong Kong Polytechnic University(香港理工大学) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 研究交通管理中基础模型部署组合问题,提出FMDP混合整数规划,证明其NP难,给出多项式时间贪婪启发式算法,通过案例研究确定低成本组合,经盈亏平衡分析得出本地GPU投资合理的条件。
Comments Accepted at IEEE ITSC 2026
TRAIL:一个用于可配置人机协作实验的平台
机构 * School of Education, University of California, Irvine(加州大学伊文斯分校教育学院)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 研究人工智能队友设计属性对团队的影响,TRAIL平台将大五人格等与多种实验方法结合,在课堂部署中实现纵向链式实验、文本相似性分析等,发现不同人格代理对团队有不同影响。
美国高空晴空湍流的预测建模:一种机器学习方法
专题命中 其他安全 :safety(abstract);分类 cs.LG
AI总结 该研究利用机器学习模型,基于飞行员报告、ERA5再分析数据和飞机空气动力学参数,对美国200 - 350百帕压力水平下的高空晴空湍流进行预测建模,梯度提升算法表现最佳,强调了地理坐标等因素作用,凸显机器学习在CAT预测中的潜力。
拉瓜迪亚:基于病理学基础模型的语言引导自适应蒸馏
机构 * College of Informatics, Korea University(韩国大学信息学院)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 研究针对病理学基础模型计算成本高问题,提出拉瓜迪亚框架,通过多阶段流程,在临床语言指导下整合多模型知识,进行自适应蒸馏。实验表明其87M参数学生模型性能出色,凸显临床语言对构建高效可靠数字病理系统的作用。