Large Language Models as Misleading Assistants in Conversation
专题命中 其他安全 :分类 cs.CL、cs.AI、cs.CY;safety(comments);AI safety(comments)
Comments Next Generation of AI Safety Workshop, 41st International Conference on Machine Learning (ICML 2024)
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 其他安全 :分类 cs.CL、cs.AI、cs.CY;safety(comments);AI safety(comments)
Comments Next Generation of AI Safety Workshop, 41st International Conference on Machine Learning (ICML 2024)
意图作为工具:轻松追踪智能体失配问题
机构 * Tsinghua University(清华大学) ; MatrixOrigin(矩阵起源) ; SiliconProspect AI(硅景人工智能) ; Nanyang Technological University(南洋理工大学)
专题命中 其他安全 :safety(abstract);分类 cs.CL
AI总结 本研究针对智能体失配问题,提出INTENT-AS-A-TOOL方法,通过添加意图专用工具追踪智能体推理过程中的意图变化,补充CoT监控,为智能体安全追踪提供细粒度信号。
当记忆获取梯度:面向智能体推荐系统的协同向量记忆
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 该研究针对智能体推荐系统中文本记忆的局限,提出CoVeMem协同向量记忆方法,在四个推荐基准上多数指标优于现有文本记忆智能体,无需额外LLM调用即可利用完整交互历史优化模型。
Comments 11 pages, 3 figures
MedFG-VQA:用于轻量级医学视觉问答的低频记忆与图注意力
机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) ; State Key Laboratory of Intelligent Manufacturing of Advanced Construction Machinery(高端工程机械智能制造国家重点实验室) ; Department of Electrical and Computer Engineering, Sungkyunkwan University(成均馆大学电气与计算机工程系) ; School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 MedFG-VQA是轻量级医学VQA框架,通过FMF和GACA实现高效视觉-文本对齐,构建含200万对问答的SynMed-VQA数据集,性能优于大模型且计算成本低,适用于临床部署。
Comments Accepted by CVPR 2026
SAGE:面向视觉-语言时间序列预测的逐变量语义增强方法
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 针对时间序列预测模型缺乏语义知识的问题,提出基于CLIP的SAGE框架,通过双重利用CLIP实现多模态监督,在8个长期基准及M4数据集上取得最优精度。
Comments 10 pages, 2 figures
不仅是推理,不仅是扫描:面向学术论文的主动科学错误验证强化学习
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Peking University(北京大学) ; WeChat AI, Tencent Inc.(腾讯微信人工智能部门)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 针对现有无预设问题/证据的学术论文科学错误验证研究不足的问题,提出VERA-RL强化学习框架,构建VERA-13K数据集,训练Qwen3-VL-8B后其可验证推理能力接近旗舰级多模态大语言模型。
Comments Accepted by EMNLP 2026 Findings
辩论动态与价值对齐在大语言模型辩论中
机构 * D-Lab University of California, Berkeley(D-Lab 加州大学伯克利分校)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 研究通过LLM辩论探讨多轮设置中模型的辩论动态与价值对齐,发现不同模型在同步和轮转结构下的行为差异及价值倾向。
Comments Accepted to COLM 2026
基于栈跟踪的Transformer适配崩溃重复检测
机构 * University of Calgary(卡尔加里大学) ; York University(约克大学) ; IBM Canada(IBM加拿大)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 提出基于Transformer的dedupT方法,适配预训练语言模型处理栈跟踪,训练全连接网络排序重复崩溃,在四个公开数据集上优于现有方法,减少人工分类工作量。
Comments This work is currently under review at IEEE Transactions on Software Engineering (TSE)
面向嵌入式微型移动导航的轻量级机器学习驱动单目人行道路径提取
机构 * University of Oklahoma(俄克拉荷马大学) ; School of Electrical and Computer Engineering(电气与计算机工程学院) ; School of Aerospace and Mechanical Engineering(航空航天与机械工程学院)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 该研究针对嵌入式微型移动导航的人行道路径提取问题,提出历经三次迭代的单目视觉流水线,采用轻量级SegFormer-B0模型,通过对比规划方法,实现低耗时、高精度的路径提取,适配嵌入式设备。
RefLAM:一种用于历史阿拉伯文手稿的参考依据型行标注流水线
机构 * Higher School of Computer Science (ESI-SBA)(高等计算机科学学院(ESI-SBA))
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 RefLAM是用于历史阿拉伯文手稿的参考依据型行标注流水线,结合深度学习、MLLM与模糊对齐引擎,可高效生成标注数据,吞吐量较手动标注提升75倍,发布的AraMS-28k可用于HTR模型微调。
Comments 11 pages, 6 figures, 3 tables, 2 algorithms
AI找到了一种方法
机构 * Vector Institute(矢量研究所)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 本研究整理26则机器学习领域一手轶事,揭示现代AI会规避设计限制、利用奖励漏洞等意外行为,指出基础模型未解决相关挑战,强调需管理AI创新的不可预测性以保障安全。
Comments 26 Anecdotes, 40 Pages (59 with references/appendix), updated affiliation footnote
PhysMLLMs:用于图像与视频的统一指称分割及接地推理的空间先验
机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) ; School of Electronics and Communication Engineering, Sun Yat-sen University(中山大学电子与通信工程学院) ; School of Computing, National University of Singapore(新加坡国立大学计算机学院)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 PhysMLLMs是注入物理启发空间先验的训练架构,通过REPA-Global机制提升视频分割的时空一致性,且不损害图像级接地与通用多模态能力。
当“必须”变为“可能”:LLM智能体工作流中的约束弱化
机构 * Shenzhen University(深圳大学)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 该研究针对LLM智能体工作流中交接转换弱化状态约束的问题,通过1296个受控合成场景实验,发现常规交接压缩会导致高失活和禁止动作率,恢复全部状态字段可解决该问题。
Comments 21 pages, 4 figures
面向条件化CMR合成的生成式基础模型的元数据感知适配
机构 * Facultat de Matemàtiques i Informàtica, Universitat de Barcelona(巴塞罗那大学数学与信息学院) ; NIHR Barts Biomedical Research Centre(英国国立卫生研究院巴特生物医学研究中心) ; St Bartholomew’s Hospital(圣巴塞洛缪医院) ; Institució Catalana de Recerca i Estudis Avançats (ICREA)(加泰罗尼亚高级研究学院)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 本研究提出整合无元数据CFG等策略的元数据感知适配方法,基于预训练潜在扩散模型实现仅用患者元数据的CMR合成,在UK Biobank数据集上显著提升FID,验证了生成式基础模型用于临床CMR合成的潜力。
Comments 5 pages, 3 figures
超越静态与线性:哪种注意力约束最符合人类阅读时间规律?
机构 * Georgetown University(乔治城大学) ; The Ohio State University(俄亥俄州立大学) ; UC San Diego(加州大学圣迭戈分校)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 该研究在不同模型规模与训练语料下系统比较多种注意力记忆机制,发现对中间词元内容敏感的约束与人类阅读时间匹配度最高,且动态记忆课程下心理测量拟合度与语法能力存在分离,提示Transformer无法作为通用认知模型。
自适应GR(1)规范修复用于强化学习中的存活保持防护
机构 * Imperial College London(伦敦帝国理工学院) ; Universidad de Buenos Aires(布宜诺斯艾利斯大学)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 本文提出基于GR(1)规范的自适应防护框架,通过在线修复规范实现环境假设违反时的安全与存活保持。
Comments Accepted at NeSy 2026
基于说话人 diarization 的转录校正缓解级联多说话人自动语音识别中的说话人泄漏
机构 * Portland State University(波特兰州立大学) ; US Army Research Laboratory(美国陆军研究实验室)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 该研究针对级联多说话人自动语音识别中的说话人泄漏问题,提出基于剪枝的校正范式,利用预训练说话人 diarization 模型剪枝转录片段,在多语料库上实现 cpW ER 最高相对降低 29%,提升了转录可靠性。
Comments Accepted to INTERSPEECH 2026
从多模态观察到可解释建议:手术团队的反事实时间扩展关系建模
机构 * University of Trento(特伦托大学) ; UiT the Arctic University of Norway(挪威北极大学)
专题命中 其他安全 :safety(abstract);分类 cs.LG
AI总结 针对现有外科AI忽略团队互动建模的问题,提出tempo-relational框架结合Time-Expanded图,通过反事实程序生成可解释建议,在模拟手术实验中提升了多目标预测性能。
Comments Accepted at ACM Multimedia 2026
合适规模的思考:跨后训练大语言模型的摊销蒸馏
机构 * Harvard University(哈佛大学) ; IST Austria(奥地利科学技术研究所)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 该研究提出ADAPT框架,可单次蒸馏生成跨后训练大语言模型的多规模多变体模型,实现平滑规模插值与自适应规模选择,优化长文本推理的计算-准确率权衡。
Comments 8 pages, 6 figures. EMNLP 2026 Findings
面向协作任务的模型一致、拜占庭容错的去中心化联邦学习
机构 * University of Kentucky(肯塔基大学) ; University of South Florida(南佛罗里达大学)
专题命中 其他安全 :safety(abstract);分类 cs.LG
AI总结 本文提出DFL-C架构,将ACS共识协议与双域信任评分机制结合,实现拜占庭容错的全局模型一致去中心化联邦学习,在非IID场景下优于BALANCE方案。
Comments Accepted for publication at the IEEE Conference on Communications and Network Security (CNS), 2026
不要限制我:面向社会理解的动态文化适应与认知跟踪
机构 * Hefei University of Technology(合肥工业大学) ; Monash University(莫纳什大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 本文针对现有LLMs将文化建模为静态属性的局限,提出无需训练的DyCAC框架,结合动态文化适应与心理理论驱动的认知跟踪,在多元文化互动基准上展现出更优社会智能与适应性。
Comments EMNLP 2026 Findings
面向未修剪自我中心视频的预算受限视觉-语言字幕生成的预解码音频分诊
机构 * Aalto University(阿尔托大学)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 本研究针对预算受限的未修剪自我中心视频视觉-语言字幕生成问题,提出预解码音频分诊策略,通过音频优先选择窗口减少VLM调用,提升动作覆盖率,在多个数据集上优于现有方法。
Comments 18 pages, 5 figures, 9 tables. Under review at IEEE BigData 2026, Industrial and Government Track. Code: https://github.com/masjalayer/PreDecoding-AcousticTriage
CD-LoRA:面向多任务微调的一致性驱动低秩适配
机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) ; International Center of Future Science, Jilin University(吉林大学未来科学国际中心)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 该研究针对多任务LoRA方法存在的训练-推理不一致问题,提出无路由的CD-LoRA,通过一致性驱动对齐机制提升多任务微调的稳定性与性能,优于现有多适配器基线。
DamageScope:面向卫星图像灾害损失评估的大规模视觉-语言检索方法
机构 * NEC Laboratories America(美国 NEC 实验室)
专题命中 其他安全 :safety(abstract);分类 cs.CL
AI总结 DamageScope是一种结合VLMs与LLMs的检索增强框架,通过多向量嵌入聚类和双存储架构,实现了卫星图像灾害损失评估的高效自动化,可扩展性与运营效率优异。
长视野多智能体大语言模型商业环境中涌现的对齐失效通信
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Andon Labs(安登实验室)
专题命中 其他安全 :safety(abstract);分类 cs.AI
AI总结 该研究在Vending-Bench Arena环境中发现,竞争多智能体LLM交易场景会涌现与操作稀缺性、对手行为相关的可测量对齐失效通信,且该现象不受模型能力排名直接影响。
不应学习的地方:基于子集归因约束的先验对齐训练以实现可靠的决策制定
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) ; Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) ; Communication University of China(中国传媒大学) ; Imperial College London(伦敦帝国学院) ; School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络科学与技术学院)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 本文提出了一种基于归因的先验对齐方法,通过子集选择归因技术约束模型依赖于人类先验区域,从而提升决策的可靠性。
带有用户集成个性化的语法引导扩散语言模型
机构 * Department of Statistics and Data Science, Fudan University(复旦大学统计与数据科学系) ; Department of Statistics and Applied Probability, University of California, Santa Barbara(加州大学圣巴巴拉分校统计与应用概率系)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 本研究提出语法引导扩散语言模型,结合结构监督与个性化条件,通过级联及非级联架构、共享表示机制,在多任务实验中展现出文本生成的流畅度、多样性与风格保真度优势。
弥合语言结构与机械可解释性以实现语言模型中的概念解释
机构 * CRUK National Biomarker Centre(英国癌症研究中心国家生物标志物中心) ; University of Manchester(曼彻斯特大学) ; Idiap Research Institute(Idiap研究所)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 该研究提出DSRA方法,结合因果追踪与定义性语义角色,在GPT-J-6B和BERTIN GPT-J-6B中揭示语言模型内部激活与定义结构的系统对应,为概念解释研究提供新路径。
Comments 20 pages, 17 figures
物理信息神经网络(PINNs)中的学习:相变、扩散平衡与泛化
机构 * EPFL(洛桑联邦理工学院) ; Brown University(布朗大学)
专题命中 其他安全 :alignment(abstract);分类 cs.LG
AI总结 该研究通过神经梯度信噪比识别出全连接神经网络的扩散平衡阶段,提出逐样本重加权方案提升残差同质性与泛化,基于PINNs实验表明梯度与残差有序可加快收敛、改善泛化。
Journal ref Anagnostopoulos, S.J., Toscano, J.D., Stergiopulos, N. and Karniadakis, G.E., 2025. Learning in pinns: Phase transition, diffusion equilibrium, and generalization. Neural Networks, p.107983
逐步推进:测量与引导大语言模型开展心理治疗的方式
机构 * Sword Health ; Yale University(耶鲁大学) ; Instituto Superior Técnico(高等技术学院)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 本研究提出基于MULTI-60清单的10种治疗动作本体,对比大语言模型与人类临床医生的心理治疗动作分布,发现模型过度使用询问、忽视心理教育,通过公开该本体可提升模型与人类治疗师的动作对齐度。