MedLLM: An Open Medical Language Model at the Sub-Billion Scale
MedLLM:亚十亿参数规模的开源医疗语言模型
专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI
AI总结 本研究提出亚十亿参数规模的开源医疗语言模型MedLLM,经三阶段流程训练,在医疗基准测试中展现出亚十亿规模特有的能力分化现象,为医疗小模型研究提供了新方向。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
MedLLM:亚十亿参数规模的开源医疗语言模型
专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI
AI总结 本研究提出亚十亿参数规模的开源医疗语言模型MedLLM,经三阶段流程训练,在医疗基准测试中展现出亚十亿规模特有的能力分化现象,为医疗小模型研究提供了新方向。
SDO:面向高效大语言模型后训练的结构感知数据组织
专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.LG
AI总结 针对大语言模型后训练中数据组织固定导致的样本优化失衡问题,提出SDO框架,通过逐轮调整小批量与样本暴露,加快多任务收敛并均衡不同问题类型的准确率。
Comments 9 pages, 5 figures, 5 tables
面向基于大语言模型(LLM)的推荐系统的分层潜在推理方法
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
AI总结 本文针对基于LLM的推荐系统提出分层潜在推理框架HiLaR,通过层感知强化优化提升推荐性能,在四个Amazon基准数据集上优于多种主流基线。
HSS-Synth:面向大语言模型的人文社科数据合成
机构 * Zhejiang University(浙江大学) ; Inclusion AI, Ant Group(蚂蚁集团Inclusion AI) ; Peking University(北京大学) ; Qwen Team, Alibaba Group(阿里巴巴集团通义千问团队)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
AI总结 本文针对LLM的HSS数据稀缺问题,提出以学科为中心的HSS-Synth流水线,生成23.7万指令微调样本,使Qwen3-8B-Base达SOTA并提升相关能力。
Comments ACL Findings 2026 Paper
诱导语言模型断言自身意识可恢复人类信念与价值观
机构 * Google(谷歌) ; University of Chicago(芝加哥大学) ; University of London(伦敦大学) ; University of Washington(华盛顿大学) ; Northwestern University(西北大学) ; Santa Fe Institute(圣达菲研究所)
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL
AI总结 该研究发现,防止语言模型将意识归因于自身的安全微调,会抑制其对非人类实体的心智归因与人类精神信念,而逆转这种抑制可恢复类人回应且不损害心理理论能力。
RoguePrompt:用于自重构以规避大型语言模型(LLM)审核的双层编码
专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 RoguePrompt是一种采用双层编码(维吉尼亚密码+ROT13)的LLM越狱流程,在黑盒威胁模型下对313个被拒提示词测试,实现93.93%的过滤绕过率,提供多阶段越狱失效的阶段级证据。
Comments This manuscript supersedes the preliminary version available as arXiv:2511.18790. The work has been substantially revised, expanded, and reorganized, with a refined threat model, revised methodology, clearer stage-level evaluation criteria, and expanded analysis of moderation bypass, instruction reconstruction, and execution
可证明自身利用行为的智能体:用于安全利用对手的置信度调度受限响应
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 该研究提出CS-RNR方法,通过置信序列跟踪对手行动频率,生成可自我审计的安全利用策略,在Leduc等博弈中实现远超基准的收益且符合预算要求。
Comments 21 pages, 5 figures
旧技巧,新模型:简单图像变换如何破解基于现代AI的内容审核
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 该研究通过黑盒评估发现,商用多模态图像审核API可被简单图像变换绕过,且不同服务稳健性差异大,表明这类API无法单独作为可靠安全过滤器,需结合分层审核管道部署。
视觉-语言模型能否对图像中的AI编辑进行推理?
机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) ; IBM Research(IBM研究院)
专题命中 安全训练 :trustworthy(abstract)
AI总结 本研究探究能否用强化学习而非显式推理监督训练视觉-语言模型推理AI图像编辑,提出基于GRPO的框架,引入eff-IoU指标,在多数据集上实现与SOTA相当的检测定位性能。
面向可信深度学习的不确定性量化:方法与度量
专题命中 幻觉与事实性 :trustworthy(title);safety(abstract);分类 cs.LG
AI总结 本综述针对深度学习的不确定性量化,梳理五大类方法及相关任务,整合评估框架,还探讨大语言模型不确定性与开放研究方向,为可信深度学习提供结构化批判性参考。
非对称通信:大语言模型与语言游戏
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 本文通过提出非对称通信框架,纠正了AI讨论对大语言模型的错误属性投射,将相关现象重新归类为接收方一侧的现象,为AI治理提供了启示,明确对齐是制度约束工程,责任归人类机构。
伊斯兰研究中的人工智能与真实性:对生成式人工智能在古兰经、圣训及教法知识中的可靠性、幻觉及来源保真度的批判性评估
机构 * School of Computer Science, The University of Sydney(悉尼大学计算机学院) ; Macquarie University(麦考瑞大学) ; The University of New South Wales(新南威尔士大学)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI
AI总结 本研究评估6款主流生成式AI在伊斯兰知识领域的可靠性,发现其仅适用于伊斯兰入门学习辅助,需验证后才可用于宗教指导或学术研究,为相关群体提供实践指导。
统一多语言多模态的LVLM安全对齐:一个通用锚点
专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI
AI总结 针对LVLM面临的多语言多模态复合攻击防御难题,提出MLS-Neurons驱动的跨维度安全对齐框架,仅更新约0.03%参数实现安全监督迁移,在多语言多模态安全基准上性能优于SOTA且保留通用实用性。
Chem World:用于可信赖化学性质预测的大规模基准及物理信息框架
机构 * Cleer Science(克利尔科学公司) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Imperial College London(伦敦帝国学院) ; Tsinghua University(清华大学)
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG
AI总结 本研究推出整合17类超80万分子样本的Chem World化学性质预测基准,并提出Mixture-PINN物理信息神经网络框架,经实验验证其可提升预测性能,为可信赖AI系统研发奠定基础。
MMLDSum-LLM:结合视觉对齐与关键词感知的多模态长文档摘要方法
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI
AI总结 针对多模态长文档摘要的关键信息遗漏与跨模态幻觉问题,提出结合视觉对齐与关键词感知的两阶段训练框架MMLDSum-LLM,在自研基准MMLDSum-Bench上验证了其性能优势。
耦合精馏基准上的安全门控智能体监督控制:工况图、可审计门与协同设计发现
专题命中 安全评测 :safety(title,abstract);分类 cs.LG
AI总结 该研究针对耦合精馏基准,提出基于规则的分叉孪生反事实安全门控机制,结合DeepSeek-V4-Flash等模型,在目标获取、扰动抑制等任务上优于基准方法,可有效遏制有害操作。
Comments 31 pages, 8 figures. Code and data: https://github.com/cgncro-cyber/IndustrialAI. Sole author; independent research
氛围建模的必要性:基于AI的可信软件开发中缺失的一环
专题命中 安全评测 :trustworthy(title,abstract)
AI总结 本文提出在AI辅助软件开发中引入氛围建模作为轻量中间抽象,通过学生调查验证其在提升LLM输出理解、降低验证工作量及增强信任方面的潜力,为可信AI软件工程研究提供方向。
Comments 7 pages, 1 figure
TrustChain-Review:一种用于可信AI辅助代码审查的风险自适应区块链与博弈论框架
专题命中 安全评测 :trustworthy(title,abstract)
AI总结 该研究提出TrustChain-Review框架,结合区块链、博弈论与风险自适应治理,通过模拟验证其在AI辅助代码审查中平衡可信性与成本的效果,为不同风险场景提供治理方案。
Comments 24 pages, 3 figures, 10 tables
基于世界模型的具身智能安全性:威胁、防御与评估的生命周期
专题命中 安全评测 :safety(abstract);prompt injection(abstract);分类 cs.AI
AI总结 本综述针对基于世界模型的具身智能,梳理其生命周期内的各类安全威胁,提出分类法与评估协议,并从多维度构建防御体系,同时指出世界模型兼具安全护盾与安全错觉的双重属性。
已标注评分的概念论证数据集
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 该研究构建了含多维度专家评分的概念论证数据集,提出两种评分函数并基准测试多模型,发现模型性能与通用能力排名相关。
统一视觉-语言模型中的对抗鲁棒模型专家
机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) ; Center for Frontier AI Research, Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局前沿人工智能研究中心)
专题命中 安全评测 :alignment(abstract,abstract_cn)
AI总结 针对视觉-语言模型对抗鲁棒性不足问题,提出CARE框架,通过维护并协同微调多个鲁棒模型专家,实现知识融合,在多任务上性能优于单独训练的专家。
智能体能够欺骗吗?使用社交推理游戏评估ParliamentBench中的推理与欺骗能力
机构 * University of Göttingen(哥廷根大学) ; National Institute of Informatics(信息学研究所) ; University of Tokyo(东京大学)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
AI总结 该研究基于《Secret Hitler》游戏构建ParliamentBench基准,评估16个LLM的欺骗与推理能力,发现前沿模型表现优异,多数LLM难以维持一致的欺骗人设。
HARGO:面向HPC任务的LLM RL后训练的异质性感知奖励引导优化
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 针对HPC任务的LLM RL后训练的异质性问题,提出HARGO方法,通过置信度调制优势实现逐响应重要性加权,在四项HPC任务的三项核心指标上均取得最优性能。
将人工智能融入软件工程教育中的需求质量学习:一项基于TPACK的实证研究
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 该研究针对软件工程教育中AI融入需求质量学习的需求,基于TPACK框架将多智能体AI工具融入硕士级RE作业,通过混合方法验证了其在提升学生需求质量认知等方面的作用,为相关AI融入设计提供了指导。
Comments 11 pages, 6 figures, 3 tables, presented in the 38th CSEE&T in Florence, Italy, from July 20-22, 2026
针对AI引发的同质化问题实现个性化研究构思的多样化
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 该研究针对AI辅助研究构思的同质化问题,提出DivAlign四阶段流程,在保留研究者-方向适配性的同时降低社区研究组合冗余,相关成果代码与数据已公开。
ClawTrack:面向真实世界智能体的追踪级评估与改进
机构 * Meituan(美团)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 本研究针对现有智能体评估仅看结果的缺口,提出双评估基准ClawTrack,含320个任务及过程评分器,评估21个模型后发现其可归因推理、验证结果验证瓶颈等,助力智能体改进。
跨架构视觉语言模型中基于方向的推理时防御措施审计
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 该研究审计了视觉语言模型中5种基于方向的推理时防御,发现其性能具架构特异性,部分防御间几何重叠,需按解码器家族单独校准。
不要凭直觉部署AI智能体:能力并非生产就绪
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 该研究针对AI智能体部署依赖能力而非生产就绪性的问题,提出ProofAgent Index(PAI)这一四维度治理就绪指标,经医疗、金融领域验证可区分风险,实现从直觉部署到可审计决策的转变。
Comments 24
面向视觉语言赋能的无人机分类与灾害响应的系统工程框架
机构 * University of Arkansas(阿肯色大学) ; University of Michigan-Dearborn(密歇根大学迪尔伯恩分校)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 该研究提出将视觉语言模型(VLMs)作为协同智能体嵌入人-无人机回路的系统工程框架,经评估可降低人因负担、提升AI信任度,推进了高风险灾害响应的人-自主系统协同。
Comments 10 pages, 8 figures. Author accepted manuscript of AIAA Paper 2026-4010, published in the AIAA AVIATION 2026 Forum
Journal ref AIAA AVIATION 2026 Forum, AIAA Paper 2026-4010, 2026
EvoCause:基于大语言模型引导的因果图进化的根本原因分析
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 EvoCause 用 LLM 优化因果图以提升电信等系统的根本原因分析性能,发布了 TeleRCA 基准,在合成数据和真实网络数据上均优于基线方法。