Cyber-Attack Technique Classification Using Two-Stage Trained Large Language Models
专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.LG
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.LG
专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.AI
Comments Accepted to EMNLP 2024. The model and data are uploaded to \url{https://github.com/ritaranx/BMRetriever}
Journal ref EMNLP 2024
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)
Comments First Authors: Ritik Sachin Parkar and Jaehyung Kim | Second Author: Jong Inn Park | PI: Dongyeop Kang
专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.AI
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)
专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.AI
专题命中 预训练与数据 :LLM(title);large language model(abstract,comments);language model(abstract,comments);分类 cs.CL、cs.AI
Comments Accepted as AAAI-24 Oral paper; Knowledge Base Question Answering; Large Language Model; Data Generation; Few-Shot & Zero-Shot
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)
专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.AI
Comments Work in progress
专题命中 预训练与数据 :language model(title);pretraining(title);分类 cs.CL、cs.AI
Comments Accepted in SemEval2020. 7 pages, 4 figures
DiaScriber:面向多说话人场景的联合说话人 diarization(语音分割)与转录的语音大语言模型
专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);pretraining(abstract)
AI总结 本研究提出基于Qwen3.5-Omni的端到端多说话人 diarization与转录模型DiaScriber,通过构建多样数据流程与三阶段训练策略,在多说话人场景测试集上性能优于对比方法且泛化能力出色。
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);prompting(abstract)
Comments 5 pages,3 figures, 1 table, CVPR DriveX workshop
Journal ref DriveX Workshop at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026
GigaBrain-0.7:采用三系统架构扩展具身基础模型以获得涌现能力
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);post-training(abstract)
AI总结 研究针对VLA模型泛化不足问题,提出三系统架构的GigaBrain-0.7具身基础模型,扩展至37000小时异质具身数据,实现零样本等能力显著提升,将开源代码与权重。
Comments https://gigaai.cc/blog/gigabrain07
合成角色预训练:从零开始的对齐
机构 * EPFL(洛桑联邦理工学院) ; University of Toronto(多伦多大学) ; Northeastern University(东北大学) ; SJTU(上海交通大学) ; Saarland University(萨尔大学) ; Hereon(亥姆霍兹极地与海洋研究中心) ; TUHH(汉堡工业大学) ; Ontocord AI(Ontocord人工智能公司) ; TUC(德累斯顿工业大学) ; DFKI(德国人工智能研究中心)
专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究提出合成角色预训练(SPP),在预训练token零阶段植入助手角色,通过标注反思、预训练及角色绑定,提升模型价值构成遵循度与鲁棒性,降低对齐错误率,证明预训练时角色干预是对齐的有效方法。
记忆还是检索:考虑RAG的缩放规律
机构 * Stanford University(斯坦福大学) ; Independent Researcher(独立研究员) ; Patronus AI ; The Ohio State University(俄亥俄州立大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究探讨了预训练知识与检索知识的平衡,提出三维缩放框架,揭示在不同模型规模和任务类型下检索的边际效用,为语言模型设计提供数据资源分配指导。
Comments Code available at https://github.com/DegenAI-Labs/RAG-Scaling-Laws
语言之前的逻辑:基于形式推导的预预训练可促进技能获取与可压缩性
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究提出Logic-PPT策略,通过形式推导预预训练语言模型,可加速技能获取、提升性能,还能增强模型可压缩性,在少用36B token时达80%准确率,33%稀疏度下匹配密集基线性能。
MonkeyOCRv2:用于文档人工智能的视觉-文本基础模型
机构 * Huazhong University of Science and Technology(华中科技大学) ; Kingsoft Office(金山办公软件)
专题命中 预训练与数据 :foundation model(title);large language model(abstract);language model(abstract);pretraining(abstract)
AI总结 研究针对主流视觉编码器难以应用于文档图像的问题,提出MonkeyOCRv2模型。通过构建大型文档图像预训练语料库及采用联合预训练策略,在多个文档分析任务中提升性能,并验证其作为视觉编码器在文档解析和理解任务中的有效性。
从业务需求到测试断言:评估大语言模型生成的预言机在实际错误上的表现
专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);pretraining(abstract)
AI总结 研究大语言模型能否从自然语言业务需求生成测试预言机,提出基于Defects4J的流程,对10个实际错误进行实验,评估预言机在与需求衍生预言机及被测系统一致性上表现,发现大语言模型有泛化但存在差异,为后续研究提供可行性参考。
保留语音到文本LLM能力的语音到语音生成
机构 * Microsoft(微软)
专题命中 预训练与数据 :LLM(title,title_cn)
AI总结 提出PRIME-Speech框架,通过冻结骨干网络并仅训练语音生成模块,在保持语音到文本性能的同时实现高质量语音到语音转换,支持多轮对话。
时间涌现提示用于多帧红外小目标检测中的Segment Anything
专题命中 预训练与数据 :prompting(title,abstract);foundation model(abstract);pretraining(abstract)
AI总结 提出TEP-SAM框架,通过联合建模全局运动模式和局部运动偏差,利用时间涌现线索提示SAM,实现低信噪比红外序列中小目标的精准定位与分割。
Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)
通过填充从扩散语言模型中提取训练数据
机构 * University of Waterloo(滑铁卢大学) ; KTH Royal Institute of Technology(皇家理工学院)
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出填充提取协议,利用扩散语言模型的双向去噪能力,通过任意二进制掩码参数化,揭示掩码几何形状控制提取能力,边缘条件掩码比前缀条件掩码多提取三倍逐字序列,且双向访问打开了自回归模型无法利用的通道。
Fill-in-the-Middle 预训练的记忆动态
机构 * Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系)
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过对比 FIM 与标准 LTR 预训练,研究 FIM 对逐字记忆的影响,发现 FIM 更易恢复短片段或部分匹配,而 LTR 对长精确延续置信度更高,且 FIM 训练下的逐字提取随重复次数近似线性增长。
Comments MemFM @ ICML 2026
MalwarePT:一种用于恶意软件分析的二进制级基础模型
专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);pretraining(abstract)
AI总结 本文提出MalwarePT,一种基于ModernBERT编码器的二进制级基础模型,通过预训练实现跨任务的迁移学习,提升恶意软件分析中API预测和功能分类的性能。
Comments Preprint. Under review
Video2GUI:合成大规模交互轨迹用于通用GUI代理预训练
机构 * National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(国家多媒体信息处理重点实验室,计算机科学学院,北京大学) ; The University of Hong Kong(香港大学) ; Renmin University of China(中国人民大学)
专题命中 预训练与数据 :pretraining(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出Video2GUI框架,通过自动提取互联网视频中的GUI交互轨迹,生成大规模数据集WildGUI,提升了GUI代理的泛化能力。
Comments Accepted at ICML 2026
连续扩散口语语言模型的可扩展性特性
机构 * Apple(苹果公司)
专题命中 预训练与数据 :language model(title,abstract);SLM(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究连续扩散口语语言模型在性能上的可扩展性,提出基于音素Jensen-Shannon散度的评估指标,发现其在参数规模增加时生成质量提升,但长文本连贯性仍面临挑战。
LLaMo:通过连续自回归令牌扩展预训练语言模型,实现统一的运动理解和生成
机构 * Brown University(布朗大学) ; Meta
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract)
AI总结 LLaMo通过模态特定的Transformer混合架构扩展预训练语言模型,解决运动-语言生成和理解的统一问题,实现高保真文本到运动生成和运动到文本描述。
Comments Project page: https://kunkun0w0.github.io/project/LLaMo/
简单即正义:视觉基础模型中通用可推广AIGI检测的出现
机构 * Shenzhen University(深圳大学) ; Nanchang University(南昌大学) ; University of North Texas(北得克萨斯大学)
专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);pretraining(abstract)
AI总结 本文提出通过简单线性分类器在现代视觉基础模型冻结特征上训练,实现超越专门检测器的AIGI检测性能,尤其在真实世界数据集上表现更优。
你的VFM说话植物吗?面向物体检测的视觉基础模型的植物语法
机构 * University of California, Davis(加州大学戴维斯分校)
专题命中 预训练与数据 :foundation model(title,abstract);LLM(abstract);prompting(abstract)
AI总结 本文提出系统提示优化框架,评估四个开放词汇检测器在合成和真实农田图像中对豆科植物花和豆荚的检测性能,发现提示结构对不同模型响应各异,通过模型特定的组合提示显著提升检测精度。
PoC-Adapt: 基于语义的自动漏洞重现与LLM多智能体及强化学习驱动的自适应策略
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文提出PoC-Adapt框架,通过语义运行时验证和自适应策略学习,提升漏洞重现的可靠性并降低生成成本,实验表明其在CWE-Bench-Java和PrimeVul基准上验证可靠性和效率提升显著。
Comments 16 pages, abstracted and meta updated
大型语言模型如何帮助区域CPI预测:一种基于大型语言模型的深度面板建模框架
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文提出一种结合大型语言模型分析和社会媒体叙述的深度面板建模框架,通过构建大规模叙述语料库和微调BERT模型生成高频LLM诱导替代品,提升区域CPI预测精度。