arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 804 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 804 篇

2608.12911 2026-08-14 cs.CV cs.CR cs.MM 新提交 67%

Beyond Visual Evidence: Revealing and Mitigating Relational Privacy Leakage in Document MLLMs

超越视觉证据:揭示并缓解文档多模态大语言模型中的关系隐私泄露

Beining Xu, Hairui Wang, Jiaxin Wang, Changsheng Chen, Anirban Chakraborty

机构 * Faculty of Engineering, Shenzhen MSU-BIT University(深圳北理莫斯科大学工程学院) Faculty of CMC, Shenzhen MSU-BIT University(深圳北理莫斯科大学计算机、数学与力学学院) Department of CDS, Indian Institute of Science(印度科学学院计算机与数据科学系)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 本文针对文档理解MLLMs的KIE任务,揭示其在视觉证据不足时会通过记忆的字段关系泄露隐私,提出DRUF框架与DocPrivacyBench基准,实验显示DRUF可提升泄露抑制效果并维持KIE性能。

Comments ACM mm 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11142 2026-08-12 cs.CV 新提交 67%

SAR2Agri: Learning SAR Intensity Representations for Agricultural Monitoring

SAR2Agri:学习SAR强度表征用于农业监测

Moti Rattan Gupta, Anupam Sobti

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)

AI总结 本研究提出首个仅用SAR强度影像的自监督学习流水线,通过改进时间预文本任务提升物候特征捕捉能力,在SICKLE基准上的作物类型制图任务中,其IoU较光学基线和现有SAR基线均有显著提升,验证了SAR强度编码器预训练的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09474 2026-08-11 cs.CV 新提交 67%

FaLCon: Facet-Anchored Retrieval with Late Consensus for Sim2Real Text-Based Person Anomaly Search

FaLCon:用于Sim2Real基于文本的行人异常搜索的基于面锚定的后期共识检索

Hieu Dinh Trung Pham, Phuong Huu Vu Tran, Thuan Duc Mai, Son Nguyen Minh Le, Khang Le Minh, Hoang Vo, Minh-Chi Phung, Huy Minh Nhat Nguyen, Cuong Tuan Nguyen

机构 * Vietnamese-German University(越南-德国大学) Ho Chi Minh City University of Technology(胡志明市技术大学) University of Information Technology(信息技术大学) Ho Chi Minh city University of Science(胡志明市科学大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 该研究针对Sim2Real基于文本的行人异常搜索的挑战,提出FaLCon框架,结合全局匹配与细粒度验证,在PAB基准上取得优异性能,代码将开源。

Comments accepted to the ECCV 2026 AI City Challenge Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05706 2026-08-07 cs.CV 新提交 67%

LAWM-3D: Learning 3D-Aware Latent Actions from Human Videos for Generalizable Robot World Models

LAWM-3D:从人类视频中学习具有3D感知能力的潜在动作以构建可泛化的机器人世界模型

Jiarui Yang, Jiale Zhange, Jiawei Li, Hang Guo, Wen Huang, Jinpeng Wang, Peidong Liu, Shu-Tao Xia

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)

AI总结 本研究针对现有潜在动作模型缺乏3D感知能力的问题,提出LAWM-3D模型,通过多视图动作 token 化、几何对齐约束和RGB-D联合重建目标,实现了性能SOTA的机器人世界模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01449 2026-08-04 cs.DC 新提交 67%

NIXT: A NCCL Inspector Exporter Tool for Observability of Collective Communication in Large Model Training

NIXT:用于大模型训练中集合通信可观测性的NCCL检查器导出工具

Ziyang Jia, Sirshak Das, Jason Sewall, Laxmi Bhuyan, Pasha Shamis, Daniel Wong

专题命中 预训练与数据 :LLM(abstract);pretraining(abstract)

AI总结 本文提出NIXT工具,解决NCCL Inspector数据量大难以分析的问题,通过案例展示其在大模型训练中提升集合通信可观测性、定位性能问题的作用。

Comments Accepted at IEEE IISWC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26196 2026-07-30 cs.CV 新提交 67%

Rad-JEPA 3D: Radiology Joint-Embedding Predictive Model for 3D Computed Tomography

Rad-JEPA 3D:用于三维计算机断层扫描的放射学联合嵌入预测模型

Quoc-Huy Trinh, Minh-Van Nguyen, Ulas Bagci

机构 * Northwestern University(西北大学) Technical University of Denmark(丹麦技术大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract)

AI总结 Rad-JEPA 3D是用于3D CT的自监督联合嵌入预测框架,采用混合H-Mamba编码器与HSOR正则化,在12万次CT扫描预训练后,在器官识别、空间推理等任务上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25851 2026-07-29 cs.SE 新提交 67%

Rethinking Training Data for Generating Code Review Comments

重新思考用于生成代码审查评论的训练数据

Leonardo Centellas-Claros, Estefania Pakarati-Cofre, Juan Pablo Sandoval Alcocer, Diego Elias Costa

专题命中 预训练与数据 :LLM(abstract,abstract_cn)

AI总结 研究代码审查评论生成,指出尽管有进展但生成的评论存在问题,通过实证检查识别出不匹配训练对并得出分类法,探讨纳入分类法能否改善问题,发现仍有挑战,认为改进需更多举措而非仅数据集清理。

Comments Paper accepted to ICSME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23782 2026-07-28 cs.RO 新提交 67%

$N_0$-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens

$N_0$-VTLA:使用潜在触觉令牌扩展视觉-触觉-语言-动作模型

NeoteAI Team, Fudan TEAI Team

机构 * NeoteAI Team(NeoteAI团队) Fudan TEAI Team(复旦大学TEAI团队)

专题命中 预训练与数据 :foundation model(abstract);post-training(abstract)

AI总结 研究提出$N_0$-VTLA模型,基于视觉主干,通过视觉-触觉预训练、分阶段触觉路径集成和优势条件离线策略改进进行触觉集成训练。该模型在丰富接触基准测试中表现出色,为通用触觉驱动操作策略奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22334 2026-07-27 cs.LG cs.AI cs.CL 新提交 67%

Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization

基于字节前缀边缘化的跨分词器策略内蒸馏

Hao Wang, Kun Yuan, Wenlin Zhong, Minglei Zhang, Han Xiao, Ming Sun, Honggang Qi

机构 * University of Chinese Academy of Sciences(中国科学院大学) KwaiKAT Team(快手KwaiKAT团队) Zhejiang University(浙江大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究如何通过策略内蒸馏整合不同家族语言模型,提出字节前缀边缘化方法,在共享字节空间重表达教师下一个令牌分布,在数学和编程基准测试中,该方法优于现有跨分词器方法,提升了平均准确率。

Comments Project page: https://bpm-opd.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16828 2026-07-21 cs.CV 新提交 67%

UniNDM: A Unified Noise-driven Detection and Mitigation Framework Against Sexual Content in Text-to-Image Generation

UniNDM:文本到图像生成中针对性内容的统一噪声驱动检测与缓解框架

Yao Huang, Yitong Sun, Huanran Chen, Ruochen Zhang, Shouwei Ruan, Ranjie Duan, Maoxun Yuan, Yinpeng Dong, Hui Xue, Xiaochun Cao, Xingxing Wei

机构 * Institute of Artificial Intelligence, State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室人工智能研究院) College of Artificial Intelligence, Tsinghua University(清华大学人工智能学院) Security Department, Alibaba Group(阿里巴巴集团安全部) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区网络科学与技术学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 针对文本到图像生成易受隐式性提示影响的问题,提出UniNDM统一噪声驱动框架。利用早期预测噪声的可分离性开发轻量级检测器,引入噪声增强自适应负引导缓解问题,扩展到扩散变压器架构,实验显示比现有方法有显著改进。

Comments 18 pages, 10 figures, accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16680 2026-07-21 cs.SE 新提交 67%

Specification-Driven Development as the Foundation of AI-Native Enterprise Software Engineering

规范驱动开发作为人工智能原生企业软件工程的基础

Mamdouh Alenezi

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 研究大语言模型和智能人工智能推动下软件工程范式转变,介绍规范驱动开发,提出规范治理参考模型,经评估能减少安全缺陷、缩短上市时间,证明企业软件需规范治理,vibe编码适用于构思和快速原型制作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14903 2026-07-17 cs.SE 新提交 67%

FirmPilot: Evidence-Guided Multi-Agent Environment Recovery for IoT Firmware Rehosting

FirmPilot:用于物联网固件重新托管的证据引导多智能体环境恢复

Yanbing Shen, Fan Zhang, Haitao Xu

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 研究针对物联网固件重新托管管道脆弱问题,提出证据引导多智能体框架FirmPilot,通过迭代环境重建解决跨层依赖,经实验验证其能提升可达性、增加检测服务数并支持下游分析,提高了固件重新托管的成功率和效用。

Comments 11 pages, 10 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14811 2026-07-17 cs.CR 新提交 67%

Is External Database Protection Static in Retrieval-Augmented Generation? Rethinking Privacy Preservation under Dynamic Queries

检索增强生成中的外部数据库保护是静态的吗?重新思考动态查询下的隐私保护

Gang Zhang, Mingyu Tian, Xukun Luan, Yuanchi Ma, Jinyan Liu

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 研究检索增强生成中外部数据库隐私保护问题,提出Prompt-Aware动态分层差分隐私框架PA-HDP,通过风险分层评估和自适应保护,在减少隐私泄露的同时保持高检索质量,实现更好的隐私-效用权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14532 2026-07-17 cs.CY 新提交 67%

Probabilistic "Copies" in Generative AI Models

生成式人工智能模型中的概率性“复制”

Mark A. Lemley, A. Feder Cooper

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 研究探讨生成式人工智能模型中概率性“复制”问题,指出能从大语言模型提取版权作品文本,因其权重存储令牌统计关系影响概率性生成过程。版权法对此判定重要但现有法律难助力,认为可能采取功能性方法,还建议了法律变革。

Comments Forthcoming, Berkeley Technology Law Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13493 2026-07-16 cs.IR 新提交 67%

Personalizing Incremental Video Search with Hybrid Text and ID Embeddings

使用混合文本和ID嵌入个性化增量视频搜索

Vivek Kanojiya, Vishalaksh Aggarwal, Daeho Baek, Lyndon Kennedy, Xuetao Yin

专题命中 预训练与数据 :LLM(abstract,abstract_cn)

AI总结 研究针对增量视频搜索中意图不明的问题,提出结合语义与协作信号的个性化系统。通过学习文本和ID嵌入空间构建用户表示,注入相似度到排名器。实验表明离线提升了NDCG@10和MRR,在线提高了点击率、转化率和排名位置,还分析了嵌入权衡与质量。

Comments Accepted to the Industry Track of the 20th ACM Conference on Recommender Systems (RecSys 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13092 2026-07-16 cs.PL 新提交 67%

Executable JavaScript as a Checkable Specification Language: A JS-SAM Case Study on SysMoBench

可执行JavaScript作为一种可检查的规范语言:关于SysMoBench的JS-SAM案例研究

Jean-Jacques Dubray

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 研究大语言模型用不同语言为真实系统写规范的情况,以SysMoBench为平台,通过添加JS-SAM进行控制比较,涵盖多个模型和系统,发现一致性是区分模型关键,规范契约决定保真度,最小契约有转录无语义推导,将可执行JavaScript作为规范基础作案例研究。

Comments 34 pages, 9 tables, no figures. Code, trace corpora, and replication guide: https://github.com/jdubray/SysMoBench-1 (branch js-sam-tla-phase3) . Companion study on a production payment system: arXiv:2607.05076

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12524 2026-07-15 cs.CR cs.SE 新提交 67%

Open-Source Intelligence for Code Provenance and the Security Patterns that Separate Human and Large-Language-Model Implementations of Common Programming Tasks

用于代码溯源的开源情报以及区分人类和大语言模型对常见编程任务实现的安全模式

Mohammadreza Rashidi

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 研究开发者代码来源(人类答案和大语言模型输出)的差异,利用开源构建管道收集样本,训练分类器区分溯源,报告安全差异,通过案例研究发现修复情况及问题,管道数据驱动可添加新任务或语言。

Comments 25 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10993 2026-07-14 cs.CV 新提交 67%

Confidence Scores in Open-Vocabulary Detection Are a Biased Mixture of Scale and Semantics

开放词汇检测中的置信度分数是尺度和语义的有偏混合

Yi Tang Soon, Jun-Wei Hsieh

机构 * Institute of Intelligence Systems, National Yang Ming Chiao Tung University(国立阳明交通大学智能系统研究所) College of Artificial Intelligence and Green Energy, National Yang Ming Chiao Tung University(国立阳明交通大学人工智能与绿色能源学院)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)

AI总结 研究开放词汇检测中置信度分数问题,通过实验表明其是尺度和语义的有偏混合,两种偏差源于CLIP图像级预训练,阈值调整无法消除,无参数温度缩放校正可部分改善小物体召回率并揭示相关限制。

Comments ICPR Workshop 2026 (FMVA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10953 2026-07-14 cs.CV 新提交 67%

Learning Anatomy-Grounded CT Vision-Language Representations with Organ-Hierarchical Report Knowledge

利用器官分层报告知识学习基于解剖学的CT视觉语言表征

Guoliang You, Hongming Li, Yuanwang Zhang, Yong Fan

机构 * Department of Radiology, Perelman School of Medicine, University of Pennsylvania(放射科,佩尔曼医学院,宾夕法尼亚大学)

专题命中 预训练与数据 :LLM(abstract);pretraining(abstract)

AI总结 研究利用CT图像与放射学报告进行医学视觉语言预训练,提出OKA-CT框架,通过转化报告为器官条件知识,分阶段学习,在数据集上实现零样本异常诊断高AUROC,优于基线,提升报告-图像对齐。

Comments 9 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06403 2026-07-08 cs.RO 新提交 67%

From Foundation to Application: Improving VLA Models in Practice

从基础到应用:在实践中改进VLA模型

Wei Wu, Fangjing Wang, Fan Lu, He Sun, Shi Liu, Yunnan Wang, Yibin Yan, Yong Wang, Shuailei Ma, Xinyang Wang, Yibin Liu, Shuai Yang, Tianxiang Zhou, Kejia Zhang, Lei Zhou, Cheng Su, Nan Xue, Bin Tan, Han Zhang, Youchao Zhang, Fei Liao, Xing Zhu, Yujun Shen, Kecheng Zheng

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)

AI总结 针对VLA模型实验室与实际应用差距问题,提出LingBot-VLA 2.0。通过改进数据处理、扩展动作空间及预测动力学建模等方法,经GM-100基准测试验证,提升了模型跨实体长距离移动操作能力。

Comments Website: https://technology.robbyant.com/lingbot-vla-v2, Github: https://github.com/robbyant/lingbot-vla-v2, Checkpoints: https://huggingface.co/collections/robbyant/lingbot-vla-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05727 2026-07-08 cs.CV 新提交 67%

SAMPLe: SAM-based Optimizer for Prompt Learning in VLMs

SAMPLe:基于SAM的视觉语言模型提示学习优化器

Hossein Rajoli, Fatemeh Lotfi, Niloufar Alipour Talemi, Hossein Kashiani, Xiaolong Ma, Fatemeh Afghah

机构 * Clemson University(克莱姆森大学) Siemens Energy (AI Lab)(西门子能源(人工智能实验室)) University of Arizona(亚利桑那大学)

专题命中 预训练与数据 :language model(abstract);foundation model(abstract)

AI总结 研究VLM提示学习中性能与泛化的困境,提出SAMPLe优化器,通过考虑损失曲面锐度平衡探索与利用,减少过拟合,提升泛对未见能力,在多种提示学习框架中表现出色,优于现有优化器。

Comments The manuscript has been accepted to ECCV and will be presented at the conference and published in the main proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05076 2026-07-07 cs.SE cs.FL 新提交 67%

Can Code Specify a System Precisely Enough to Formally Verify It?

代码能否精确指定系统以进行形式化验证?

Jean-Jacques Dubray

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 研究评估生产软件支付工作流,通过手工模型验证核心协议正确性,发现故障处理差距并修复;生产支付沙盒探针暴露问题;还复制了关于大语言模型规范可靠性受合同结构而非语言影响的结论。

Comments 25 pages, 3 figures, 5 tables. Artifacts and reference models at https://github.com/jdubray/SysMoBench-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02799 2026-07-07 cs.CV 新提交 67%

Conversational Human Audio-visual Talking Dialogue Generation

对话式人类视听对话生成

Junhao Song, Lluis Guasch, Xilin He, Zhongyu Yang, Yingfang Yuan, Weicheng Xie, Linlin Shen, Haijun Lin, Shizhe Liu, Wei Pang, Siyang Song

机构 * Department of Computing, Imperial College London(伦敦帝国理工学院计算系) Department of Earth Science & Engineering, Imperial College London(伦敦帝国理工学院地球科学与工程系) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Department of Computer Science, Heriot-Watt University(赫瑞瓦特大学计算机科学系) School of Computer Science, Northumbria University(诺森比亚大学计算机科学学院) College of Computer Science & Software Engineering, Shenzhen University(深圳大学计算机科学与软件学院) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(深圳大学广东省智能信息处理重点实验室) School of Engineering and Design, Hunan Normal University(湖南师范大学工程与设计学院) Department of Computer Science, University of Oxford(牛津大学计算机科学系) Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 提出CHAT框架,统一大语言模型和说话人脸模型,通过交互音频和面部行为细化模块,从单一文本提示生成多样、配对且相互响应的语音-面部对话片段,优于现有方法,合成数据集可作预训练数据。

Comments Accepted to ECCV 2026 as a main paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01640 2026-07-03 cs.SE cs.CR 新提交 67%

AgentFlow: Building Agent Dependency Graphs for Static Analysis of Agent Programs

AgentFlow:构建用于智能体程序静态分析的智能体依赖图

Shenao Wang, Xinyi Hou, Yanjie Zhao, Xiao Cheng, Haoyu Wang

专题命中 预训练与数据 :LLM(abstract,abstract_cn)

AI总结 提出AgentFlow,首个从智能体程序中恢复和分析智能体依赖的静态分析框架,通过构建框架无关的智能体依赖图(ADG)支持智能体治理和安全分析,在5399个真实程序中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23041 2026-07-03 cs.CV 新提交 67%

SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models

SPAR: 语义-像素自对齐与自适应路由的统一多模态模型

Hongxiang Li, Hongxu Chen, Chenyang Zhu, Xiaoshuang Huang, Jiayin Cai, Xiaolong Jiang, Yao Hu, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Xiaohongshu Inc.(小红书公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 提出SPAR框架,通过非对称双流统一分词器协调语义感知与像素重建,利用自对齐生成范式消除外部依赖,并引入动态令牌路由实现灵活多模态交互,在统一架构中达到生成、重建与视觉理解的最优性能。

Comments ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30777 2026-07-01 cs.CV 新提交 67%

Unveiling Transferability in Trajectory Prediction via Latent Scene Embeddings

通过潜在场景嵌入揭示轨迹预测中的可迁移性

Theodor Westny, David Axelsson, Björn Olofsson, Erik Frisk

机构 * Linköping University(林雪平大学) Lund University(隆德大学)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)

AI总结 提出一个学习数据集潜在表示并用量化分布指标衡量相似性的框架,在24个数据集上验证迁移分数与跨数据集模型性能强相关,为数据集选择、预训练和基础模型提供指导。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27663 2026-06-29 cs.RO 新提交 67%

Direct Action-Head Injection of A Grounded 3D Point Unlocks Spatial and Task Generalization

直接动作头注入接地3D点实现空间与任务泛化

Shiang-Feng Tsai, Jin-Cheng Jhang, Yen-Ling Tai, Jia-Hong Lai, Shih-Yun Wong, KangTung-Hsu, Yi-Ting Chen

机构 * National Tsing Hua University(国立清华大学) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 预训练与数据 :pretraining(abstract);prompting(abstract)

AI总结 提出轻量级模块,将3D点表示的接地信号通过自适应层归一化直接注入VLA模型的动作头,在LIBERO-PRO上显著提升空间和任务泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24226 2026-06-24 cs.CY cs.CR 新提交 67%

Inside Crypter-as-a-Service: An Ecosystem Analysis of the exploit.in Underground Forum Research Talks

加密器即服务:exploit.in 地下论坛的生态系统分析研究讲座

Mathieu Jeannot, Jean-Yves Marion, Manon Pamar, Maira Nassau, Pierre Marty, Romain Guittienne

专题命中 预训练与数据 :LLM(abstract,abstract_cn)

AI总结 通过分析俄语网络犯罪论坛 exploit.in 上的491个帖子和2949条回复,揭示了加密器即服务(CraaS)生态系统的特征,包括服务化运营、信任机制和分层市场结构。

Journal ref Workshop on Attackers and Cyber-Crime Operations, IEEE European Symposium on Security and Privacy, Jul 2026, Lisbon (Portugal), Portugal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15817 2026-06-17 cs.PL cs.SE 新提交 67%

ScratchLens: Lens-Parametric Behavioral Equivalence for Scratch Programs

ScratchLens: 用于 Scratch 程序的透镜参数化行为等价性

Yuan Si, Jialu Zhang

专题命中 预训练与数据 :LLM(abstract,abstract_cn)

AI总结 针对块编程语言中程序等价性判定问题,提出透镜参数化等价框架SPECTRA,通过因果IR、规范化和Mazurkiewicz迹商等技术,实现高精度行为等价判定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16053 2026-06-16 cs.SI cs.CY 新提交 67%

Modeling Engagement with Brand and Organizational TikTok Videos Using Machine-Assisted Theory-Ensemble Annotation

使用机器辅助理论集成标注建模品牌和组织TikTok视频的参与度

Sander Paekivi, Andres Karjus

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 利用多模态大语言模型标注77个理论驱动的结构变量,分析约1万个TikTok视频,以预测参与度并探索短视频文化差异。

详情

展开后加载摘要…

URL PDF HTML 收藏