arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22405 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22405 篇

2603.29913 2026-08-25 cs.AR cs.AI 84%

SISA: A Scale-In Systolic Array for GEMM Acceleration

SISA:一种可扩展的流体阵列用于GEMM加速

Luigi Altamura, Alessio Cicero, Mateo Vázquez Maceiras, Mohammad Ali Maleki, Pedro Trancoso

机构 * Department of Computer Science Engineering,\ University of Technology

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对LLM中非均匀矩阵带来的Systolic Array资源浪费问题,SISA通过将传统正方形阵列划分为水平矩形片,实现小/倾斜矩阵的高效执行,同时保留大GEMM的全阵操作,从而在代表LLM上实现8.52倍的速度提升和93%的EDP降低。

Journal ref Euro-Par 2026: Parallel Processing, Lecture Notes in Computer Science, vol. 16781, pp. 359-372, Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17856 2026-08-19 cs.AI 新提交 84%

ARASH: Adaptive Retrieval And Shot Selection for Tabular Prediction

ARASH:面向表格预测的自适应检索与样本选择

Samirasadat Jamalidinan, Yue Xu, Kazem Cheshmi

机构 * McMaster University(麦克马斯特大学)

专题命中 效率与部署 :foundation model(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出ARASH方法,通过训练集局部邻域分析选择最优样本,在保持TabPFN相当准确率的同时,大幅降低其提示长度与内存使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13831 2026-08-17 eess.AS cs.CL 新提交 84%

VoiceChat-TTS: A Low-Latency Continuous Speech Synthesis Model for Interactive Agents

VoiceChat-TTS:面向交互智能体的低延迟连续语音合成模型

Edresson Casanova, Jaehyeon Kim, Mariana Graterol Fuenmayor, Shehzeen Hussain, Viacheslav Klimkov, Valentin Mendelev, Mikyas Desta, Paarth Neekhara, Piotr Zelasko, Chen Chen, Elena Rastorgueva, Ke Hu, Ankita Pasad, Xuesong Yang, Aya Alja'fari, Rajarshi Roy, Rohan Badlani, Jason Roche, Jason Li, Zhehuai Chen

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(abstract);分类 cs.CL

AI总结 针对现有语音模型延迟高、无法处理用户插话的问题,提出VoiceChat-TTS模型,由LLM文本令牌流驱动,支持语句中途中断且不重置KV缓存,在保证高语音质量的同时实现低延迟连续语音合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09941 2026-08-12 cs.CL 新提交 84%

The Multilingual Quantization Tax: Structural Collapse and Typological Fragility in Edge SLMs

多语言量化代价:边缘端小型语言模型(SLM)中的结构崩溃与类型学脆弱性

Mohammad Wathiq Soualhi

专题命中 效率与部署 :SLM(title_cn,abstract_cn);language model(abstract);small language model(abstract);分类 cs.CL

AI总结 本研究针对Gemma 4、Qwen 3.5架构开展4比特量化的零样本多语言评估,发现量化存在类型学脆弱性等四类现象,揭示了量化代价的多语言差异。

Comments Under review at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06630 2026-08-10 cs.LG 新提交 84%

The Sparsity Whisperer

稀疏低语者

Linghao Kong, Inimai Subramanian, Micah Adler, Dan Alistarh, Dan Gutfreund, Nir Shavit

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文针对大语言模型剪枝忽略输出差异的问题,提出Wisp、Wisp+、Whisper等差异感知剪枝方法,在Llama系列模型上提升了剪枝效果,可与其他技术结合优化性能。

Comments 10 pages, 3 figures. Code available at https://github.com/Shavit-Lab/Whisper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28149 2026-08-05 cs.LG 版本更新 84%

Sign-Aware Gated Sparse Autoencoders: Modeling Anticorrelated Features with Bi-Jump-ReLU Activations

符号感知门控稀疏自编码器:使用Bi-Jump-ReLU激活函数建模反相关特征

Bartosz Wieciech, Zmnako Awrahman, Marcin Czelej, Victor Hugo Jaramillo Velasquez, Wioletta Stobieniecka

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出符号感知门控稀疏自编码器(SA-GSAE),通过双面门控稀疏性、符号幅度路径和辅助重构,利用Bi-Jump-ReLU激活实现双极性共享,在保持参数效率的同时,在多个LLM激活点上优于标准门控SAE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20524 2026-07-24 cs.AI 新提交 84%

Attention Degradation, Function Token Anchoring, and the Limits of Attention-Based Intervention in Large Language Models

注意力退化、功能令牌锚定以及基于注意力的大语言模型干预的局限性

Sagar Dangal, Manoj Shakya

机构 * London Metropolitan University(伦敦城市大学) Islington College(伊斯灵顿学院) Kathmandu University(加德满都大学)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.AI

AI总结 研究探讨大语言模型中注意力退化问题,通过六个实验刻画其模式及功能令牌锚定特点,测试干预机制效果,发现平均注意力退化多为描述性,功能令牌作用于隐藏状态计算,为可解释性方法及推理优化提供启示。

Comments 19 pages, 2 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20470 2026-07-24 cs.AI 新提交 84%

PlanE: Meta Planning of Data, Tuning, and Inference for Extractive-based LLMs

PlanE:基于抽取式大语言模型的数据、调优和推理的元规划

Jiacheng Wang, Weiyan Zhang, Guangya Yu

机构 * Ant Group(蚂蚁集团) School of Information Science and Engineering, East China University of Science and Technology(华东理工大学信息科学与工程学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 针对大语言模型特定任务能力提升中数据标注成本高及缺乏优化方法的问题,提出PlanE框架,含数据分解等,引入DTI规划器,实验验证了该框架及规划器在不同场景下的有效性和通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23348 2026-07-22 cs.DC cs.AI cs.NI 版本更新 84%

CWind: A Cross-site Router for Large Language Model Inference Serving at Renewable Energy Farms

XWind: 面向可再生能源农场的跨站点大语言模型推理服务路由器

Tella Rajashekhar Reddy, Atharva Deshmukh, Liangcheng Yu, Chaojie Zhang, Mike Shepperd, Rohan Gandhi, Anjaly Parayil, Srinivasan Iyengar, Ajay Manchepalli, Debopam Bhattacherjee

机构 * Microsoft(微软)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.AI

AI总结 提出AI绿色围栏部署模式,并构建XWind路由器,利用实时信号动态配置站点和分发请求,以在可变风力供电下高效服务推理请求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14643 2026-07-21 cs.AI 版本更新 84%

Arbor: A Framework for Reliable Navigation of Critical Conversation Flows

Arbor:一种用于关键对话流程可靠导航的框架

Luís Silva, Diogo Gonçalves, Catarina Farinha, Clara Matos, Luís Ungaro

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 Arbor通过分解决策树导航为节点级任务,提升了医疗分诊中对话流程的准确性和效率,使小型模型能超越大模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07760 2026-07-10 cs.AI cs.SI 新提交 84%

Adversarial Social Epistemology for Assemblies of Humans and Large Language Models

人类与大语言模型集合的对抗性社会认识论

Mihnea C. Moldoveanu, Joel A. C. Baum

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.AI

AI总结 研究人类与大语言模型集合在密集互动交流场景中的信息问题,提出对抗性社会认识论,借助语言、机制及基于认知网络的 machinery 来分析、破坏信任并审计纠正信任违规。

Comments 50 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00481 2026-07-02 cs.CR cs.AI 新提交 84%

Beyond the Prompt: Jailbreaking Function-Calling LLMs via Simulated Moderation Traces

超越提示:通过模拟审核轨迹越狱函数调用大语言模型

Junlong Liu, Haobo Wang, Weiqi Luo, Xiaojun Jia

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对函数调用大语言模型的结构性漏洞,提出基于模拟审核轨迹的黑盒攻击框架SMT,通过多轮交互绕过安全约束,在多个商业模型上实现高攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10520 2026-07-02 cs.CL 新提交 84%

UniSVQ: 2-bit Unified Scalar-Vector Quantization

UniSVQ: 2比特统一标量-向量量化

Haoyu Wang, Haiyan Zhao, Xingyu Yu, Zhangyang Yao, Xu Han, Zhiyuan Liu, Maosong Sun

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出UniSVQ,通过将码字参数化为整数格点的仿射变换,统一标量和向量量化,实现2比特量化下性能优于标量量化、媲美向量量化,且推理吞吐更高。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29712 2026-06-30 cs.CL 84%

Why Struggle with Continuous Latents? Interpretable Discrete Latent Reasoning via Rendered Compression

为何纠结于连续潜变量?通过渲染压缩实现可解释的离散潜变量推理

Shuochen Chang, Qingyang Liu, Shaobo Wang, Bingjie Gao, Qianli Ma, Haonan Zhao, Yibo Miao, Yulin Sun, Zelin Peng, Jiangtong Li, Li Niu

机构 * Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学)

专题命中 效率与部署 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出离散潜变量推理(DLR)方法,将连续潜状态转化为离散令牌,通过渲染压缩实现高效、可解释的潜空间推理,在五个基准上优于先前方法并达到20倍压缩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24143 2026-06-24 cs.LG 新提交 84%

AsyncOPD: How Stale Can On-Policy Distillation Be?

AsyncOPD:同策略蒸馏可以有多陈旧?

Wonjun Kang, Kevin Galim, Seunghyuk Oh, Minjun Kang, Sanghyun Park, Donghoon Kim, Minjae Lee, Minseo Kim, Rishabh Tiwari, Yuchen Zeng, Hyung Il Koo, Kangwook Lee

机构 * FuriosaAI Ajou University(亚洲大学) UC Berkeley(加州大学伯克利分校) Microsoft Research(微软研究院) KRAFTON Ludo Robotics

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究异步同策略蒸馏中陈旧数据的影响,发现前向KL对陈旧更鲁棒,反向KL脆弱但可通过重算信号缓解,并提出AsyncOPD框架实现1.6-3.8倍加速。

Comments Code: https://github.com/furiosa-ai/async-opd

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18502 2026-06-18 cs.CL 新提交 84%

Towards Scalable Customization and Deployment of Multi-Agent Systems for Enterprise Applications

面向企业应用的多智能体系统可扩展定制与部署

Paresh Dashore, Shreyas Kulkarni, Uttam Gurram, Nadia Bathaee, Kartik Balasubramaniam, Genta Indra Winata, Sambit Sahu, Shi-Xiong Zhang

机构 * Capital One(第一资本)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出统一框架,通过智能体模型定制(持续预训练、微调、偏好优化)和推理优化(推测解码、FP8量化),实现领域自适应和4.48倍吞吐加速,保持性能并提升长尾场景鲁棒性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29179 2026-06-17 cond-mat.mtrl-sci cs.AI 版本更新 84%

Sustainable Metal-Organic Framework Water Harvesters in the Artificial Intelligence Era

人工智能时代可持续的金属有机框架水收集器

Reid A. Coyle, Shyam Chand Pal, Peter Walther, Saeun Park, Bin Feng, Zhiling Zheng

机构 * Department of Chemistry, Washington University(华盛顿大学化学系) Institute of Materials Science & Engineering, Washington University(华盛顿大学材料科学与工程学院)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了金属有机框架(MOF)在干旱条件下水收集的设计原理,并介绍了人工智能(AI)、大语言模型(LLM)和数据挖掘如何加速高性能吸附剂的发现。

Comments 10 pages of main text, 26 total pages. 3 Figures and 1 Table of Content Graphic

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15416 2026-06-16 cs.CL 新提交 84%

Encode Errors: Representational Retrieval of In-Context Demonstrations for Multilingual Grammatical Error Correction

编码错误:多语言语法错误纠正中上下文示例的表征检索

Guangyue Peng, Wei Li, Wen Luo, Houfeng Wang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出从LLM内部状态提取语法错误表征(GER)用于检索上下文示例,显著提升多语言语法错误纠正的少样本性能,在低资源语言上F0.5提升达1.20倍。

Comments 15 pages, 6 figures

Journal ref Findings of the Association for Computational Linguistics: ACL 2025, pages 21166-21180, Vienna, Austria. Association for Computational Linguistics, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12674 2026-06-12 cs.AI 新提交 84%

Evoflux: Inference-Time Evolution of Executable Tool Workflows for Compact Agents

Evoflux: 紧凑型智能体的可执行工具工作流的推理时演化

Kushal Raj Bhandari, Ling Yue, Ching-Yun Ko, Dhaval Patel, Shaowu Pan, Pin-Yu Chen, Jianxi Gao

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) IBM Research(IBM研究院)

专题命中 效率与部署 :SFT(summary_cn,abstract);language model(abstract);分类 cs.AI

AI总结 提出Evoflux,一种推理时演化搜索方法,通过结构化编辑和执行反馈修复紧凑语言模型的工具工作流,将执行可行性从3%提升至17-24%,优于SFT和ReAct。

Comments Code is available at https://github.com/IBM/Evoflux

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12487 2026-06-12 cs.LG 新提交 84%

DynamicPTQ: Mitigating Activation Quantization Collapse via Residual-Stream Dynamics

DynamicPTQ: 通过残差流动态缓解激活量化崩溃

Zimo Zhao, Maolin Wang, Bowen Yu, Bowen Liu, Xiao Han, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Zhejiang University of Technology(浙江工业大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出DynamicPTQ,通过分析残差流中激活的相位式动态变化,识别量化敏感层并分配8位精度,在W4A4KV4量化下提升LLaMA-2/3的困惑度和零样本QA性能,吞吐量提升1.05-1.07倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04581 2026-06-09 cs.DC cs.AI cs.NI 版本更新 84%

Multi-SPIN: Multi-Access Speculative Inference for Cooperative Token Generation at the Edge

Multi-SPIN:面向边缘协作令牌生成的多接入推测推理

Haotian Zheng, Zhanwei Wang, Mingyao Cui, Chang Cai, Hongyang Du, Kaibin Huang

机构 * Department of Electrical and Computer Engineering, The University of Hong Kong(香港大学电子与计算机工程系)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 提出多接入推测推理(Multi-SPIN)架构,通过联合优化草案长度控制和带宽分配,在异构边缘系统中最大化令牌总吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09816 2026-06-09 cs.LG 84%

Learning Fine-grained Parameter Sharing via Sparse Tensor Decomposition

通过稀疏张量分解学习细粒度参数共享

Cem Üyük, Mike Lasby, Mohamed Yassin, Utku Evci, Yani Ioannou

机构 * Department of Computer Science, Technical University of Munich(计算机科学系,慕尼黑技术大学) Schulich School of Engineering, University of Calgary(工程学院,卡尔加里大学) Google DeepMind, Canada(加拿大谷歌深Mind)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出FiPS框架,通过跨块参数共享、低秩分解和稀疏性联合优化,压缩Transformer MLP,在ViT和LLM上实现高效压缩且性能损失小。

Comments Accepted as is to Transactions on Machine Learning Research (TMLR), 2026. OpenReview: https://openreview.net/forum?id=vbS7Z8Zswe

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08782 2026-06-03 cs.CL 84%

MT-OSC: Path for LLMs that Get Lost in Multi-Turn Conversation

MT-OSC:解决大语言模型在多轮对话中迷失的路径

Jyotika Singh, Fang Tu, Miguel Ballesteros, Weiyi Sun, Sandip Ghoshal, Michelle Yuan, Yassine Benajiba, Sujith Ravi, Dan Roth

机构 * Oracle AI

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出MT-OSC框架,通过后台自动压缩对话历史(Condenser Agent)减少token量,提升多轮对话性能,在13个LLM上验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02487 2026-06-02 cs.CL 84%

Towards Multidisciplinary Summarization of Hospital Stays: Efficient Sentence-Level Clinical Provenance Categorization

迈向多学科住院总结:高效的句子级临床来源分类

Baris Karacan, Vaibhav Bhargava, Barbara Di Eugenio, Natalie Parde, Mary Khetani, Yu-Shan Tseng, Vanessa Barbosa, Julie Vignato, Lindsey Knake, Rajashree Dahal, Emily Spellman, Danielle Hitzel, Janine Petitgout, Kristi Haughey, Amanda Karstens, Brianna Clarahan, Rachel Dawson, Lauren Boyd, Mackenzie Weis, Angie Tipton, Jaewon Bae, Catherine K. Craven, Karen Dunn Lopez, Andrew D. Boyd

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Iowa(爱荷华大学) University of Missouri-Columbia(密苏里大学哥伦比亚分校)

专题命中 效率与部署 :SFT(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出一个基于大语言模型监督微调的临床来源分类流水线,用于多学科住院总结,通过量化70B模型在跨领域迁移中提升F1分数7%,并证明模型容量对语义灵活性的关键作用。

Comments 5 pages. Submitted preprint version of a paper accepted to AIME 2026. This version may differ from the camera-ready manuscript and the final Version of Record. The Version of Record will be available from Springer Nature once published

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23782 2026-06-02 cs.CL 84%

Bridging the Knowledge-Prediction Gap in LLMs on Multiple-Choice Questions

弥合大语言模型在多项选择题中的知识-预测差距

Yoonah Park, Haesung Pyun, Yohan Jo

机构 * KAIST(韩国科学技术院)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过分析隐藏表示中的知识子空间和预测子空间,提出轻量级推理时干预方法KAPPA来对齐两者,从而减少LLM在多项选择题上的知识-预测差距。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30337 2026-05-29 cs.LG 84%

Efficient Test-Time Finetuning of LLMs via Convex Reconstruction and Gradient Caching

通过凸重构和梯度缓存实现LLM的高效测试时微调

Alaa Khamis, Alaa Maalouf

机构 * Department of Computer Science(计算机科学系)

专题命中 效率与部署 :LLM(title_cn,summary_cn);language model(abstract);分类 cs.LG

AI总结 提出HullFT方法,利用凸重构和梯度缓存加速LLM的测试时微调,在保持质量的同时显著降低运行时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11182 2026-05-26 cs.AI 84%

The Many Faces of On-Policy Distillation: Pitfalls, Mechanisms, and Fixes

在线策略蒸馏的多种面貌:陷阱、机制与修复

Siqi Zhu, Xuyan Ye, Hongyu Lu, Weiye Shi, Ge Liu

机构 * UIUC(伊利诺伊大学香槟分校) Renmin University of China(中国人民大学) Peking University(北京大学)

专题命中 效率与部署 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文通过实证研究分析了在线策略蒸馏(OPD)和在线策略自蒸馏(OPSD)在大语言模型后训练中的有效性、失败机制及修复方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11679 2026-05-22 cs.AI 84%

LLMs can construct powerful representations and streamline sample-efficient supervised learning

LLMs can construct powerful representations and streamline sample-efficient supervised learning

Ilker Demirel, Lawrence Shi, Zeshan Hussain, David Sontag

机构 * MIT(麻省理工学院) Harvard Medical School(哈佛医学院)

专题命中 效率与部署 :LLM(summary_cn,abstract);foundation model(abstract);分类 cs.AI

AI总结 本文提出了一种基于LLM的代理流程,通过生成全局 rubric 来提升多模态数据的表示能力,并在15个临床任务中显著优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18579 2026-05-21 cs.LG 84%

S2Aligner: Pair-Efficient and Transferable Pre-Training for Sparse Text-Attributed Graphs

S2Aligner: 用于稀疏文本属性图的高效且可迁移的预训练方法

Yuhan Wang, Haopeng Zhang, Yibo Ding, Jiaqi Yu, Xinyu Zhao, Yuhang Liu, Ziwei Zhang, Xiao Wang, Ruijie Wang

机构 * Beihang University(北航大学) Tianjin University(天津大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出S2Aligner,一种针对稀疏文本属性图的高效且可迁移的预训练方法,通过解耦语义对齐与结构建模,增强对齐过程而不污染共享的语义空间,从而减少跨域泛化差距。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17971 2026-05-19 cs.CR cs.AI 84%

Babel: Jailbreaking Safety Attention via Obfuscation Distribution Optimized Sampling

Babel: 通过混淆分布优化采样实现安全机制的 jailbreak 安全性

Ziwei Wang, Jing Chen, Ruichao Liang, Zhi Wang, Yebo Feng, Ju Jia, Ruiying Du, Cong Wu, Yang Liu

机构 * Wuhan University(武汉大学) Nanyang Technological University(南洋理工大学) Southeast University(东南大学) University of Hong Kong(香港大学)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了大语言模型安全机制中的内在漏洞,提出了一种高效的黑盒攻击框架Babel,通过系统性的混淆采样和反馈驱动的分布优化,实现了高成功率的jailbreak攻击,展示了在LLM安全研究中的稳健方法。

详情

展开后加载摘要…

URL PDF HTML 收藏