Pruning as Evolution: Emergent Sparsity Through Selection Dynamics in Neural Networks
剪枝作为进化:通过选择动态在神经网络中产生涌现性稀疏性
专题命中 效率与部署 :post-training(abstract)
AI总结 本文提出一种基于进化视角的神经网络剪枝方法,通过模拟种群动态实现稀疏性,无需显式剪枝计划即可在训练过程中产生可测量的准确率-稀疏性权衡。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
剪枝作为进化:通过选择动态在神经网络中产生涌现性稀疏性
专题命中 效率与部署 :post-training(abstract)
AI总结 本文提出一种基于进化视角的神经网络剪枝方法,通过模拟种群动态实现稀疏性,无需显式剪枝计划即可在训练过程中产生可测量的准确率-稀疏性权衡。
ThinkFL: 通过强化微调实现微服务系统的自完善故障定位
专题命中 效率与部署 :LLM(abstract)
AI总结 ThinkFL通过强化微调提升微服务系统故障定位的准确性和效率,显著降低延迟并增强适应性。
Comments accepted by TOSEM'26
DFabric: 通过CXL-Ethernet混合互连技术实现数据并行应用的扩展
专题命中 效率与部署 :LLM(abstract)
AI总结 DFabric通过CXL-Ethernet混合互连技术实现数据并行应用的扩展,解决跨机架通信带宽限制问题。
Journal ref the 2025 USENIX Conference on Usenix Annual Technical Conference (USENIX ATC). USENIX Association,USA,Article 74,1261-1279
Causal-SAM-LLM:大型语言模型作为因果推理器用于稳健的医学分割
机构 * City University of Hong Kong, Hong Kong, China(香港城市大学) ; Xi’an Jiaotong-liverpool University, Suzhou, China(西安交通大学利物浦大学)
专题命中 领域大模型 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 Causal-SAM-LLM利用大型语言模型作为因果推理器,提升医学图像分割的鲁棒性和泛化能力。
Comments Accepted by IEEE ICASSP 2026
FORESTLLM:大型语言模型使随机森林在少样本表格学习中表现卓越
机构 * Microsoft Research Asia(微软亚洲研究院)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG
AI总结 FORESTLLM结合决策森林的结构归纳偏见和LLM的语义推理能力,通过语义分割和上下文推理机制,在少样本表格学习中实现高性能。
Comments 23 pages
在表示之前学习:连接生成学习与对比学习以构建领域特定的LLM嵌入
机构 * Zhejiang University(浙江大学) ; Peking University(北京大学)
专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出LBR框架,通过生成学习和对比学习结合,在垂直领域中提升LLM嵌入的准确性和鲁棒性。
Comments 10 pages, 3 figures
当人们是洪水:利用大型语言模型分析移民话语中的去人性化隐喻
机构 * University of Maryland(马里兰大学) ; University of Michigan(密歇根大学)
专题命中 领域大模型 :large language model(title);language model(title);分类 cs.CL
AI总结 本文利用大型语言模型分析移民话语中的去人性化隐喻,探讨隐喻、政治意识形态与用户参与之间的关系。
Comments To appear at ACL 2025. Please cite ACL version when proceedings are available
Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (2025) 8079-8103
医学SAM3:一种通用提示驱动的医学图像分割基础模型
机构 * University of Central Florida, Orlando, USA(佛罗里达大学) ; University College London, London, UK(伦敦大学学院) ; University of Illinois Urbana-Champaign, Champaign, USA(伊利诺伊大学厄巴纳-香槟分校) ; University of Trento, Trento, Italy(特伦托大学) ; The Hong Kong Polytechnic University, China(香港理工大学) ; University of Pennsylvania, Philadelphia, USA(宾夕法尼亚大学)
专题命中 领域大模型 :foundation model(title,abstract);prompting(abstract);分类 cs.AI
AI总结 Medical SAM3通过微调SAM3模型,提升医学图像分割的通用提示驱动能力,解决领域偏移和复杂结构推理问题。
为社会科学选择语言模型:从小处入手,开放并验证
机构 * Department of Sociology and Anthropology, Lehigh University(社会学与人类学系,莱恩大学) ; Department of Sociology, New Mexico State University(社会学系,新墨西哥州立大学) ; Department of Computer Science, New Mexico State University(计算机科学系,新墨西哥州立大学)
专题命中 领域大模型 :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出通过选择较小且开放的语言模型,并构建限定性基准测试来验证计算流程的有效性,以提高社会科学中语言模型选择的可重复性和可靠性。
多阶段患者角色扮演框架用于真实临床互动
机构 * College of Computer Science and Technology, Key Laboratory of Symbolic Computation and Knowledge Engineering, Ministry of Education, Jilin University(计算机科学与技术学院、符号计算与知识工程重点实验室、教育部、吉林大学) ; College of Software, Jilin University(软件学院、吉林大学) ; Gastrointestinal Endoscopy Center, The First Hospital of Jilin University(吉林大学第一医院消化内窥镜中心)
专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出无需训练的多阶段患者角色扮演框架,通过分解互动为三个阶段,提升模型在模拟患者行为时的个性化和真实性。
Comments 22 pages, 5figures, under review
利用深度神经网络的神经先知进行股票市场价格预测
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出NP-DNN模型,利用深度神经网络和多层感知机预测股票价格,准确率达99.21%。
Comments Accepted at 2nd International Conference on Software, Systems and Information Technology (SSITCON) 2025
MedReflect: 通过反思修正教学医疗LLM自我改进
机构 * Peking University(北京大学) ; University of Virginia(弗吉尼亚大学) ; Peking University Sixth Hospital(北京大学第六医院)
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 MedReflect通过自我反思机制提升医疗LLM的自主学习能力,减少外部数据依赖,实现高效医疗问题解决。
大语言模型在教育中的机遇与挑战:一种自然语言处理视角
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文从自然语言处理视角探讨大语言模型在教育中的应用,分析其在教学、学习和评估中的机遇与挑战。
Comments Pre-print
LogicLens: 通过语义代码图探索多仓库大型系统
机构 * Sourcesense
专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI
AI总结 LogicLens通过构建语义多仓库图,帮助开发者探索复杂软件系统,支持自然语言交互和动态检索子图,实现领域逻辑和运行时行为的分析。
UniX: 统一自回归与扩散以实现胸部X光理解与生成
机构 * Wuhan University(武汉大学) ; Huazhong University of Science and Technology(华中科技大学) ; Nanyang Technological University(南洋理工大学)
专题命中 领域大模型 :LLM(abstract);foundation model(abstract)
AI总结 UniX通过统一自回归与扩散模型,实现了胸部X光的高效理解和生成,显著提升了性能并减少了参数使用。
Comments Codes and models are available at https://github.com/ZrH42/UniX
EncodeRec: 一个用于推荐系统的嵌入骨干网络
机构 * Ben-Gurion University of the Negev(贝拉谢瓦巴内格利大学)
专题命中 领域大模型 :language model(abstract);分类 cs.CL
AI总结 EncodeRec通过直接从项目描述中学习紧凑且信息丰富的嵌入,提升推荐系统在语义ID标记化和顺序推荐中的性能。
PQ-CAN:用于嵌入式系统中模拟后量子密码学的框架
专题命中 领域大模型 :prompting(abstract)
AI总结 PQ-CAN框架用于模拟PQC算法在嵌入式系统中的性能和开销,评估其在汽车通信中的可行性和局限性。
Comments Accepted at QSNS 2025
面向大语言模型的可解释交通流预测
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) ; Johns Hopkins University(约翰霍普金斯大学) ; Department of Civil and System Engineering(土木与系统工程系)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG
AI总结 本文提出xTP-LLM模型,利用大语言模型生成可解释的交通流预测,首次将LLM应用于交通预测的可解释性研究。
Comments 31pages, 16 figures
Journal ref Communications in Transportation Research, vol. 4, 100150, 2024
层次化正交残差扩展用于大语言模型中的精确大规模编辑
机构 * Independent Researcher(独立研究者) ; UESTC ; Shanghai University(上海大学) ; University of Manchester(曼彻斯特大学)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出HORSE方法,通过层次化正交残差扩展实现大语言模型中的精确大规模编辑,通过理论分析和实验验证其有效性。
Comments ICASSP 2026
FactCorrector:一种基于图的长文本事实性校正方法
机构 * IBM Research Europe - Ireland(IBM欧洲研究院-爱尔兰)
专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 FactCorrector通过结构化反馈提升大语言模型的事实性准确性,优于现有基线方法。
基于大语言模型的伪相关反馈
专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文提出一种结合大语言模型的伪相关反馈方法,通过在RM3计算前过滤相关文档,提升查询扩展的鲁棒性和准确性。
Comments Accepted ECIR 2026
大五人格特征在大语言模型中的探测与引导:一项大五研究
机构 * Independent Researcher(独立研究者)
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL
AI总结 本文研究了通过大五人格特质对齐的线性方向探测和引导大语言模型行为的有效性,发现其在特定任务中表现良好,但在开放式生成中效果有限。
Comments 29 pages, 6 figures
从结到旋钮:迈向可操控的协作过滤使用稀疏自编码器
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)
AI总结 本文首次将稀疏自编码器应用于协作过滤,通过在编码器和解码器之间插入SAE来增强协作自编码器,以实现推荐方向的可控性。
基于AI的JSON模式创建与映射
专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)
AI总结 本文提出结合大型语言模型与确定性技术的混合方法,用于基于自然语言输入的JSON模式创建、修改和映射,降低非专家在结构化数据建模与集成中的门槛。
Journal ref 2025 ACM/IEEE 28th International Conference on Model Driven Engineering Languages and Systems Companion (MODELS-C), Grand Rapids, MI, USA, 2025, pp. 79-83
在LLMs中习语的比喻和字面解释之间的拉力战
机构 * Saarland University(萨尔兰大学) ; Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) ; Max Planck Institute for Informatics(马克斯·普朗克信息学研究所)
专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.AI
AI总结 本文研究了LLMs在处理习语时比喻与字面解释的冲突机制,通过因果追溯法揭示了模型如何在不同层之间竞争性地处理歧义。
图像-文本知识建模用于无监督多场景人物重识别
专题命中 知识编辑与模型理解 :language model(abstract)
AI总结 本文提出图像-文本知识建模用于无监督多场景人物重识别,通过三阶段框架提升跨场景识别性能。
Comments 12 pages, 10 figures
解锁检索增强生成在扩散语言模型中的潜力
机构 * Nankai University(南开大学) ; Beihang University(北航) ; HKUST (Guangzhou)(香港科技大学(广州)) ; Huawei Technologies Co., Ltd.(华为技术有限公司)
专题命中 其他LLM :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.LG
AI总结 本文提出SPREAD框架,通过引入查询相关性引导的去噪策略,解决DLMs在RAG框架中生成精度低和语义漂移的问题。
Comments Preprints
超越硬掩膜:用于扩散语言模型的渐进性令牌演化
机构 * Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; Zhejiang University of Technology(浙江工业大学)
专题命中 其他LLM :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出EvoToken-DLM,通过演化的软令牌分布替代硬二进制掩码,实现扩散语言模型中可修正的解码,提升模型性能。
Comments Project webpage: https://aim-uofa.github.io/EvoTokenDLM
在语言模型重述中后置水印技术有多好?
机构 * FAIR, Meta Superintelligence Labs(FAIR、Meta超智能实验室)
专题命中 其他LLM :language model(title);LLM(abstract);分类 cs.CL
AI总结 本文研究了语言模型重述中后置水印技术的效果,发现简单方法在某些情况下表现优异,但对可验证文本效果不佳。
Comments Code at https://github.com/facebookresearch/textseal
构建AI代理以提高对陌生人的求职推荐请求
机构 * UC Berkeley(加州大学伯克利分校)
专题命中 其他LLM :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出利用AI代理增强求职推荐请求的撰写效果,通过检索增强生成技术提升较弱请求的成功率,同时保持较强请求的性能。