arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-11-26 至 2025-11-26 共收录 191 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12 篇

2511.19484 2025-11-26 cs.SE cs.LG 88%

stable-pretraining-v1: Foundation Model Research Made Simple

stable-pretraining-v1: 使基础模型研究变得简单

Randall Balestriero, Hugues Van Assel, Sami BuGhanem, Lucas Maes

机构 * Brown University(布朗大学) Genentech(基因泰克) Mila & Université de Montréal(Mila与蒙特利尔大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.LG

AI总结 stable-pretraining是一个模块化、可扩展且性能优化的库,旨在通过简化基础模型研究流程,提高灵活性和迭代速度,促进发现和扩展研究可能性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08896 2025-11-26 cs.LG cs.AI 86%

Position: Beyond Euclidean -- Foundation Models Should Embrace Non-Euclidean Geometries

位置:超越欧几里得——基础模型应拥抱非欧几里得几何

Neil He, Jiahong Liu, Buze Zhang, Ngoc Bui, Ali Maatouk, Menglin Yang, Irwin King, Melanie Weber, Rex Ying

机构 * Yale University(耶鲁大学) Chinese University of Hong Kong(香港中文大学) Xi’an Jiaotong University(西安交通大学) Hong Kong University of Science and Technology(香港科学大学) Harvard University(哈佛大学)

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文主张基础模型应超越欧几里得几何,以更高效地利用非欧几里得结构,提升模型性能与适应性。

Comments 27 pages, 6 figures, LoG Conference 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19647 2025-11-26 cs.RO cs.AI 85%

Robot-Powered Data Flywheels: Deploying Robots in the Wild for Continual Data Collection and Foundation Model Adaptation

机器人驱动的数据飞轮:在真实世界中部署机器人以实现持续的数据收集和基础模型适应

Jennifer Grannen, Michelle Pan, Kenneth Llontop, Cherie Ho, Mark Zolotas, Jeannette Bohg, Dorsa Sadigh

机构 * Stanford University(斯坦福大学) Toyota Research Institute(丰田研究机构)

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 机器人驱动的数据飞轮通过部署机器人收集真实世界数据,提升基础模型在复杂环境中的适应能力,减少人工干预并提高多语言OCR性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19528 2025-11-26 cs.RO cs.AI 83%

Discover, Learn, and Reinforce: Scaling Vision-Language-Action Pretraining with Diverse RL-Generated Trajectories

发现、学习与强化:通过多样化强化学习生成轨迹扩展视觉-语言-动作预训练

Rushuai Yang, Zhiyuan Feng, Tianxiang Zhang, Kaixin Wang, Chuheng Zhang, Li Zhao, Xiu Su, Yi Chen, Jiang Bian

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Tsinghua University(清华大学) Wuhan University(武汉大学) Central South University(中南大学) Microsoft Research(微软研究院)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 本文提出DLR框架,通过多样化强化学习生成轨迹,提升VLA预训练的多样性和扩展性,实现更广泛的状态-动作空间覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09436 2025-11-26 cs.CV 82%

Scaling up self-supervised learning for improved surgical foundation models

提升自监督学习以改进手术基础模型

Tim J. M. Jaspers, Ronald L. P. D. de Jong, Yiping Li, Carolus H. J. Kusters, Franciscus H. A. Bakker, Romy C. van Jaarsveld, Gino M. Kuiper, Richard van Hillegersberg, Jelle P. Ruurda, Willem M. Brinkman, Josien P. W. Pluim, Peter H. N. de With, Marcel Breeuwer, Yasmina Al Khalil, Fons van der Sommen

机构 * Department of Electrical Engineering, Video Coding \& Architectures, Eindhoven University of Technology, Eindhoven, The Netherlands Department of Biomedical Engineering, Medical Image Analysis, Eindhoven University of Technology, Eindhoven, The Netherlands Department of Surgery, University Medical Center Utrecht, Utrecht, The Netherlands Department of Oncological Urology, University Medical Center Utrecht, Utrecht, The Netherlands Department of Urology, Catharina Hospital, Eindhoven, The Netherlands

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本研究提出SurgeNetXL,通过大规模预训练提升手术计算机视觉性能,实现多个任务上的显著改进。

Journal ref Medical Image Analysis, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20643 2025-11-26 cs.CV cs.LG 79%

Concept-Aware Batch Sampling Improves Language-Image Pretraining

概念感知的批量采样提升语言-图像预训练

Adhiraj Ghosh, Vishaal Udandarao, Thao Nguyen, Matteo Farina, Mehdi Cherti, Jenia Jitsev, Sewoong Oh, Elisa Ricci, Ludwig Schmidt, Matthias Bethge

机构 * Tübingen AI Center, University of Tübingen(图宾根人工智能中心,图宾根大学) University of Cambridge(剑桥大学) University of Washington(华盛顿大学) University of Trento(特伦托大学) LAION Stanford University(斯坦福大学)

专题命中 预训练与数据 :pretraining(title);language model(abstract);分类 cs.LG

AI总结 本研究提出CABS方法,通过概念感知的批量采样提升语言-图像预训练效果,提供灵活的任务适应性数据整理方案。

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20455 2025-11-26 physics.flu-dyn 78%

Fluid Intelligence: A Forward Look on AI Foundation Models in Computational Fluid Dynamics

流体智力:计算流体动力学中人工智能基础模型的前瞻展望

Neil Ashton, Johannes Brandstetter, Siddhartha Mishra

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 本文提出首个结合CFD输入的缩放定律,用于数据生成和模型训练,以解决复杂流体动力学问题中的独特挑战,并提供了构建基础模型的计算成本和时间估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14993 2025-11-26 cs.AI cs.CV 77%

Multi-modal Generative AI: Multi-modal LLMs, Diffusions, and the Unification

多模态生成式AI:多模态大语言模型、扩散模型与统一

Xin Wang, Yuwei Zhou, Bin Huang, Hong Chen, Wenwu Zhu

机构 * Department of Computer Science, Beijing Information Science and Technology National Research Center, Tsinghua University(计算机系,北京信息科学与技术国家研究中心,清华大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文综述了多模态生成式AI,涵盖多模态LLMs、扩散模型及统一模型的设计与应用,探讨了统一理解和生成的方法及未来研究方向。

Comments 21 pages, 10 figures, 3 tables

Journal ref IEEE Transactions on Circuits and Systems for Video Technology 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02973 2025-11-26 cs.CV 67%

InstaDA: Augmenting Instance Segmentation Data with Dual-Agent System

InstaDA: 通过双代理系统增强实例分割数据

Xianbao Hou, Yonghao He, Zeyd Boukhers, John See, Hu Su, Wei Sui, Cong Yang

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 InstaDA通过双代理系统提升实例分割数据质量,实现AP提升和效率优化

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08701 2025-11-26 cs.CV cs.AI cs.LG 62%

SafeFix: Targeted Model Repair via Controlled Image Generation

SafeFix: 通过受控图像生成实现目标模型修复

Ouyang Xu, Baoming Zhang, Ruiyu Mao, Yunhui Guo

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG

AI总结 SafeFix通过生成语义忠实的图像来修复模型,提升模型对罕见案例的鲁棒性,减少系统性错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18660 2025-11-26 cs.LG stat.ML 57%

Subtract the Corruption: Training-Data-Free Corrective Machine Unlearning using Task Arithmetic

去除污点:基于任务算术的无需训练数据的纠正性机器反遗忘学习

Mostafa Mozafari, Farooq Ahmad Wani, Maria Sofia Bucarelli, Fabrizio Silvestri

机构 * Sapienza University of Rome(罗马萨皮恩扎大学)

专题命中 预训练与数据 :post-training(abstract);分类 cs.LG

AI总结 提出CUTS方法,通过任务算术原理在无源设定下纠正受污染模型,有效消除污染影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20073 2025-11-26 cs.CV 50%

Learning Procedural-aware Video Representations through State-Grounded Hierarchy Unfolding

通过基于状态的层次解折叠学习过程感知的视频表示

Jinghan Zhao, Yifei Huang, Feng Lu

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出TSS框架,通过基于状态的层次解折叠学习过程感知的视频表示,提升任务识别和步骤预测性能。

Comments Accepted by AAAI 2026. 15 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 12 篇

2508.18847 2025-11-26 cs.CL cs.AI 90%

ConfTuner: Training Large Language Models to Express Their Confidence Verbally

ConfTuner: 训练大型语言模型以口头表达其置信度

Yibo Li, Miao Xiong, Jiaying Wu, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 ConfTuner通过引入标记化布里尔分数损失函数,有效提升大型语言模型的置信度校准能力,适用于多种推理任务并泛化至黑盒模型。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20192 2025-11-26 cs.LG cs.IR 88%

FunReason: Enhancing Large Language Models' Function Calling via Self-Refinement Multiscale Loss and Automated Data Refinement

FunReason: 通过自精炼多尺度损失和自动化数据精炼增强大语言模型的功能调用

Bingguang Hao, ZengZhuang Xu, Maolin Wang, Yuntao Wen, Yicheng Chen, Cunyin Peng, Long Chen, Dong Wang, Xiangyu Zhao, Jinjie Gu, Chenyi Zhuang, Ji Zhang

机构 * AWorld Team, Inclusion AI(AWorld Team,Inclusion AI) City University of Hong Kong(香港城市大学) Southwest Jiaotong University(西南交通大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 FunReason通过自精炼多尺度损失和自动化数据精炼方法,提升大语言模型的功能调用能力,实现性能接近GPT-4o并缓解微调中的灾难性遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19489 2025-11-26 cs.SE cs.AI 85%

Evolution without an Oracle: Driving Effective Evolution with LLM Judges

无Oracle的进化:通过LLM裁判驱动有效进化

Zhe Zhao, Yuheng Yang, Haibin Wen, Xiaojie Qiu, Zaixi Zhang, Qingfu Zhang

机构 * Stanford University(斯坦福大学) City University of Hong Kong(香港城市大学) Princeton University(普林斯顿大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MADE框架,通过问题规范减少LLM反馈噪声,实现无Oracle的进化优化,在软件需求满足和复杂指令跟随任务中取得显著成效。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19654 2025-11-26 cs.CR cs.AI 83%

Accuracy and Efficiency Trade-Offs in LLM-Based Malware Detection and Explanation: A Comparative Study of Parameter Tuning vs. Full Fine-Tuning

在基于大语言模型的恶意软件检测与解释中的准确性与效率权衡:参数调优与全微调的比较研究

Stephen C. Gravereaux, Sheikh Rabiul Islam

机构 * Department of Cybersecurity University at Albany - State University of New York Albany, NY, USA(网络安全系 美国纽约州立大学阿尔巴尼分校)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究比较了参数调优与全微调在恶意软件检测中的性能,发现LoRA在保持解释质量的同时显著提升了效率。

Comments Accepted in IEEE Big Data 2025

Journal ref IEEE Big Data 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04195 2025-11-26 cs.CL cs.MA cs.SI 81%

Computational Turing Test Reveals Systematic Differences Between Human and AI Language

计算图灵测试揭示人类与人工智能语言之间的系统性差异

Nicolò Pagan, Petter Törnberg, Christopher A. Bail, Anikó Hannák, Christopher Barrie

机构 * University of Zurich, Department of Informatics(苏黎世大学信息学院) University of Amsterdam, Institute for Logic, Language and Computation (ILLC)(阿姆斯特丹大学逻辑、语言与计算研究所) Duke University(杜克大学) New York University, Department of Sociology(纽约大学社会学系)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过计算图灵测试系统比较了九个LLM在不同校准策略下的表现,揭示了LLM在人类相似性与语义忠实性之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01196 2025-11-26 cs.LG cs.AI cs.ET cs.HC 81%

Are Large Brainwave Foundation Models Capable Yet? Insights from Fine-tuning

大规模脑电基础模型是否已具备能力?来自微调的洞察

Na Lee, Konstantinos Barmpas, Yannis Panagakis, Dimitrios Adamos, Nikolaos Laskaris, Stefanos Zafeiriou

机构 * Imperial College London(伦敦帝国学院) Archimedes / Athena Research Unit(阿基米德/雅典娜研究单位) Aristotle University of Thessaloniki(雅典娜大学) Kapodistrian University of Athens(雅典kapodistrian大学)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过微调实验评估了大规模脑电基础模型的能力,发现其在BCI任务中效率有限,提出LoRA技术可提升性能,强调需重新设计架构以提升脑电分析效果。

Journal ref International Conference on Machine Learning (ICML) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20641 2025-11-26 cs.CV cs.LG 79%

Unleashing the Power of Vision-Language Models for Long-Tailed Multi-Label Visual Recognition

释放视觉-语言模型在长尾多标签视觉识别中的潜力

Wei Tang, Zuo-Zheng Wang, Kun Zhang, Tong Wei, Min-Ling Zhang

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of Computer Network and Information Integration (Southeast University)(计算机网络与信息集成重点实验室) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(Mohamed bin Zayed人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.LG

AI总结 本文提出CAPNET框架,通过显式建模标签相关性,结合图卷积网络和可学习软提示,解决长尾多标签视觉识别中的类别不平衡问题,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12937 2025-11-26 cs.AI cs.CV 79%

Yanyun-3: Enabling Cross-Platform Strategy Game Operation with Vision-Language Models

Yanyun-3: 通过视觉-语言模型实现跨平台战略游戏操作

Guoyan Wang, Yanyan Huang, Chunlin Chen, Lifeng Wang, Yuxiang Sun

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 Yanyun-3通过整合视觉-语言模型和结构化多模态数据组织,实现了跨平台战略游戏操作的自动化,提升了任务执行效率和泛化能力。

Comments 32 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11118 2025-11-26 cs.CL cs.AI 73%

UMB@PerAnsSumm 2025: Enhancing Perspective-Aware Summarization with Prompt Optimization and Supervised Fine-Tuning

UMB@PerAnsSumm 2025: 通过提示优化和监督微调增强视角感知摘要

Kristin Qi, Youxiang Zhu, Xiaohui Liang

机构 * Department of Computer Science, University of Massachusetts Boston(计算机科学系,马萨诸塞大学波士顿分校)

专题命中 指令微调 :SFT(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 UMB@PerAnsSumm 2025通过提示优化和监督微调提升视角感知摘要质量,结合关键词和引导信息优化摘要生成过程。

Comments CL4HEALTH NAACL: Annual Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27606 2025-11-26 cs.CV cs.AI 70%

Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning

Spatial-SSRL: 通过自监督强化学习增强空间理解

Yuhong Liu, Beichen Zhang, Yuhang Zang, Yuhang Cao, Long Xing, Xiaoyi Dong, Haodong Duan, Dahua Lin, Jiaqi Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 指令微调 :language model(abstract);SFT(abstract);分类 cs.AI

AI总结 Spatial-SSRL通过自监督强化学习提升大视觉-语言模型的空间理解能力,无需人工标注,在多个基准测试中取得显著准确率提升。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19878 2025-11-26 cs.CV cs.AI cs.CL cs.LG cs.RO 67%

MAPS: Preserving Vision-Language Representations via Module-Wise Proximity Scheduling for Better Vision-Language-Action Generalization

MAPS: 通过模块级接近调度保留视觉-语言表示以实现更好的视觉-语言-动作泛化

Chengyue Huang, Mellon M. Zhang, Robert Azarcon, Glen Chou, Zsolt Kira

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MAPS通过模块级接近调度优化VLA微调,提升视觉-语言-动作任务的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19971 2025-11-26 cs.CV 50%

VGGT4D: Mining Motion Cues in Visual Geometry Transformers for 4D Scene Reconstruction

VGGT4D: 从视觉几何变换器中挖掘运动线索用于4D场景重建

Yu Hu, Chong Cheng, Sicheng Yu, Xiaoyang Guo, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 指令微调 :foundation model(abstract)

AI总结 VGGT4D通过挖掘视觉几何变换器中的运动线索,提出无需训练的4D场景重建框架,提升动态物体分割、姿态估计和密集重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 4 篇

2505.16690 2025-11-26 cs.LG cs.AI 86%

Your Pre-trained LLM is Secretly an Unsupervised Confidence Calibrator

你的预训练大语言模型实际上是一个未监督的置信度校准器

Beier Luo, Shuoyuan Wang, Sharon Li, Hongxin Wei

机构 * Department of Statistics and Data Science, Southern University of Science and Technology(统计与数据科学系,南方科技大学) Department of Computer Sciences, University of Wisconsin-Madison(计算机科学系,威斯康星大学麦迪逊分校)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出DACA方法,通过无监督方式优化后训练模型的置信度校准,减少不一致预测带来的过度自信问题,提升模型可靠性。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19504 2025-11-26 cs.LG stat.ML 86%

Position: The Complexity of Perfect AI Alignment -- Formalizing the RLHF Trilemma

位置:完美AI对齐的复杂性——形式化RLHF三重困境

Subramanyam Sahoo, Aman Chadha, Vinija Jain, Divya Chaudhary

机构 * Berkeley AI Safety Initiative (BASIS), University of California, Berkeley(伯克利人工智能安全倡议(BASIS),加州大学伯克利分校) AWS Generative AI Innovation Center, Amazon Web Services(亚马逊网络服务生成式人工智能创新中心) Meta AI Stanford University(斯坦福大学) Northeastern University, Seattle, WA, USA(东北大学,西雅图,华盛顿州,美国)

专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究提出RLHF三重困境,指出在安全、公平和稳健之间存在根本性权衡,并通过复杂性分析证明实现全球代表性需要超多项式计算资源。

Comments Accepted at NeurIPS 2025 Workshop on Socially Responsible and Trustworthy Foundation Models (ResponsibleFM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08746 2025-11-26 cs.LG 81%

Interpretable Reward Model via Sparse Autoencoder

通过稀疏自编码器的可解释奖励模型

Shuyi Zhang, Wei Shi, Sihang Li, Jiayi Liao, Hengxing Cai, Xiang Wang

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 SARM通过整合预训练稀疏自编码器,提升奖励模型的可解释性和对齐性能。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20256 2025-11-26 cs.CV 50%

The Image as Its Own Reward: Reinforcement Learning with Adversarial Reward for Image Generation

图像作为自身奖励:基于对抗性奖励的图像生成强化学习

Weijia Mao, Hao Chen, Zhenheng Yang, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 后训练与偏好优化 :foundation model(abstract)

AI总结 本文提出Adv-GRPO框架,通过对抗性奖励提升图像生成质量,利用图像自身作为奖励,结合参考图像和基础模型,实现更高质量和审美效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长上下文与记忆 4 篇

2509.00882 2025-11-26 cs.CR 85%

VULSOLVER: Vulnerability Detection via LLM-Driven Constraint Solving

通过LLM驱动的约束求解进行漏洞检测:VULSOLVER

Xiang Li, Yueci Su, Jiahao Liu, Zhiwei Lin, Yuebing Hou, Peiming Gao, Yuanchao Zhang

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 VULSOLVER通过LLM驱动的约束求解方法,实现高精度漏洞检测,准确率达97.85%

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17407 2025-11-26 cs.CL cs.LG 84%

A Comprehensive Survey on Long Context Language Modeling

对长上下文语言模型的全面综述

Jiaheng Liu, Dawei Zhu, Zhiqi Bai, Yancheng He, Huanxuan Liao, Haoran Que, Zekun Wang, Chenchen Zhang, Ge Zhang, Jiebin Zhang, Yuanxing Zhang, Zhuo Chen, Hangyu Guo, Shilong Li, Ziqiang Liu, Yong Shan, Yifan Song, Jiayi Tian, Wenhao Wu, Zhejian Zhou, Ruijie Zhu, Junlan Feng, Yang Gao, Shizhu He, Zhoujun Li, Tianyu Liu, Fanyu Meng, Wenbo Su, Yingshui Tan, Zili Wang, Jian Yang, Wei Ye, Bo Zheng, Wangchunshu Zhou, Wenhao Huang, Sujian Li, Zhaoxiang Zhang

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 本文综述了长上下文语言模型的最新进展,涵盖模型构建、训练部署及评估分析,为研究人员和工程师提供全面的资源。

详情

展开后加载摘要…

URL PDF HTML 收藏