arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-21 至 2026-04-21 共收录 803 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 112 篇

2604.17400 2026-04-21 cs.AI math.AT 70%

Phase-Scheduled Multi-Agent Systems for Token-Efficient Coordination

相调度多智能体系统用于令牌高效协调

Mohit Dubey

机构 * Open Gigantic(开放巨量)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出相调度多智能体系统,通过连续控制共享注意力空间实现高效协调,显著降低令牌消耗并保持任务性能。

Comments 8 pages, pre print, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17397 2026-04-21 cs.CV cs.AI 70%

Speculative Decoding for Autoregressive Video Generation

推测解码用于自回归视频生成

Yuezhou Hu, Jintao Zhang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了推测解码在自回归视频生成中的应用,通过引入SDVG框架,利用图像质量路由替代token验证,实现高效视频生成,同时保持高质量并提升生成速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17304 2026-04-21 cs.AI 70%

Efficient Test-Time Scaling via Temporal Reasoning Aggregation

通过时间推理聚合实现高效的测试时扩展

Jiakun Li, Xingwei He, Kefan Li, Hongzheng Chai, Hongyue Yu, Yuan Yuan

机构 * School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) Qingdao Research Institute, Beihang University(北航青岛研究院) Hangzhou Innovation Institute, Beihang University(北航杭州创新研究院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出TRACE框架,通过时间聚合多步骤证据实现高效测试时扩展,减少推理token使用25-30%,保持准确性,优于现有动态推理方法。

Comments Accepted to Findings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14493 2026-04-21 cs.AI 70%

Pushing the Limits of On-Device Streaming ASR: A Compact, High-Accuracy English Model for Low-Latency Inference

推动端设备流式语音识别的极限:一种紧凑、高精度的英文模型用于低延迟推断

Nenad Banfic, David Fan, Kunal Vaishnavi, Sam Kemp, Sunghoon Choi, Rui Ren, Sayan Shaw, Meng Tang

机构 * CoreAI, Microsoft(微软核心人工智能)

专题命中 效率与部署 :LLM(abstract);post-training(abstract);分类 cs.AI

AI总结 本文研究了端设备上部署高质量语音识别模型的需求,通过评估多种架构在不同推理模式下的表现,确定NVIDIA的Nemotron Speech Streaming为最佳选择,并通过优化降低模型大小至0.67GB,同时保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13468 2026-04-21 cs.IR cs.CL 70%

From Relevance to Authority: Authority-aware Generative Retrieval in Web Search Engines

从相关性到权威性:面向网页搜索引擎的权威感知生成检索

Sunkyung Lee, Jihye Back, Donghyeon Jeon, Soonhwan Kwon, Moonkwon Kim, Inho Kang, Jongwuk Lee

机构 * Sungkyunkwan University(成均馆大学) Naver Corporation(Naver公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出权威感知生成检索框架AuthGR,通过多模态权威评分、三阶段训练和混合集成流程提升检索的权威性和准确性,在实际应用中显著提高用户参与度和可靠性。

Comments ACL 2026 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24328 2026-04-21 cs.CL 70%

Speculative Verification: Exploiting Information Gain to Refine Speculative Decoding

推测验证:利用信息增益来细化推测解码

Sungkyun Kim, Jaemin Kim, Dogyung Yoon, Jiho Shin, Junyeol Lee, Jiwon Seo

机构 * Hanyang University(翰阳大学) Seoul National University(首尔国立大学) KAIST(韩国科学技术院) Machine Learning Systems Lab(机器学习系统实验室)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出推测验证(SV),通过动态预测推测准确性并调整验证长度来提升推测解码效率,实验证明SV在多个NLP任务中显著优于SD和标准解码。

Comments 16 pages, 8 figures, accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16682 2026-04-21 cs.DC cs.AI 70%

KAIROS: Stateful, Context-Aware Power-Efficient Agentic Inference Serving

KAIROS:具有状态的、基于上下文的节能代理推理服务

Yichao Yuan, Mosharaf Chowdhury, Nishil Talati

机构 * University of Illinois, Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan(密歇根大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出KAIROS,一种基于上下文的节能代理AI服务系统,通过管理GPU频率、实例并发性和请求分配,实现27%的平均能耗降低,同时保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16462 2026-04-21 cs.CV cs.AI 70%

From Inheritance to Saturation: Disentangling the Evolution of Visual Redundancy for Architecture-Aware MLLM Inference Acceleration

从继承到饱和:解构视觉冗余的演化以实现架构感知的MLLM推理加速

Jiaqi Shi, Yuechan Li, Xulong Zhang, Xiaoyang Qu, Jianzong Wang

机构 * University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学) Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出HalfV框架,通过统一剪枝策略缓解内在视觉冗余,并根据具体表现适应性处理二次饱和冗余,实现跨架构的高效推理。

Comments 16 pages, 14 figures, plus appendix, accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16367 2026-04-21 cs.CY cs.AI 70%

Talk, Walk, and Market Response: Multimodal Measurement of AI Washing and Its Capital Market Consequences in China

讲话、行走与市场反应:多模态测量AI洗绿及其资本市场后果在中国

Wen Zhanjie, Guo Jingqiao

机构 * School of Economics and Trade, Guangdong University of Finance(广东金融学院经济贸易学院) Department of Computer Science, Faculty of Science, Hong Kong Baptist University(香港 Baptist 大学科学学院计算机科学系)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过多模态方法测量中国AI洗绿现象,发现其对资本市场的负面影响,揭示了AI投资与实际创新之间的关系及市场反应机制。

Comments 18 pages, 3 figures, 7 tables, academic research paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16301 2026-04-21 cs.IR cs.AI 70%

Domain-Specific Query Understanding for Automotive Applications: A Modular and Scalable Approach

面向汽车应用的领域特定查询理解:一种模块化和可扩展的方法

Isha Motiyani, Abhishek Kumar, Tilak Kasturi

机构 * Predii

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种模块化方法,通过分解查询理解任务提升汽车领域查询处理的效率和准确性,同时构建高质量数据集以支持系统部署。

Comments 11 pages, 2 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17977 2026-04-21 cs.SE 67%

MASFuzzer: Fuzz Driver Generation and Adaptive Scheduling via Multidimensional API Sequences

MASFuzzer: 通过多维API序列生成和自适应调度进行驱动生成

Xingyu Liu, Zengqin Huang, Xiang Gao, Hailong Sun

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 MASFuzzer通过多维API序列生成和自适应调度策略提升软件库测试效率,实现更高的代码覆盖率和漏洞发现能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05777 2026-04-21 cs.SE 67%

EET: Experience-Driven Early Termination for Cost-Efficient Software Engineering Agents

EET:基于经验的早期终止以提高软件工程代理的效率

Yaoqi Guo, Ying Xiao, Jie M. Zhang, Mark Harman, Yiling Lou, Yang Liu, Zhenpeng Chen

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出EET方法,通过利用历史经验减少软件工程代理的运行成本,同时保持任务性能,实验显示在SWE-bench基准上平均节省19%-55%的成本,且解决率损失极小。

Comments Accepted by the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026) Findings Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21613 2026-04-21 cs.DC 67%

Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection

Chameleon:通过实时策略选择实现分布式训练的自适应容错

Yuhang Zhou, Zhibin Wang, Peng Jiang, Haoran Xia, Junhe Lu, Qianyu Jiang, Rong Gu, Hengxi Xu, Xinjing Huang, Guanghuan Fang, Zhiheng Hu, Jingyi Zhang, Yongjin Cai, Jian He, Chen Tian

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出Chameleon系统,通过统一性能模型和高效执行计划搜索,在故障发生时智能选择最优恢复策略,实验表明其在保持模型收敛和内存效率的同时,比现有方法提升了1.229倍和1.355倍的平均吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17816 2026-04-21 cs.CR 67%

Privacy-Preserving Product-Quantized Approximate Nearest Neighbor Search Framework for Large-scale Datasets via A Hybrid of Fully Homomorphic Encryption and Trusted Execution Environment

面向大规模数据集的隐私保护产品量化近邻搜索框架:通过全同态加密和可信执行环境的混合方案

Shozo Saeki, Minoru Kawahara, Hirohisa Aman

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出PPPQ-ANN框架,结合全同态加密和可信执行环境,优化大规模数据集的隐私保护近邻搜索,实现快速数据库生成和高吞吐量检索。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17475 2026-04-21 cs.AI cs.CL cs.LG 67%

Waking Up Blind: Cold-Start Optimization of Supervision-Free Agentic Trajectories for Grounded Visual Perception

觉醒失明:为基于视觉感知的代理轨迹进行无监督的冷启动优化

Ashutosh Bajpai, Tamal Majumder, Akshay Nambi, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi(印度理工学院德里) Indian Institute of Technology Abu Dhabi(印度理工学院阿布扎比) Microsoft Research(微软研究院)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SPECTRA框架,通过冷启动强化学习提升小视觉语言模型的视觉鲁棒性和工具协调能力,无需监督即可提高任务准确性和工具效率。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10937 2026-04-21 cs.IR 67%

Benchmarking and Enabling Efficient Chinese Medical Retrieval via Asymmetric Encoders

通过不对称编码器评估并实现高效的中文医疗检索

Angqing Jiang, Jianlyu Chen, Zhe Fang, Yongcan Wang, Xinpeng Li, Keyu Ding, Defu Lian

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本文提出CMedTEB基准,结合检索、重排序和语义文本相似性任务,引入CARE不对称检索器,通过两阶段训练策略提升性能,实现高效医疗检索。

Comments 21 pages, 4 figures. Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08480 2026-04-21 cs.CV cs.IR 67%

Compressing then Matching: An Efficient Pre-training Paradigm for Multimodal Embedding

压缩后再匹配:一种高效的多模态嵌入预训练范式

Da Li, Yuxiao Luo, Keping Bi, Jiafeng Guo, Wei Yuan, Biao Yang, Yan Wang, Fan Yang, Tingting Gao, Guorui Zhou

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Kuaishou Technology(快手科技)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出CoMa,一种高效的多模态嵌入预训练方法,通过压缩预训练阶段提升对比学习效率,实现多模态嵌入模型的高效优化。

Comments ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16698 2026-04-21 cs.CL cs.AI 62%

Hierarchical Retrieval with Out-Of-Vocabulary Queries: A Case Study on SNOMED CT

具有词汇外查询的分层检索:一项SNOMED CT案例研究

Jonathon Dilworth, Hui Yang, Jiaoyan Chen, Yongsheng Gao, Ernesto Jimenez-Ruiz

机构 * The University of Manchester(曼彻斯特大学) SNOMED International(SNOMED国际) City St George’s, University of London(伦敦大学城圣乔治学院)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了SNOMED CT中词汇外查询的分层概念检索问题,提出基于语言模型的本体嵌入方法,在双曲空间中实现高效子概念推理,优于基线方法。

Comments 21 pages, 5 figures, 8 tables, submission to the Transactions on Graph Data and Knowledge (TGDK) journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17585 2026-04-21 cs.CV cs.AI cs.LG 62%

DGSSM: Diffusion guided state-space models for multimodal salient object detection

DGSSM:基于扩散引导的状态空间模型的多模态显著目标检测

Suklav Ghosh, Arijit Sur, Pinaki Mitra

机构 * Dept. of Computer Science and Engineering, Indian Institute of Technology, Guwahati(计算机科学与工程系,印度理工学院,果阿提)

专题命中 效率与部署 :prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DGSSM,一种结合扩散模型结构先验和多尺度状态空间编码的多模态显著目标检测框架,通过迭代Mamba扩散细化机制提升边界精度,实验表明其在多个评估指标上优于现有方法。

Comments Accepted at ICPR 2026. Diffusion-guided Mamba framework for multimodal salient object detection. Evaluated on 13 benchmarks (RGB, RGB-D, RGB-T)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13707 2026-04-21 cs.CV cs.AI cs.LG 62%

Attention-space Contrastive Guidance for Efficient Hallucination Mitigation in LVLMs

注意力空间对比引导用于高效缓解大视觉-语言模型中的幻觉

Yujin Jo, Sangyoon Bae, Taesup Kim

机构 * Seoul National University(首尔国立大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Attention-space Contrastive Guidance方法,通过对比引导生成更视觉一致且语义忠实的文本,实验表明在CHAIR和POPE数据集上提升了忠实度并降低了延迟。

Comments Accepted at CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16441 2026-04-21 cs.SD cs.AI cs.CL 62%

iPhoneme: Brain-to-Text Communication for ALS Using ConformerXL Decoding

iPhoneme:基于ALS的脑-文本通信系统使用ConformerXL解码

Yoonmin Cha, Dawit Chun, Sung Park

机构 * School of Data Science and Artificial Intelligence(数据科学与人工智能学院) Taejae University(泰雅大学)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI

AI总结 iPhoneme通过集成建模和交互设计,解决ALS患者脑机接口中的解码准确性和输入接口限制问题,实现高精度的脑-文本通信。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18452 2026-04-21 cs.CV cs.CL 57%

ESsEN: Training Compact Discriminative Vision-Language Transformers in a Low-Resource Setting

ESsEN: 在低资源环境下训练紧凑的判别视觉-语言变换器

Clayton Fields, Casey Kennington

机构 * Department of Computer Science(计算机科学系)

专题命中 效率与部署 :language model(abstract);分类 cs.CL

AI总结 本文提出ESsEN模型,通过双塔编码器结构和传统卷积网络,实现低资源环境下高效视觉-语言模型训练,实验表明其参数量仅为其他模型的分数,性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18117 2026-04-21 cs.LG 57%

LoRaQ: Optimized Low Rank Approximation for 4-bit Quantization

LoRaQ:面向4位量化优化的低秩近似

Yann Bouquet, Alireza Khodamoradi, Sophie Yáng Shen, Kristof Denolf, Mathieu Salzmann

机构 * Computer Vision Laboratory, Ecole Polytechnique Fédérale de Lausanne, Lausanne, Switzerland(瑞士洛桑联邦理工学院计算机视觉实验室) Research and Advancement Development Team, Advanced Micro Devices, Inc, USA(美国高级微器件公司研发与进步发展团队)

专题命中 效率与部署 :post-training(abstract);分类 cs.LG

AI总结 LoRaQ通过简化校准方法,实现了无需高精度分支的4位量化优化,首次提出全子16位流水线,提升Pixart-$Σ$和SANA模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17503 2026-04-21 cs.AI cs.MA 57%

SkillGraph: Self-Evolving Multi-Agent Collaboration with Multimodal Graph Topology

SkillGraph: 基于多模态图拓扑的自进化多智能体协作

Zheng Nie, Ruolin Shen, Xinlei Yu, Bo Yin, Jiangning Zhang, Xiaobin Hu

机构 * National University of Singapore, Singapore(新加坡国立大学) Technical University of Munich, Munich, Germany(慕尼黑技术大学) Zhejiang University, China(浙江大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 SkillGraph通过联合进化智能体能力与通信拓扑,解决视觉多智能体系统中固定拓扑和静态推理能力的问题,提升协作效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21257 2026-04-21 cs.CL 57%

MoCo: A One-Stop Shop for Model Collaboration Research

MoCo:模型协作研究的一站式解决方案

Shangbin Feng, Yuyang Bai, Ziyuan Yang, Yike Wang, Zhaoxuan Tan, Jiajie Yan, Zhenyu Lei, Wenxuan Ding, Weijia Shi, Haojin Wang, Zhenting Qi, Yuru Jiang, Heng Wang, Chengsong Huang, Yu Fei, Jihan Yao, Yilun Du, Luke Zettlemoyer, Yejin Choi, Yulia Tsvetkov

机构 * University of Washington(华盛顿大学) University of Notre Dame(诺特大学) University of Virginia(弗吉尼亚大学) New York University(纽约大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Harvard University(哈佛大学) Washington University in St. Louis(圣路易斯华盛顿大学) University of California Irvine(加州大学尔湾分校) Stanford University(斯坦福大学)

专题命中 效率与部署 :language model(abstract);分类 cs.CL

AI总结 本文提出MoCo库,提供26种模型协作方法及25个评估数据集,验证协作策略在多数场景下优于非协作模型,分析协作系统的有效性及未来研究方向。

Comments Moco is available at https://github.com/BunsenFeng/model_collaboration

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16621 2026-04-21 cs.IR cs.CL 57%

The Role of Vocabularies in Learning Sparse Representations for Ranking

词汇在学习用于排序的稀疏表示中的作用

Hiun Kim, Tae Kwan Lee, Taeryun Won

机构 * Naver

专题命中 效率与部署 :pretraining(abstract);分类 cs.CL

AI总结 研究通过构建BERT模型探讨词汇规模和预训练权重对稀疏表示检索性能的影响,发现ESPLADE模型在效率和效果上优于随机词汇模型。

Comments fix citation style; add some previous work description at the beginning of section 3;

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16683 2026-04-21 cs.RO cs.AI cs.CV 57%

Rewind-IL: Online Failure Detection and State Respawning for Imitation Learning

Rewind-IL:在线故障检测与状态重置用于模仿学习

Gehan Zheng, Sanjay Seenivasan, Matthew Johnson-Roberson, Weiming Zhi

机构 * College of Connected Computing, Vanderbilt University(范德比尔特大学连接计算学院) School of Computer Science, University of Waterloo(滑铁卢大学计算机科学学院) School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) Australian Centre for Robotics, The University of Sydney(悉尼大学机器人研究中心)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 Rewind-IL通过零样本故障检测和状态重置机制,提升模仿学习在长时域任务中的可靠性,解决执行漂移问题。

Comments 9 pages, 8 figures, 6 tables. Project page at https://sjay05.github.io/rewind-il

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17187 2026-04-21 cs.SE 50%

React-ing to Grace Hopper 200: Five Open-Weights Coding Models, One React Native App, One GH200, One Weekend

回应格蕾丝·霍普200周年:五个开源权重编码模型,一个React Native应用,一个GH200,一个周末

Alex Potanin

专题命中 效率与部署 :language model(abstract)

AI总结 评估五个最先进的开源权重编码语言模型在生成React Native应用任务中的表现,发现Kimi-K2.5在3位量化下表现最佳,揭示了部署中的新发现及硬件层级结构。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 领域大模型 63 篇

2604.17988 2026-04-21 cs.CL 92%

Employing General-Purpose and Biomedical Large Language Models with Advanced Prompt Engineering for Pharmacoepidemiologic Study Design

利用通用和生物医药大语言模型与先进提示工程进行药事流行病学研究设计

Xinyao Zhang, Nicole Sonne Heckmann, Manuela Del Castillo Suero, Francesco Paolo Speca, Maurizio Sessa

机构 * Department of Drug Design and Pharmacology, University of Copenhagen(哥本哈根大学药物设计与药理学系)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract,abstract_cn)

AI总结 本文比较通用和生物医药大语言模型在药事流行病学研究设计中的表现,发现通用模型在相关性和逻辑性上表现更优,但提示策略对模型性能影响显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16425 2026-04-21 cs.DB cs.LG 92%

Method for Aggregating Unstructured Data Using Large Language Models

利用大语言模型聚合非结构化数据的方法

Vsevolod Lazebnyi, Natalia Tereshkina, Maria Shabarina, Dmitriy Fedorov

机构 * ITMO University(ITMO大学)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出一种利用大语言模型自动收集和聚合来自不同网页源的非结构化数据的方法,通过混合网页爬虫、非关系型数据库存储及LLM智能提取,解决现有技术在网页结构变化时的不稳定性及动态内容加载问题。

Comments 10 pages, 4 figures. Preprint. Accepted for ICMLC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏