arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 139420 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12429 篇

2502.12170 2025-05-29 cs.LG cs.AI cs.CL 75%

MUDDFormer: Breaking Residual Bottlenecks in Transformers via Multiway Dynamic Dense Connections

Da Xiao, Qingye Meng, Shengping Li, Xingyuan Yuan

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to the 42nd International Conference on Machine Learning (ICML'25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12833 2025-05-29 cs.CV 75%

FocusChat: Text-guided Long Video Understanding via Spatiotemporal Information Filtering

Zheng Cheng, Rendong Wang, Zhicheng Wang

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12953 2025-05-28 cs.CL cs.AI cs.LG 75%

Task-Informed Anti-Curriculum by Masking Improves Downstream Performance on Text

Andrei Jarca, Florinel Alin Croitoru, Radu Tudor Ionescu

机构 * University of Bucharest(布加勒斯特大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.09617 2025-05-20 cs.HC 75%

How Good is ChatGPT in Giving Advice on Your Visualization Design?

Nam Wook Kim, Yongsu Ahn, Grace Myers, Benjamin Bach

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

Comments 34 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12236 2025-05-20 cs.CL cs.AI cs.LG 75%

Bridging Generative and Discriminative Learning: Few-Shot Relation Extraction via Two-Stage Knowledge-Guided Pre-training

Quanjiang Guo, Jinchuan Zhang, Sijie Wang, Ling Tian, Zhao Kang, Bin Yan, Weidong Xiao

机构 * University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) Information Engineering University(信息工程大学) National University of Defense Technology(国防科技大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 13 pages, 6 figures, Appear on IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10562 2025-05-16 cs.CV 75%

End-to-End Vision Tokenizer Tuning

Wenxuan Wang, Fan Zhang, Yufeng Cui, Haiwen Diao, Zhuoyan Luo, Huchuan Lu, Jing Liu, Xinlong Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Dalian University of Technology(大连理工大学) Tsinghua University(清华大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02550 2025-05-12 cs.LG cs.AI cs.CL 75%

Bielik v3 Small: Technical Report

Krzysztof Ociepa, Łukasz Flis, Remigiusz Kinas, Krzysztof Wróbel, Adrian Gwoździej

机构 * SpeakLeash ACK Cyfronet AGH Jagiellonian University(雅盖隆大学) Azurro Enelpol

专题命中 预训练与数据 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18086 2025-05-02 cs.RO cs.AI cs.CL cs.GR cs.LG 75%

Generating Traffic Scenarios via In-Context Learning to Learn Better Motion Planner

Aizierjiang Aiersilan

机构 * Aizierjiang Aiersilan(独立研究者)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments We are excited to announce that this paper has been accepted for oral presentation at the AAAI 2025 Main Conference. We are grateful for the insightful feedback from the reviewers and look forward to contributing to the discussions at AAAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13181 2025-04-30 cs.CV 75%

Perception Encoder: The best visual embeddings are not at the output of the network

Daniel Bolya, Po-Yao Huang, Peize Sun, Jang Hyun Cho, Andrea Madotto, Chen Wei, Tengyu Ma, Jiale Zhi, Jathushan Rajasegaran, Hanoona Rasheed, Junke Wang, Marco Monteiro, Hu Xu, Shiyu Dong, Nikhila Ravi, Daniel Li, Piotr Dollár, Christoph Feichtenhofer

机构 * Meta FAIR Fudan University(复旦大学) Meta Reality Labs

专题命中 预训练与数据 :LLM(abstract);language model(abstract);pretraining(abstract)

Comments Updated refs, fixed typos, and added new COCO SotA: 66.0 val mAP! Code, models, and data at https://github.com/facebookresearch/perception_models

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01163 2025-04-25 cs.CV 75%

3D-LLaVA: Towards Generalist 3D LMMs with Omni Superpoint Transformer

Jiajun Deng, Tianyu He, Li Jiang, Tianyu Wang, Feras Dayoub, Ian Reid

机构 * Australian Institute for Machine Learning, The University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学) Microsoft Research(微软研究院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学)

专题命中 预训练与数据 :LLM(abstract);instruction tuning(abstract);pretraining(abstract)

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04918 2025-04-25 cs.CV 75%

Training-free Zero-shot Composed Image Retrieval via Weighted Modality Fusion and Similarity

Ren-Di Wu, Yu-Yen Lin, Huei-Fang Yang

机构 * National Sun Yat-sen University(国立中山大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract)

Comments 14 pages, 6 figures, International Conference on Technologies and Applications of Artificial Intelligence (TAAI) Camera Ready

Journal ref Technologies and Applications of Artificial Intelligence, pp. 77-90, Springer, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16000 2025-04-23 stat.ML cs.AI cs.CL cs.CR cs.LG 75%

How Private is Your Attention? Bridging Privacy with In-Context Learning

Soham Bonnerjee, Zhen Wei, Yeon, Anna Asch, Sagnik Nandy, Promit Ghosal

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14808 2025-04-22 cs.CL cs.AI cs.IR cs.LG 75%

On Self-improving Token Embeddings

Mario M. Kubek, Shiraj Pokharel, Thomas Böhme, Emma L. McDaniel, Herwig Unger, Armin R. Mikler

机构 * Georgia State University(佐治亚州立大学) Technische Universität Ilmenau(伊伦姆阿大学) FernUniversität in Hagen(哈根弗伦大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 18 pages, 4 figures, 3 tables, accepted at the 2025 25th International Conference on Innovations for Community Services (I4CS), June 11 - 13, Munich, Germany, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11546 2025-04-07 cs.CL cs.AI cs.LG 75%

Memorization in In-Context Learning

Shahriar Golchin, Mihai Surdeanu, Steven Bethard, Eduardo Blanco, Ellen Riloff

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments v3

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24062 2025-04-01 cs.CL cs.AI cs.LG 75%

Artificial Conversations, Real Results: Fostering Language Detection with Synthetic Data

Fatemeh Mohammadi, Tommaso Romano, Samira Maghool, Paolo Ceravolo

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23448 2025-04-01 cs.SE cs.AI cs.CL cs.LG 75%

Semantic-Preserving Transformations as Mutation Operators: A Study on Their Effectiveness in Defect Detection

Max Hort, Linas Vidziunas, Leon Moonen

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted for publication in Mutation 2025 at the 18th IEEE International Conference on Software Testing, Verification and Validation (ICST 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19199 2025-03-26 cs.CV 75%

Open-Vocabulary Functional 3D Scene Graphs for Real-World Indoor Spaces

Chenyangguang Zhang, Alexandros Delitzas, Fangjinhua Wang, Ruida Zhang, Xiangyang Ji, Marc Pollefeys, Francis Engelmann

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract)

Comments Accepted at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07279 2025-03-26 cs.AI cs.CL cs.LG 75%

The Surprising Effectiveness of Test-Time Training for Few-Shot Learning

Ekin Akyürek, Mehul Damani, Adam Zweiger, Linlu Qiu, Han Guo, Jyothish Pari, Yoon Kim, Jacob Andreas

专题命中 预训练与数据 :language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09398 2025-03-24 eess.AS cs.SD 75%

Language-Queried Target Sound Extraction Without Parallel Training Data

Hao Ma, Zhiyuan Peng, Xu Li, Yukai Li, Mingjie Shao, Qiuqiang Kong, Ju Liu

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

Comments Accepted by ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13642 2025-03-20 cs.SE 75%

A Multi-Agent Approach to Fault Localization via Graph-Based Retrieval and Reflexion

Md Nakhla Rafi, Dong Jae Kim, Tse-Hsun Chen, Shaowei Wang

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13447 2025-03-18 cs.CL cs.AI cs.LG 75%

MetaScale: Test-Time Scaling with Evolving Meta-Thoughts

Qin Liu, Wenxuan Zhou, Nan Xu, James Y. Huang, Fei Wang, Sheng Zhang, Hoifung Poon, Muhao Chen

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14042 2025-03-12 cs.CV 75%

CAD-Recode: Reverse Engineering CAD Code from Point Clouds

Danila Rukhovich, Elona Dupont, Dimitrios Mallis, Kseniya Cherenkova, Anis Kacem, Djamila Aouada

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05529 2025-03-10 stat.AP cs.SI 75%

PoSSUM: A Protocol for Surveying Social-media Users with Multimodal LLMs

Roberto Cerina

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02318 2025-03-07 cs.CL cs.AI cs.LG cs.LO 75%

Autoformalizing Natural Language to First-Order Logic: A Case Study in Logical Fallacy Detection

Abhinav Lalwani, Tasha Kim, Lovish Chopra, Christopher Hahn, Zhijing Jin, Mrinmaya Sachan

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20299 2025-02-28 cs.LG cs.AI cs.CL 75%

An exploration of features to improve the generalisability of fake news detection models

Nathaniel Hoy, Theodora Koulouri

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at Expert Systems with Applications (Elsevier)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19038 2025-02-27 cs.CV 75%

FungalZSL: Zero-Shot Fungal Classification with Image Captioning Using a Synthetic Data Approach

Anju Rani, Daniel O. Arroyo, Petar Durdevic

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

Comments 11 pages, 5 Figures, 1 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17428 2025-02-26 cs.CL cs.AI cs.IR cs.LG 75%

NV-Embed: Improved Techniques for Training LLMs as Generalist Embedding Models

Chankyu Lee, Rajarshi Roy, Mengyao Xu, Jonathan Raiman, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping

专题命中 预训练与数据 :LLM(abstract);instruction tuning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICLR 2025 (Spotlight). We open-source the model at: https://huggingface.co/nvidia/NV-Embed-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15370 2025-02-24 cs.CV 75%

Weakly Supervised Video Scene Graph Generation via Natural Language Supervision

Kibum Kim, Kanghoon Yoon, Yeonjun In, Jaehyeong Jeon, Jinyoung Moon, Donghyun Kim, Chanyoung Park

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

Comments 10 pages, ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16125 2025-02-12 cs.IR 75%

SampleLLM: Optimizing Tabular Data Synthesis in Recommendations

Jingtong Gao, Zhaocheng Du, Xiaopeng Li, Yichao Wang, Xiangyang Li, Huifeng Guo, Ruiming Tang, Xiangyu Zhao

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03549 2025-02-11 cs.CV 75%

Kronecker Mask and Interpretive Prompts are Language-Action Video Learners

Jingyi Yang, Zitong Yu, Xiuming Ni, Jia He, Hui Li

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract)

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏