arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12460 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12460 篇

2410.23904 2024-12-20 cs.CV 75%

EZ-HOI: VLM Adaptation via Guided Prompt Learning for Zero-Shot HOI Detection

Qinqian Lei, Bo Wang, Robby T. Tan

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12513 2024-12-18 cs.SE 75%

Generating Move Smart Contracts based on Concepts

Rabimba Karanjai, Sam Blackshear, Lei Xu, Weidong Shi

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12502 2024-12-18 cs.CV 75%

Track the Answer: Extending TextVQA from Image to Video with Spatio-Temporal Clues

Yan Zhang, Gangyan Zeng, Huawen Shen, Daiqing Wu, Yu Zhou, Can Ma

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract)

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10635 2024-12-17 econ.EM 75%

Do LLMs Act as Repositories of Causal Knowledge?

Nick Huntington-Klein, Eleanor J. Murray

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

Comments 8 figures, 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17569 2024-12-16 cs.CR cs.AR 75%

RTL-Breaker: Assessing the Security of LLMs against Backdoor Attacks on HDL Code Generation

Lakshmi Likhitha Mankali, Jitendra Bhandari, Manaar Alam, Ramesh Karri, Michail Maniatakos, Ozgur Sinanoglu, Johann Knechtel

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

Comments Accepted at 2025 Design, Automation & Test in Europe (DATE) Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09604 2024-12-13 cs.CV 75%

SynerGen-VL: Towards Synergistic Image Understanding and Generation with Vision Experts and Token Folding

Hao Li, Changyao Tian, Jie Shao, Xizhou Zhu, Zhaokai Wang, Jinguo Zhu, Wenhan Dou, Xiaogang Wang, Hongsheng Li, Lewei Lu, Jifeng Dai

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06673 2024-12-10 cs.CV 75%

ILLUME: Illuminating Your LLMs to See, Draw, and Self-Enhance

Chunwei Wang, Guansong Lu, Junwei Yang, Runhui Huang, Jianhua Han, Lu Hou, Wei Zhang, Hang Xu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05619 2024-12-10 cs.CV 75%

Do We Need to Design Specific Diffusion Models for Different Tasks? Try ONE-PIC

Ming Tao, Bing-Kun Bao, Yaowei Wang, Changsheng Xu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract)

Comments 11 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05388 2024-12-10 cs.CL cs.AI cs.LG 75%

CALICO: Conversational Agent Localization via Synthetic Data Generation

Andy Rosenbaum, Pegah Kharazmi, Ershad Banijamali, Lu Zeng, Christopher DiPersio, Pan Wei, Gokmen Oz, Clement Chung, Karolina Owczarzak, Fabian Triefenbach, Wael Hamza

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to The 37th International Conference on Neural Information Processing Systems (NeurIPS 2023) December 10-16, 2023 - SyntheticData4ML Workshop, New Orleans, United States https://neurips.cc/virtual/2023/workshop/66540

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04432 2024-12-06 cs.CV 75%

Divot: Diffusion Powers Video Tokenizer for Comprehension and Generation

Yuying Ge, Yizhuo Li, Yixiao Ge, Ying Shan

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

Comments Project released at: https://github.com/TencentARC/Divot

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07602 2024-12-03 cs.LG cs.AI cs.CC cs.CL 75%

Circuit Complexity Bounds for RoPE-based Transformer Architecture

Bo Chen, Xiaoyu Li, Yingyu Liang, Jiangxuan Long, Zhenmei Shi, Zhao Song

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15864 2024-11-22 cs.CV 75%

InterControl: Zero-shot Human Interaction Generation by Controlling Every Joint

Zhenzhi Wang, Jingbo Wang, Yixuan Li, Dahua Lin, Bo Dai

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

Comments NeurIPS 2024 camera ready version. TL;DR: Generate human interactions with only single-person motion data in training via joint contact pairs from LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09823 2024-11-18 cs.CV 75%

Architect: Generating Vivid and Interactive 3D Scenes with Hierarchical 2D Inpainting

Yian Wang, Xiaowen Qiu, Jiageng Liu, Zhehuan Chen, Jiting Cai, Yufei Wang, Tsun-Hsuan Wang, Zhou Xian, Chuang Gan

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06646 2024-11-12 cs.LG cs.AI cs.CL stat.ML 75%

Understanding Scaling Laws with Statistical and Approximation Theory for Transformer Neural Networks on Intrinsically Low-dimensional Data

Alex Havrilla, Wenjing Liao

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12034 2024-11-06 cs.CL cs.AI cs.LG 75%

Understanding Transformers via N-gram Statistics

Timothy Nguyen

专题命中 预训练与数据 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2024. Datasets and N-gram statistics open-sourced: https://github.com/google-deepmind/transformer_ngrams

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01663 2024-11-05 cs.LG cs.AI cs.CC cs.CL 75%

Unlocking the Theory Behind Scaling 1-Bit Neural Networks

Majid Daliri, Zhao Song, Chiwun Yang

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16273 2024-11-05 cs.CV 75%

M$^3$GPT: An Advanced Multimodal, Multitask Framework for Motion Comprehension and Generation

Mingshuang Luo, Ruibing Hou, Zhuo Li, Hong Chang, Zimo Liu, Yaowei Wang, Shiguang Shan

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

Comments Accepted at NeurIPS 2024, 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00552 2024-10-31 cs.RO cs.HC 75%

Long-Term Human Trajectory Prediction using 3D Dynamic Scene Graphs

Nicolas Gorlo, Lukas Schmid, Luca Carlone

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

Comments 8 pages, 6 figures. Accepted at IEEE Robotics and Automation Letters (RA-L). Code released at: https://github.com/MIT-SPARK/LP2

Journal ref IEEE Robotics and Automation Letters, vol. 9, no. 12, pp. 10978-10985, Dec. 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10225 2024-10-31 cs.CL cs.AI cs.IR cs.LG 75%

ChatQA: Surpassing GPT-4 on Conversational QA and RAG

Zihan Liu, Wei Ping, Rajarshi Roy, Peng Xu, Chankyu Lee, Mohammad Shoeybi, Bryan Catanzaro

专题命中 预训练与数据 :foundation model(abstract);instruction tuning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02369 2024-10-30 cs.CV 75%

Unleashing the Potential of the Diffusion Model in Few-shot Semantic Segmentation

Muzhi Zhu, Yang Liu, Zekai Luo, Chenchen Jing, Hao Chen, Guangkai Xu, Xinlong Wang, Chunhua Shen

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract)

Comments Accepted to Proc. Annual Conference on Neural Information Processing Systems (NeurIPS) 2024. Webpage: https://github.com/aim-uofa/DiffewS

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19954 2024-10-29 cs.CV 75%

Turn-by-Turn Indoor Navigation for the Visually Impaired

Santosh Srinivasaiah, Sai Kumar Nekkanti, Rohith Reddy Nedhunuri

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11029 2024-10-28 cs.CL cs.AI cs.LG 75%

Scaling Law with Learning Rate Annealing

Howe Tissue, Venus Wang, Lu Wang

专题命中 预训练与数据 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Add more experiments to consolidate our scaling laws. 29 pages, 29 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15625 2024-10-28 cs.CL cs.AI cs.LG 75%

Shortcomings of LLMs for Low-Resource Translation: Retrieval and Understanding are Both the Problem

Sara Court, Micha Elsner

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Presented at the Ninth Conference on Machine Translation (WMT24)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15027 2024-10-22 cs.CV 75%

Group Diffusion Transformers are Unsupervised Multitask Learners

Lianghua Huang, Wei Wang, Zhi-Fan Wu, Huanzhang Dou, Yupeng Shi, Yutong Feng, Chen Liang, Yu Liu, Jingren Zhou

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04717 2024-10-21 cs.CL cs.AI cs.LG cs.SE 75%

$\textbf{Only-IF}$:Revealing the Decisive Effect of Instruction Diversity on Generalization

Dylan Zhang, Justin Wang, Francois Charton

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Fix formatting issues

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10864 2024-10-16 cs.CL cs.AI cs.LG 75%

Fill In The Gaps: Model Calibration and Generalization with Synthetic Data

Yang Ba, Michelle V. Mancenido, Rong Pan

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to EMNLP 2024 Main Conference (Long paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19292 2024-10-15 cs.LG cs.AI cs.CL 75%

From Artificial Needles to Real Haystacks: Improving Retrieval Capabilities in LLMs by Finetuning on Synthetic Data

Zheyang Xiong, Vasilis Papageorgiou, Kangwook Lee, Dimitris Papailiopoulos

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07408 2024-10-15 cs.CE 75%

Multimodal Language and Graph Learning of Adsorption Configuration in Catalysis

Janghoon Ock, Srivathsan Badrinarayanan, Rishikesh Magar, Akshay Antony, Amir Barati Farimani

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract)

Comments manuscript updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17840 2024-10-08 cs.CL cs.AI cs.CR cs.LG 75%

Follow My Instruction and Spill the Beans: Scalable Data Extraction from Retrieval-Augmented Generation Systems

Zhenting Qi, Hanlin Zhang, Eric Xing, Sham Kakade, Himabindu Lakkaraju

专题命中 预训练与数据 :language model(abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03049 2024-10-07 cs.CL cs.AI cs.IR cs.LG 75%

Scalable Frame-based Construction of Sociocultural NormBases for Socially-Aware Dialogues

Shilin Qu, Weiqing Wang, Xin Zhou, Haolan Zhan, Zhuang Li, Lizhen Qu, Linhao Luo, Yuan-Fang Li, Gholamreza Haffari

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 17 pages

Journal ref TOMM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏