Pretraining and adapting a language model on a dependency-free stack: GPT-2 124M from random weights, reproduced against llm.c, and a clinical adapter for Qwen3-0.6B
Pretraining and adapting a language model on a dependency-free stack: GPT-2 124M from random weights
Deep Dive
Computer Science > Software Engineering arXiv:2609.28568 (cs) [Submitted on 23 Sep 2026] Title: Pretraining and adapting a language model on a dependency-free stack: GPT-2 124M from random weights, reproduced against llm.c, and a clinical adapter for Qwen3-0.6B Authors: Thang Tran (CloudKites AI Lab