227 Commits
Author SHA1 Message Date
Christian Medina 22d1bfd573 fix: use 4-bit model first, then bf16 with CPU offload 2026-07-01 14:43:30 -04:00
Christian Medina 3fa2cfe4cc fix: use DeepSpeed ZeRO-3 directly (skip CPU loading) 2026-07-01 14:41:48 -04:00
Christian Medina 3760aaf316 fix: rename output dir to ornith-35b-lora 2026-07-01 14:19:43 -04:00
Christian Medina 4287e42148 fix: remove screen, run training directly 2026-07-01 14:16:05 -04:00
Christian Medina 3bd51ec7db feat: add screen support to bypass cgroup limits 2026-07-01 14:09:34 -04:00
Christian Medina ce758f7eb5 feat: improve loading strategies with low_cpu_mem_usage and proper DeepSpeed config 2026-07-01 14:00:41 -04:00
Christian Medina 2d13e63c25 feat: add 4 loading strategies with automatic fallback 2026-07-01 13:55:23 -04:00
Christian Medina b300235be0 fix: load 4-bit model AS-IS without additional quantization 2026-07-01 13:53:43 -04:00
Christian Medina e967bd74f1 fix: skip quantization, use DeepSpeed ZeRO-3 CPU offload directly 2026-07-01 13:53:06 -04:00
Christian Medina 7539e39a93 fix: use accelerate load_checkpoint_and_dispatch for proper CPU offload 2026-07-01 13:39:51 -04:00
Christian Medina 528e7002ef feat: add 8-bit CPU offload fallback between 4-bit and bf16 2026-07-01 13:32:04 -04:00
Christian Medina 59ddfb45ed feat: add fallback to bf16 with CPU offload if 4-bit fails 2026-07-01 13:29:23 -04:00
Christian Medina b41d99f956 fix: remove broken quantization_config before loading 2026-07-01 13:12:57 -04:00
Christian Medina 1228a1f38b fix: load model first then quantize with BnB 2026-07-01 13:11:14 -04:00
Christian Medina 14042dbb44 fix: use pre-quantized 4bit model 2026-07-01 12:35:19 -04:00
Christian Medina f784d06f0a fix: load QLoRA directly to GPU (skip CPU) 2026-07-01 12:33:21 -04:00
Christian Medina 9471d5cc77 fix: cast learning_rate to float (YAML parses 2e-4 as string) 2026-07-01 11:19:00 -04:00
Christian Medina 2fa52cd9d4 fix: load QLoRA model to CPU first, DeepSpeed distributes 2026-07-01 09:37:20 -04:00
Christian Medina 2fa5173c56 feat: add prepare_model_for_kbit_training and update LoRA r=64 alpha=128 2026-07-01 07:48:44 -04:00
Christian Medina 357c9fa781 fix: use standard QLoRA pattern with BitsAndBytesConfig 2026-07-01 07:47:42 -04:00
Christian Medina da5eb3abed feat: implement QLoRA with 4-bit BitsAndBytes quantization 2026-07-01 07:45:33 -04:00
Christian Medina f0ee6bc9a2 fix: torch_dtype -> dtype (fix deprecation warning) 2026-07-01 07:38:36 -04:00
Christian Medina f651ca030c fix: convert warmup_ratio to warmup_steps (fix deprecation warning) 2026-07-01 07:37:47 -04:00
Christian Medina f47944ee75 fix: remove quantization_config after loading to bypass SFTTrainer check 2026-07-01 07:36:38 -04:00
Christian Medina 86b401c12f fix: convert FP8 to bf16 for PEFT compatibility 2026-07-01 07:30:10 -04:00
Christian Medina 6f631f00ae fix: use FP8 model with 32GB CPU offload 2026-07-01 07:29:32 -04:00
Christian Medina 9d92531c55 fix: use Ornith-1.0-35B bf16 base model (PEFT compatible) 2026-07-01 07:28:21 -04:00
Christian Medina 05ace2d38f fix: load NVFP4 as bf16 by overriding quantization config 2026-07-01 07:27:13 -04:00
Christian Medina be7b589c6b fix: use BitsAndBytes INT4 for PEFT compatibility 2026-07-01 00:34:34 -04:00
Christian Medina d7301d37dd fix: use float16 dtype to preserve NVFP4 quantization 2026-07-01 00:08:42 -04:00
Christian Medina af09d47c6f fix: load model to CPU first, let DeepSpeed distribute 2026-07-01 00:03:24 -04:00
Christian Medina 2c1251788d fix: add compressed-tensors to training dependencies 2026-06-30 23:56:59 -04:00
Christian Medina 905c2ba30d fix: preserve NVFP4 quantization, don't force bf16 2026-06-30 23:50:27 -04:00
Christian Medina 114e25fcfb fix: use device_map=auto to distribute model across GPUs 2026-06-30 23:45:57 -04:00
Christian Medina 8d4cdca3bb feat: use Ornith-1.0-35B-NVFP4 for training 2026-06-30 23:34:33 -04:00
Christian Medina 5713bf0285 fix: add CPU offload back to DeepSpeed ZeRO-3 2026-06-30 22:47:19 -04:00
Christian Medina 3bb7328e2a fix: disable quantization config for fp8 model training 2026-06-30 22:41:28 -04:00
Christian Medina a8c9cd682e fix: simplify DeepSpeed config, remove offload settings 2026-06-30 22:36:49 -04:00
Christian Medina b760ba09e7 fix: use CUDA 13.0 nightly for RTX 5090 support 2026-06-30 22:32:14 -04:00
Christian Medina 9cbf6549e5 fix: use output_file parameter in prepare_dataset 2026-06-30 21:54:05 -04:00
Christian Medina ed0b1eddf8 fix: use messages format for SFTTrainer (system/user/assistant) 2026-06-30 21:05:48 -04:00
Christian Medina d8ad31fd03 fix: remove max_seq_length from SFTTrainer (newer TRL API) 2026-06-30 20:59:24 -04:00
Christian Medina 8ad87f0e7e fix: remove dataset_text_field (dataset pre-formatted) 2026-06-30 20:48:07 -04:00
Christian Medina 6bd6662f5f docs: rename config and docs to reflect Ornith-35B model 2026-06-30 20:41:53 -04:00
Christian Medina 6f31fa0197 feat: add --check-only flag to validate setup without training 2026-06-30 20:39:29 -04:00
Christian Medina 83ba987840 fix: tokenizer -> processing_class SFTTrainer API change 2026-06-30 20:38:31 -04:00
Christian Medina 9d5d4eebc7 fix: mixed_precision -> bf16/api change 2026-06-30 20:34:05 -04:00
Christian Medina 9280103260 fix: evaluation_strategy -> eval_strategy API change 2026-06-30 20:29:03 -04:00
Christian Medina 50fa171f68 fix: use local model path instead of HuggingFace download 2026-06-30 20:24:44 -04:00
Christian Medina 7f7467ef89 fix: remove max_seq_length from TrainingArguments (passed to SFTTrainer) 2026-06-30 20:17:04 -04:00