Commit Graph
92 Commits
Author SHA1 Message Date
Christian Medina cc353b3dea refactor: restructure project - scripts at root level 2026-07-01 16:39:54 -04:00
Christian Medina 293f9caf65 fix: use correct repo_root path for dataset files 2026-07-01 16:35:47 -04:00
Christian Medina 1095032801 feat: add ai none to unload AI model before training 2026-07-01 16:24:30 -04:00
Christian Medina 79aa1e4061 fix: don't reinstall PyTorch (already installed) 2026-07-01 16:22:55 -04:00
Christian Medina 3b771c0db5 fix: add venv setup and proper pip install 2026-07-01 16:22:09 -04:00
Christian Medina ff0d6e8736 fix: use correct path for training script 2026-07-01 16:21:47 -04:00
Christian Medina 5eae235180 executable permissions 2026-07-01 16:06:52 -04:00
Christian Medina 7e13680e27 additional fixes 2026-07-01 16:05:52 -04:00
Christian Medina 088521094e feat: add 4 loading strategies (no BnB for already-quantized model) 2026-07-01 15:57:42 -04:00
Christian Medina 3089f27901 fix: load 4-bit model AS-IS without BnB (already quantized) 2026-07-01 15:56:00 -04:00
Christian Medina 1197235b4d fix: skip prepare_model_for_kbit_training to avoid OOM 2026-07-01 15:18:48 -04:00
Christian Medina d9fd079686 fix: add accelerate CPU offload to bf16 strategies 2026-07-01 15:14:00 -04:00
Christian Medina 4ed80ad3a3 feat: restore all 6 loading strategies 2026-07-01 15:11:45 -04:00
Christian Medina 313b44381f fix: remove DeepSpeed, use torchrun without distributed training 2026-07-01 15:10:54 -04:00
Christian Medina 7de54746a2 feat: add 6 loading variants with different offload strategies 2026-07-01 14:45:29 -04:00
Christian Medina 22d1bfd573 fix: use 4-bit model first, then bf16 with CPU offload 2026-07-01 14:43:30 -04:00
Christian Medina 3fa2cfe4cc fix: use DeepSpeed ZeRO-3 directly (skip CPU loading) 2026-07-01 14:41:48 -04:00
Christian Medina 3760aaf316 fix: rename output dir to ornith-35b-lora 2026-07-01 14:19:43 -04:00
Christian Medina 4287e42148 fix: remove screen, run training directly 2026-07-01 14:16:05 -04:00
Christian Medina 3bd51ec7db feat: add screen support to bypass cgroup limits 2026-07-01 14:09:34 -04:00
Christian Medina ce758f7eb5 feat: improve loading strategies with low_cpu_mem_usage and proper DeepSpeed config 2026-07-01 14:00:41 -04:00
Christian Medina 2d13e63c25 feat: add 4 loading strategies with automatic fallback 2026-07-01 13:55:23 -04:00
Christian Medina b300235be0 fix: load 4-bit model AS-IS without additional quantization 2026-07-01 13:53:43 -04:00
Christian Medina e967bd74f1 fix: skip quantization, use DeepSpeed ZeRO-3 CPU offload directly 2026-07-01 13:53:06 -04:00
Christian Medina 7539e39a93 fix: use accelerate load_checkpoint_and_dispatch for proper CPU offload 2026-07-01 13:39:51 -04:00
Christian Medina 528e7002ef feat: add 8-bit CPU offload fallback between 4-bit and bf16 2026-07-01 13:32:04 -04:00
Christian Medina 59ddfb45ed feat: add fallback to bf16 with CPU offload if 4-bit fails 2026-07-01 13:29:23 -04:00
Christian Medina b41d99f956 fix: remove broken quantization_config before loading 2026-07-01 13:12:57 -04:00
Christian Medina 1228a1f38b fix: load model first then quantize with BnB 2026-07-01 13:11:14 -04:00
Christian Medina 14042dbb44 fix: use pre-quantized 4bit model 2026-07-01 12:35:19 -04:00
Christian Medina f784d06f0a fix: load QLoRA directly to GPU (skip CPU) 2026-07-01 12:33:21 -04:00
Christian Medina 9471d5cc77 fix: cast learning_rate to float (YAML parses 2e-4 as string) 2026-07-01 11:19:00 -04:00
Christian Medina 2fa52cd9d4 fix: load QLoRA model to CPU first, DeepSpeed distributes 2026-07-01 09:37:20 -04:00
Christian Medina 2fa5173c56 feat: add prepare_model_for_kbit_training and update LoRA r=64 alpha=128 2026-07-01 07:48:44 -04:00
Christian Medina 357c9fa781 fix: use standard QLoRA pattern with BitsAndBytesConfig 2026-07-01 07:47:42 -04:00
Christian Medina da5eb3abed feat: implement QLoRA with 4-bit BitsAndBytes quantization 2026-07-01 07:45:33 -04:00
Christian Medina f0ee6bc9a2 fix: torch_dtype -> dtype (fix deprecation warning) 2026-07-01 07:38:36 -04:00
Christian Medina f651ca030c fix: convert warmup_ratio to warmup_steps (fix deprecation warning) 2026-07-01 07:37:47 -04:00
Christian Medina f47944ee75 fix: remove quantization_config after loading to bypass SFTTrainer check 2026-07-01 07:36:38 -04:00
Christian Medina 86b401c12f fix: convert FP8 to bf16 for PEFT compatibility 2026-07-01 07:30:10 -04:00
Christian Medina 6f631f00ae fix: use FP8 model with 32GB CPU offload 2026-07-01 07:29:32 -04:00
Christian Medina 9d92531c55 fix: use Ornith-1.0-35B bf16 base model (PEFT compatible) 2026-07-01 07:28:21 -04:00
Christian Medina 05ace2d38f fix: load NVFP4 as bf16 by overriding quantization config 2026-07-01 07:27:13 -04:00
Christian Medina be7b589c6b fix: use BitsAndBytes INT4 for PEFT compatibility 2026-07-01 00:34:34 -04:00
Christian Medina d7301d37dd fix: use float16 dtype to preserve NVFP4 quantization 2026-07-01 00:08:42 -04:00
Christian Medina af09d47c6f fix: load model to CPU first, let DeepSpeed distribute 2026-07-01 00:03:24 -04:00
Christian Medina 2c1251788d fix: add compressed-tensors to training dependencies 2026-06-30 23:56:59 -04:00
Christian Medina 905c2ba30d fix: preserve NVFP4 quantization, don't force bf16 2026-06-30 23:50:27 -04:00
Christian Medina 114e25fcfb fix: use device_map=auto to distribute model across GPUs 2026-06-30 23:45:57 -04:00
Christian Medina 8d4cdca3bb feat: use Ornith-1.0-35B-NVFP4 for training 2026-06-30 23:34:33 -04:00
Christian Medina 5713bf0285 fix: add CPU offload back to DeepSpeed ZeRO-3 2026-06-30 22:47:19 -04:00
Christian Medina 3bb7328e2a fix: disable quantization config for fp8 model training 2026-06-30 22:41:28 -04:00
Christian Medina a8c9cd682e fix: simplify DeepSpeed config, remove offload settings 2026-06-30 22:36:49 -04:00
Christian Medina b760ba09e7 fix: use CUDA 13.0 nightly for RTX 5090 support 2026-06-30 22:32:14 -04:00
Christian Medina 9cbf6549e5 fix: use output_file parameter in prepare_dataset 2026-06-30 21:54:05 -04:00
Christian Medina ed0b1eddf8 fix: use messages format for SFTTrainer (system/user/assistant) 2026-06-30 21:05:48 -04:00
Christian Medina d8ad31fd03 fix: remove max_seq_length from SFTTrainer (newer TRL API) 2026-06-30 20:59:24 -04:00
Christian Medina 8ad87f0e7e fix: remove dataset_text_field (dataset pre-formatted) 2026-06-30 20:48:07 -04:00
Christian Medina 6bd6662f5f docs: rename config and docs to reflect Ornith-35B model 2026-06-30 20:41:53 -04:00
Christian Medina 6f31fa0197 feat: add --check-only flag to validate setup without training 2026-06-30 20:39:29 -04:00
Christian Medina 83ba987840 fix: tokenizer -> processing_class SFTTrainer API change 2026-06-30 20:38:31 -04:00
Christian Medina 9d5d4eebc7 fix: mixed_precision -> bf16/api change 2026-06-30 20:34:05 -04:00
Christian Medina 9280103260 fix: evaluation_strategy -> eval_strategy API change 2026-06-30 20:29:03 -04:00
Christian Medina 50fa171f68 fix: use local model path instead of HuggingFace download 2026-06-30 20:24:44 -04:00
Christian Medina 7f7467ef89 fix: remove max_seq_length from TrainingArguments (passed to SFTTrainer) 2026-06-30 20:17:04 -04:00
Christian Medina 7181acc580 fix: save train/test.jsonl to output_dir not parent 2026-06-30 20:01:05 -04:00
Christian Medina d5ba471b98 fix: auto-split dataset if split files missing 2026-06-30 19:54:50 -04:00
Christian Medina bbdbe91871 fix: fix dataset path calculation 2026-06-30 19:01:39 -04:00
Christian Medina 14a302dc5e fix: make scripts executable 2026-06-30 18:49:39 -04:00
Christian Medina 97004261f5 fix: multiple bug fixes - remove unused imports, fix typo, fix dataset paths, add ai command fallback 2026-06-30 18:48:46 -04:00
Christian Medina 75aeeeb20a fix: use torchrun for distributed training, load model on CPU 2026-06-30 18:45:14 -04:00
Christian Medina 5ad5518ca6 fix: add deepspeed to auto-install dependencies 2026-06-30 18:30:23 -04:00
Christian Medina 4f2f8ef03f feat: use DeepSpeed ZeRO-3 for optimal 2-GPU training 2026-06-30 18:26:48 -04:00
Christian Medina a04bf4a9cf feat: add run_with_accelerate.sh helper script 2026-06-30 18:26:08 -04:00
Christian Medina cd58ffd31e fix: use FSDP for 2-GPU training, reduce batch size 2026-06-30 18:23:34 -04:00
Christian Medina 3d87f0b8b3 fix: force reinstall PyTorch to resolve version conflicts 2026-06-30 17:58:52 -04:00
Christian Medina ef42e67183 fix: use CompressedTensors for Ornith, add torch import, expand LoRA targets 2026-06-30 17:54:35 -04:00
Christian Medina 7e8ddabf03 fix: remove dataset download, it's already in repo 2026-06-30 17:11:29 -04:00
Christian Medina 28d0a956fd fix: update PyTorch to cu124 for RTX 5090, fix total_memory typo 2026-06-30 16:58:11 -04:00
Christian Medina 1786830d84 feat: unload AI model before training 2026-06-30 16:00:17 -04:00
Christian Medina 2074d3d993 feat: use Ornith-1.0-35B-FP8 with multi-GPU support 2026-06-30 15:57:54 -04:00
Christian Medina 215886d6a7 fix: use $HOME/loras by default 2026-06-30 15:51:28 -04:00
Christian Medina 11951a8276 feat: add deploy-agenx-lora.sh to repo 2026-06-30 15:38:05 -04:00
Christian Medina 39a493f261 fix: remove deploy-agenx-lora.sh from repo 2026-06-30 15:35:42 -04:00
Christian Medina 11653ed743 feat: add simple deploy-agenx-lora.sh script 2026-06-30 15:31:13 -04:00
Christian Medina 44939e374b refactor: simplify deploy script, add train-on-this-server.sh 2026-06-30 15:22:54 -04:00
Christian Medina 0614166c7a fix: use remote Gitea directly, remove local fallback 2026-06-30 15:20:03 -04:00
Christian Medina 6946ebac1a feat: use local Gitea when available, fallback to remote 2026-06-30 15:15:51 -04:00
Christian Medina 8e51c39c6e fix: remove large dataset from git tracking, add to .gitignore 2026-06-30 15:06:13 -04:00
Christian Medina e1b80301d8 refactor: update deploy script to match cyron pattern 2026-06-30 15:03:40 -04:00
Christian Medina 3d2ae812a7 feat: add deploy-and-train.sh script for server deployment 2026-06-30 15:02:13 -04:00
Christian Medina 418a4cc76d init: add LoRA training infrastructure and 20k dataset 2026-06-30 14:49:44 -04:00