Solizardking/train2earn

0

stars

11

commits

Python

primary language

Sep 4, 2026

updated

README

🧠 Solana Clawd AI Training Framework

On-Chain Model Training Β· LoRA Fine-Tuning Β· Dataset Engineering Β· NVIDIA Blueprint Integration Β· ZK Attestation Β· CAAP/1.0 Registry


\boxed{\text{Training Surface}} \xrightarrow[\text{36K SFT + 29K Realtime + 19K CPT + 142 Trading}]{\text{Dataset Ingestion}} \boxed{SFT JSONL} \xrightarrow{\text{LoRA (r=16)}} \boxed{\text{Adapter}} \xrightarrow{\text{HF Jobs / Local MPS}} \boxed{\text{Trained Model}}

Hugging Face Org Onchain Registry Model Kit $CLAWD


GitHub Repo License LoRA Params Base Model Training Loss Token Accuracy


πŸ“‹ Table of Contents


🎯 Overview

The Solana Clawd AI Training Framework is a complete, one-shot pipeline for training, registering, and serving Solana-native AI models. It ships inside ai-training/ and includes:

ComponentDescription
36K SFT DatasetCurated Solana/DeFi instruction-tuning examples
LoRA Training PipelineQwen2.5-1.5B-Instruct + Hermes-3-8B fine-tuning
13 Perps ToolsPhoenix/Jupiter function-calling library
6 NVIDIA BlueprintsTransaction foundation, distillation, RAG, signal discovery, portfolio optimization, AI-Q
Onchain RegistryCAAP/1.0 model registration + ZK compressed attestations
Clawd ConstitutionSovereign AI agent runtime governance
Model Kit CLIclawd-model-kit β€” one-shot ingest β†’ train β†’ register
Model ArenaMulti-provider chat/code benchmark comparison

πŸš€ Quick Start

# ─── 1. Clone & Install ───
git clone https://github.com/Solizardking/solana-clawd
cd solana-clawd/ai-training
pip install -r requirements.txt
export HF_TOKEN=hf_...

# ─── 2. Train on Remote GPU (Recommended) ───
./scripts/launch_hf_jobs.sh a100-large   # ~$3-6 for full run

# ─── 3. Train on Local Mac MPS ───
python3 scripts/train_lora.py --num-epochs 1 --no-quant

# ─── 4. Register Model Onchain ───
./dao/register_model.sh \
  --hf-model "YOUR_ORG/your-model-id" \
  --eval-accuracy 0.60 \
  --dataset-size 36109

# ─── 5. Serve Locally ───
ollama create my-clawd -f ollama/Modelfile.finetuned
ollama run my-clawd "How do I detect a rug pull on a fresh Solana token?"

One-Shot with Model Kit

# Drop files into data/incoming/, then:
model-kit/bin/clawd-model-kit doctor            # check system
model-kit/bin/clawd-model-kit init              # create dirs
model-kit/bin/clawd-model-kit one-shot \
  data/incoming \
  --dataset-repo solanaclawd/my-dataset \
  --train-dry-run

πŸ“Š Datasets

DatasetExamplesSplit (train/eval/test)StatusDomain
Core AI Instruct35,17331,655 / 1,758 / 1,760βœ… PublishedSolana, DeFi, ZK, Agent Architecture
Legacy Seed36,10932,498 / 1,805 / 1,806βœ… PublishedSolana fundamentals, constitutional reasoning
Realtime Research29,05826,152 / 1,452 / 1,454βœ… PublishedPDFs, notebooks, parquet QA, ZK skills
TX Foundation CPT19,542β€”βœ… PublishedSolana mainnet transactions (4886 vocab)
NVIDIA Trading Factory142127 / 7 / 8βœ… PublishedPerps, cuML, cuFOLIO, Mean-CVaR
TX Foundation Unified82,16917,262 CPT + 64,907 SFTβœ… PublishedCombined transaction foundation

Dataset Hub IDs

solanaclawd/solana-clawd-core-ai-instruct          # 35,173 examples
solanaclawd/solana-clawd-instruct                  # 36,109 examples (legacy)
solanaclawd/solana-clawd-realtime-research-instruct # 29,058 examples
solanaclawd/solana-tx-foundation-cpt               # 19,542 examples
solanaclawd/solana-clawd-nvidia-trading-factory-instruct # 142 examples
solanaclawd/solana-tx-foundation-unified            # 82,169 examples

Data Flow

BigQuery (mainnet) ──► Tokenizer (vocab 4886) ──► CPT JSONL ──► TX Foundation Model
PDFs / Notebooks    ──► realtime_dataset_ingest  ──► SFT JSONL  ──► Realtime Dataset
Source Docs         ──► auto_research.py          ──► SFT JSONL  ──► Core AI Dataset
Perps Tools         ──► build_trading_factory     ──► SFT JSONL  ──► NVIDIA Trading Dataset

🧬 Model Family

ModelTypeParamsBaseStatus
solanaclawd/solana-clawd-core-ai-1.5b-loraLoRA Adapter~9M (0.6%)Qwen2.5-1.5B-Instructβœ… Live
solanaclawd/solana-tx-foundation-1.5bFull Model1.5BQwen2.5-1.5B-InstructπŸ”„ Training
solanaclawd/solana-tx-foundation-7bFull Model7BQwen2.5-7B-Instruct⏳ Queued
solanaclawd/clawd-fableFull Modelβ€”AliesTaha/fable-tracesβœ… Live
solanaclawd/clawd-fable-loraLoRA Adapterβ€”AliesTaha/fable-tracesβœ… Live
solanaclawd/solana-nvidia-trading-factory-8b-loraLoRA Adapterβ€”Hermes-3-8Bβœ… Live
solanaclawd/clawd-solana-masterpiece-qwen15-loraLoRA Adapterβ€”Qwen2.5-1.5Bβœ… Live

NIM Endpoint Routing

NVIDIA_API_KEY set        β†’  NIM API (nvidia/nemotron-3-nano-30b-a3b)
HF_TOKEN set              β†’  HF Inference API (nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16)
CLAWD_INFERENCE_URL set   β†’  Self-hosted Clawd endpoint
CLAWD_ROUTER_KEY set      β†’  clawd-box-router.fly.dev (free tier)
(fallback)                β†’  Ollama localhost:11434

βš™οΈ Training Pipeline

Architecture

data/solana_clawd_merged.jsonl
  β”‚
  β–Ό
scripts/prepare_dataset.py    ──► HF Dataset splits (90/5/5)
  β”‚                                 data/processed/*.parquet
  β–Ό
scripts/train_lora.py         ──► LoRA adapter (r=16, Ξ±=32, all-linear)
  β”‚                                 data/outputs/solana-clawd-1.5b-lora/
  β–Ό
scripts/launch_hf_jobs.sh     ──► HF Jobs (A100, H200, L4x1)
  β”‚                                 Push to hub: solanaclawd/...
  β–Ό
scripts/evaluate.py           ──► Eval results β†’ outputs/eval/
  β”‚
  β–Ό
dao/register_model.sh         ──► CAAP/1.0 registry β†’ onchain.x402.wtf

Training Hyperparameters

β”Œβ”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”
β”‚  LoRA Rank/Alpha:     16 / 32               β”‚
β”‚  LoRA Dropout:        0.05                  β”‚
β”‚  Target Modules:      q/k/v/o + gate/up/downβ”‚
β”‚  Trainable Params:    ~9M (0.6% of base)    β”‚
β”‚  Epochs:              3 (1 for recovery)    β”‚
β”‚  Learning Rate:       2.0e-4 (cosine, 3% WP)β”‚
β”‚  Batch Size:          2 Γ— 8 grad accum = 16 β”‚
β”‚  Max Sequence:        4096 tokens           β”‚
β”‚  Loss:                Assistant-only masked  β”‚
β”‚  Quantization:        4-bit NF4 (optional)   β”‚
β”‚  Hardware:            A100 80GB / MPS (Mac)  β”‚
β”‚  Train Loss:          0.9008                β”‚
β”‚  Token Accuracy:      82.9%                 β”‚
β”‚  Tokens Trained:      24.54M                β”‚
β””β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”˜

Local MPS Training (Apple Silicon)

# Smoke test β€” 100 steps, float32 (bfloat16 unsupported on MPS)
python3 scripts/train_lora.py \
  --config configs/glm52_lora_config_mac.yaml \
  --num-epochs 1 \
  --no-quant

# Fixes applied for MPS compatibility:
#   device_map: "auto" β†’ {"": "mps"}     (avoid meta-device offload)
#   torch_dtype: bfloat16 β†’ float32      (stable MPS matmul)
#   gradient_checkpointing: false         (PEFT conflict on MPS)

πŸ”§ Configuration Matrix

Config FileBase ModelDatasetPurpose
configs/lora_config.yamlQwen2.5-1.5BCore AI (35K)Primary SFT config
configs/core_ai_lora_config.yamlQwen2.5-1.5BCore AI (35K)Core AI lane
configs/hermes3_lora_config.yamlHermes-3-8BPerps (13 tools)Function-calling + trading
configs/glm52_lora_config.yamlQwen2.5-7BCore AI (36K)Full 7B training
configs/glm52_lora_config_mac.yamlQwen2.5-7BCore AI (27K)MPS-compatible 7B
configs/deep_solana_cpt_config.yamlQwen2.5-1.5BTX Foundation CPTContinued pre-training
configs/deepsol_clawd_code_lora_mac.yamlQwen2.5-1.5BCode SFTCode generation MPS
configs/qwen35_fable5_clawd_lora.yamlfable-tracesClawd Fable SFTFable trace training
configs/qwen35_fable5_clawd_lora_mac.yamlfable-tracesClawd Fable SFTFable MPS config
configs/nvidia_trading_factory_lora_config.yamlHermes-3-8BTrading Factory (142)NVIDIA trading LoRA
configs/nvidia_trading_factory_lora_config_mac.yamlHermes-3-8BTrading Factory (142)Trading factory MPS
configs/nvidia_trading_factory_config.yamlNemotron-3Trading Factory (142)NVIDIA teacher config
configs/autoresearch_wiki_lora_config_mac.yamlQwen2.5-1.5BAutoResearch SFTWiki research MPS
configs/autoresearch_wiki_dataset_config.yamlβ€”AutoResearchDataset generation
configs/clawd_future_drill_lora_config_mac.yamlQwen2.5-1.5BFuture Drill SFTScenario planning MPS
configs/clawd_future_refinement_lora_config_mac.yamlQwen2.5-1.5BFuture Refinement SFTRefinement MPS
configs/clawd_masterpiece_lora_config_mac.yamlQwen2.5-1.5BMasterpiece SFTMasterpiece MPS
configs/eval_config.yamlβ€”Eval datasetEvaluation runner
configs/realtime_dataset_config.yamlβ€”Realtime dataDataset ingest config
configs/hauhau_qwen36_llama_cpp.yamlQwen3.6llama.cppGGUF quantization

πŸ–₯️ NVIDIA Blueprint Integration

#BlueprintDirectoryStatusOutput
1Transaction Foundation Modelnvidia/blueprints/transaction-foundation-model/πŸ”„ TrainingSolana TX tokenizer (vocab 4886), CPT pipeline
2Model Distillationnvidia/blueprints/model-distillation/βœ… ReadyNemotron teacher β†’ CoT distillation
3Enterprise RAGnvidia/blueprints/enterprise-rag/βœ… ReadySolana doc retrieval pipeline
4Quantitative Signal Discoverynvidia/blueprints/signal-discovery/βœ… ReadyMarket signal agent
5Portfolio Optimizationnvidia/blueprints/portfolio-optimization/ + nvidia/cufolio/βœ… ReadycuFOLIO Mean-CVaR
6AI-Qnvidia/blueprints/aiq/βœ… ReadyModel quality scoring

Transaction Foundation Pipeline

BigQuery (crypto_solana_mainnet_us)
  β”‚  query: DEX swaps (Jupiter, Phoenix, Orca, Raydium)
  β–Ό
SolanaTokenizerPipeline (vocab_size=4886)
  β”‚  PROG_N IX_SWAP MINT_N MINT_N AMT_N AMT_N FEE_N SLOT_N SIDE_BUY STATUS_SUCCESS
  β–Ό
CPT JSONL (19,542 examples)
  β”‚
  β”œβ”€β”€β–Ί 01_dataset_baseline.ipynb
  β”œβ”€β”€β–Ί 02_seq_preproc_tokenization.ipynb
  β”œβ”€β”€β–Ί 03_foundation_model_training.ipynb
  β”œβ”€β”€β–Ί 04_inference_embedding_extraction.ipynb
  └──► 05_xgboost_fraud_detection.ipynb

Running NVIDIA Workflows

# Full TX foundation pipeline
python3 nvidia/blueprints/transaction-foundation-model/pipeline.py \
  --stages cpt sft evaluate

# Signal discovery agent
python3 nvidia/blueprints/signal-discovery/quantitative_signal_agent.py \
  --market SOL --mode paper

# AI-Q evaluation
model-kit/bin/clawd-model-kit nvidia aiq --strict

# All NVIDIA checkpoints
model-kit/bin/clawd-model-kit nvidia verify --strict

πŸ› οΈ Perps Tool Library

13 Solana Perpetuals Tools β€” Drop-in function-calling for any OpenAI-compatible agent

ToolWhat It Does
get_sol_priceSOL price + 24h change (CoinGecko)
get_token_priceAny Solana token by symbol or mint
get_perp_marketsPhoenix DEX perp markets (mark, OI, volume, funding)
get_funding_rateHourly + 8h + annualized funding rate
get_orderbookPhoenix order book (top N bids/asks, spread)
check_positionsOpen perp positions for a wallet
check_sol_balanceSOL + USD balance
get_jupiter_quoteBest swap route + price impact (Jupiter v6)
paper_tradeSimulate perp entry (mark, liq, margin, funding)
get_market_overviewSnapshot: SOL price, TPS, epoch, top markets
get_trader_historyRecent fills + realized PnL on Phoenix
send_solTransfer SOL (paper mode by default)
assess_position_riskLiq price, max loss, funding cost, 1-10 risk score
from perps.functions import get_openai_tools, call_function

tools = get_openai_tools()  # all 13 tools in OpenAI format

# Direct call
import json
print(json.dumps(call_function("get_sol_price", {}), indent=2))
print(json.dumps(call_function("assess_position_risk", {
    "market": "SOL-PERP", "side": "long", "size_usd": 500, "leverage": 3
}), indent=2))
# Hermes-3 agent
python3 perps/functioncall.py --query "What's the SOL-PERP funding rate?"

# GOAP multi-step reasoning
python3 perps/functioncall.py --goap \
  --query "Assess the risk of shorting SOL-PERP with $1000 at 5x leverage"

πŸ”— Onchain Registry & DAO

Three-Layer Registration

Layer 1: Off-Chain Index (curl, no wallet)
  curl -X POST https://onchain.x402.wtf/api/register \
    -H "Authorization: Bearer $HF_TOKEN" \
    -d '{"hf_model_id": "...", ...}'
  Returns CAAP/1.0 JSON record

Layer 2: Onchain PDA (Anchor tx, permanent)
  ./dao/register_model.sh --onchain \
    --hf-model "..." --keypair ~/.config/solana/id.json --cluster devnet
  Creates ModelRegistry PDA at seeds ["model", authority]

Layer 3: ZK Attestations (Light Protocol compressed, ~0.00003 SOL)
  pnpm tsx dao/attestation/create_attestation.ts \
    --type dataset --model-id "..." --hash "sha256:..." --compressed

Program Addresses

solana_ai_inference:  3dLst2E3djtCSwG19mFS3REHxtZPngjyga7iYZLDL5xj  (devnet)
SAS Attestation:      ATSPssFHEjvJgAXKkfAWNRqTQW9Wm6JDDVW7Ec1G3zM
Light Protocol Null:  NFLx5WGPrTHHvdRNsidcrNcLxRruMC92E4yv7zhZBoT
$CLAWD Token:         8cHzQHUS2s2h8TzCmfqPKYiM4dSt4roa3n7MyRLApump

DAO Architecture

β”Œβ”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”
β”‚                        CLAWD DAO                             β”‚
β”‚                                                              β”‚
β”‚  Genesis Programs (Attribution/Accounting Only):              β”‚
β”‚  β”œβ”€β”€ ModelRegistry      ── PDA per authority                  β”‚
β”‚  β”œβ”€β”€ DataSubmission     ── $CLAWD credit per example          β”‚
β”‚  β”œβ”€β”€ ValidatorAccount   ── Stake + reputation                 β”‚
β”‚  └── SAS Attestations   ── Compressed ZK credentials          β”‚
β”‚                                                              β”‚
β”‚  User Capital (Genesis NEVER touches):                       β”‚
β”‚  └── Percolator Insurance Pools  ── Market-determined rates   β”‚
β”‚                                                              β”‚
β”‚  Governance: Proposal β†’ 72h vote β†’ 1-week Squads timelock    β”‚
β”‚  Emergency: 3-of-5 multisig (pause only, no withdrawals)     β”‚
β””β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”˜

Query the Registry

# Full index
curl https://onchain.x402.wtf/.well-known/clawd-registry.json | jq .

# Specific model
curl "https://onchain.x402.wtf/api/models?hf_id=solanaclawd/solana-clawd-1.5b"

# Verify attestation onchain (no API trust)
solana account <ATTESTATION_PDA> --url devnet --output json

πŸ“œ Constitution

The Onchain Constitution governs all Clawd agents at runtime. It is not decorative β€” it prescribes how agents choose models, route inference, store data, handle failures, and add integrations.

Core Invariants

1.  Usable without a paid model provider
2.  Core functionality requires no single vendor account
3.  Data remains under operator control by default
4.  Every important inference path leaves evidence
5.  Paid inference is an upgrade, not a dependency
6.  Model routing is configurable at the boundary
7.  Failure is logged, not hidden
8.  Deterministic solutions preferred over model calls
9.  Correctness is checkable after the fact
10. Sovereignty and capability are the same requirement

Backend Selection Protocol

1. Deterministic local computation
2. Cached result
3. Local or self-hosted model
4. Free no-auth router with ZK receipt
5. Free no-auth router without ZK receipt
6. Paid x402 premium model
7. Paid external provider
8. Manual operator escalation

Constitutional Summary

Inference by default. Dependency by choice. Verification over trust. Operator control over vendor gravity. Sovereign by design. On-chain by proof.

Full constitution: docs/onchain_constitution.md (665 lines)


πŸ§ͺ Evaluation

python3 scripts/evaluate.py \
  --config configs/eval_config.yaml \
  --adapter solanaclawd/solana-clawd-core-ai-1.5b-lora \
  --dataset solanaclawd/solana-clawd-eval \
  --out ./outputs/eval \
  --format markdown

What the Model Knows

  • Solana mechanics (PDAs, accounts, instructions, rent, compute budgets, Token-2022)
  • DeFi primitives (AMMs, CLMMs, perpetuals, bonding curves, Jupiter, Phoenix)
  • Memecoin risk (rug detection, holder concentration, deployer forensics)
  • Agent architecture (skill registries, brain/hands split, multi-agent coordination)
  • ZK compression (Light Protocol, nullifiers, Groth16)
  • Code generation (Anchor/Rust, TypeScript @solana/kit, Python)
  • Constitutional reasoning (guardrails, refusal patterns)
  • Perps function calling ← Hermes-3 8B path

Evaluation Metrics

MetricValue
Training Loss0.9008
Token Accuracy82.9%
Tokens Trained24.54M
Samples/sec2.73

πŸ€– Model Arena

The model arena at models.x402.wtf compares any OpenAI-compatible provider, plus Anthropic and Gemini:

OpenRouter:         nvidia/llama-nemotron, openrouter/fusion, kimi-k2.7-code
Anthropic:          claude-opus-4.8-fast
OpenAI:             gpt-5.2, gpt-5.1-codex-max
xAI:                grok-4.3
NVIDIA:             nemotron-3-ultra-550b-a55b
Qwen:               qwen3.7-plus
DeepSeek:           deepseek-v3.2
# Arena API
GET  /api/arena/providers       # Provider templates + metadata
POST /api/arena/runs             # Start chat or code run
GET  /api/arena/runs/{id}/events # SSE realtime events
GET  /api/arena/runs/{id}        # Recorded outputs + benchmarks

πŸ“ Directory Map

train2earn/
β”œβ”€β”€ clawd-training-index/       # Static training index export
β”œβ”€β”€ configs/                    # LoRA/CPT/eval/dataset configs
β”œβ”€β”€ data/                       # LFS-backed datasets, manifests, processed metadata
β”‚   β”œβ”€β”€ core_ai_processed/
β”‚   β”œβ”€β”€ model_kit/
β”‚   β”œβ”€β”€ nvidia_trading_factory_processed/
β”‚   β”œβ”€β”€ realtime_research_processed/
β”‚   β”œβ”€β”€ tx_foundation_cpt_processed/
β”‚   β”œβ”€β”€ incoming/               # Drop zone for model-kit ingest
β”‚   β”œβ”€β”€ perps/                  # Perps strategy data
β”‚   └── strategies/             # Trading strategies
β”œβ”€β”€ dao/                        # Onchain registry + attestations
β”‚   β”œβ”€β”€ attestation/            # ZK compressed attestation scripts
β”‚   β”œβ”€β”€ DAO_DESIGN.md           # Full DAO architecture
β”‚   β”œβ”€β”€ MODEL_KIT_HANDOFF.md    # Model kit β†’ DAO handoff
β”‚   β”œβ”€β”€ register_model.sh       # One-shot registration
β”‚   └── register_model.ts       # Anchor TS client
β”œβ”€β”€ docs/                       # Model, dataset, onchain, and session docs
β”‚   β”œβ”€β”€ model_card.md           # Live model card (624 lines)
β”‚   β”œβ”€β”€ dataset_card.md         # Dataset documentation (272 lines)
β”‚   β”œβ”€β”€ onchainai.md            # Onchain registry skill (414 lines)
β”‚   β”œβ”€β”€ onchain_constitution.md # Constitution (665 lines)
β”‚   β”œβ”€β”€ clawd_fable.md          # Fable trace training
β”‚   β”œβ”€β”€ clawd_solana_svm_ai_compute_design.md  # Full protocol spec (1658 lines)
β”‚   β”œβ”€β”€ hauhau_qwen36.md        # Qwen3.6 quantization
β”‚   └── SESSIONS.md             # Training session logs
β”œβ”€β”€ etc/                        # Mascot images (4K transparent, blueprint grid)
β”œβ”€β”€ memory/                     # Honcho memory server
β”œβ”€β”€ model-kit/                  # Terminal-first training surface
β”‚   β”œβ”€β”€ bin/clawd-model-kit     # CLI entrypoint
β”‚   β”œβ”€β”€ clawd_model_kit.py      # Python CLI wrapper
β”‚   β”œβ”€β”€ frontend/               # models.x402.wtf + register.x402.wtf
β”‚   β”œβ”€β”€ backend/                # FastAPI arena + status + registration proxy
β”‚   β”œβ”€β”€ scripts/                # Verification scripts
β”‚   └── docs/                   # 8 documentation files
β”œβ”€β”€ nvidia/                     # NVIDIA blueprint implementations
β”‚   └── blueprints/
β”‚       β”œβ”€β”€ transaction-foundation-model/  # BigQuery + tokenizer + CPT pipeline
β”‚       β”œβ”€β”€ model-distillation/            # Nemotron teacher β†’ CoT
β”‚       β”œβ”€β”€ enterprise-rag/                # Document retrieval
β”‚       β”œβ”€β”€ signal-discovery/              # Market signals
β”‚       β”œβ”€β”€ portfolio-optimization/        # cuFOLIO
β”‚       └── aiq/                           # Model quality
β”œβ”€β”€ ollama/                     # Modelfile templates and LFS-backed GGUF builds
β”œβ”€β”€ site/                       # Vite/React source for the training index
β”‚   β”œβ”€β”€ src/
β”‚   β”œβ”€β”€ public/
β”‚   └── assets/
β”œβ”€β”€ tools/                      # Static-site and W&B/data sync helpers
β”œβ”€β”€ training/                   # Imported Nemo Clawd training scaffold
β”œβ”€β”€ training-data/              # Source-grounded corpus/SFT/eval workspace
β”œβ”€β”€ wandb/                      # Local/offline W&B runs; ignored by Git
β”œβ”€β”€ TRAINING_DATA_MAP.md        # Machine-wide training asset inventory
β”œβ”€β”€ .gitattributes              # Git LFS rules and text normalization
└── .gitignore                  # Generated/local cache exclusions

Large JSONL datasets, GGUF model builds, vector indexes, model weight formats, and binary image assets are tracked through Git LFS. Generated dependencies and local runtime output are ignored: site/node_modules/, site/.npm-cache/, site/dist/, Python __pycache__/, NVIDIA blueprint .venv/ directories, .DS_Store, wandb/, and local training outputs.


Contributors

Solizardking

11 commits

Solizardking/train2earn

0

stars

11

commits

Python

primary language

Sep 4, 2026

updated

README

🧠 Solana Clawd AI Training Framework

On-Chain Model Training Β· LoRA Fine-Tuning Β· Dataset Engineering Β· NVIDIA Blueprint Integration Β· ZK Attestation Β· CAAP/1.0 Registry


\boxed{\text{Training Surface}} \xrightarrow[\text{36K SFT + 29K Realtime + 19K CPT + 142 Trading}]{\text{Dataset Ingestion}} \boxed{SFT JSONL} \xrightarrow{\text{LoRA (r=16)}} \boxed{\text{Adapter}} \xrightarrow{\text{HF Jobs / Local MPS}} \boxed{\text{Trained Model}}

Hugging Face Org Onchain Registry Model Kit $CLAWD


GitHub Repo License LoRA Params Base Model Training Loss Token Accuracy


πŸ“‹ Table of Contents


🎯 Overview

The Solana Clawd AI Training Framework is a complete, one-shot pipeline for training, registering, and serving Solana-native AI models. It ships inside ai-training/ and includes:

ComponentDescription
36K SFT DatasetCurated Solana/DeFi instruction-tuning examples
LoRA Training PipelineQwen2.5-1.5B-Instruct + Hermes-3-8B fine-tuning
13 Perps ToolsPhoenix/Jupiter function-calling library
6 NVIDIA BlueprintsTransaction foundation, distillation, RAG, signal discovery, portfolio optimization, AI-Q
Onchain RegistryCAAP/1.0 model registration + ZK compressed attestations
Clawd ConstitutionSovereign AI agent runtime governance
Model Kit CLIclawd-model-kit β€” one-shot ingest β†’ train β†’ register
Model ArenaMulti-provider chat/code benchmark comparison

πŸš€ Quick Start

# ─── 1. Clone & Install ───
git clone https://github.com/Solizardking/solana-clawd
cd solana-clawd/ai-training
pip install -r requirements.txt
export HF_TOKEN=hf_...

# ─── 2. Train on Remote GPU (Recommended) ───
./scripts/launch_hf_jobs.sh a100-large   # ~$3-6 for full run

# ─── 3. Train on Local Mac MPS ───
python3 scripts/train_lora.py --num-epochs 1 --no-quant

# ─── 4. Register Model Onchain ───
./dao/register_model.sh \
  --hf-model "YOUR_ORG/your-model-id" \
  --eval-accuracy 0.60 \
  --dataset-size 36109

# ─── 5. Serve Locally ───
ollama create my-clawd -f ollama/Modelfile.finetuned
ollama run my-clawd "How do I detect a rug pull on a fresh Solana token?"

One-Shot with Model Kit

# Drop files into data/incoming/, then:
model-kit/bin/clawd-model-kit doctor            # check system
model-kit/bin/clawd-model-kit init              # create dirs
model-kit/bin/clawd-model-kit one-shot \
  data/incoming \
  --dataset-repo solanaclawd/my-dataset \
  --train-dry-run

πŸ“Š Datasets

DatasetExamplesSplit (train/eval/test)StatusDomain
Core AI Instruct35,17331,655 / 1,758 / 1,760βœ… PublishedSolana, DeFi, ZK, Agent Architecture
Legacy Seed36,10932,498 / 1,805 / 1,806βœ… PublishedSolana fundamentals, constitutional reasoning
Realtime Research29,05826,152 / 1,452 / 1,454βœ… PublishedPDFs, notebooks, parquet QA, ZK skills
TX Foundation CPT19,542β€”βœ… PublishedSolana mainnet transactions (4886 vocab)
NVIDIA Trading Factory142127 / 7 / 8βœ… PublishedPerps, cuML, cuFOLIO, Mean-CVaR
TX Foundation Unified82,16917,262 CPT + 64,907 SFTβœ… PublishedCombined transaction foundation

Dataset Hub IDs

solanaclawd/solana-clawd-core-ai-instruct          # 35,173 examples
solanaclawd/solana-clawd-instruct                  # 36,109 examples (legacy)
solanaclawd/solana-clawd-realtime-research-instruct # 29,058 examples
solanaclawd/solana-tx-foundation-cpt               # 19,542 examples
solanaclawd/solana-clawd-nvidia-trading-factory-instruct # 142 examples
solanaclawd/solana-tx-foundation-unified            # 82,169 examples

Data Flow

BigQuery (mainnet) ──► Tokenizer (vocab 4886) ──► CPT JSONL ──► TX Foundation Model
PDFs / Notebooks    ──► realtime_dataset_ingest  ──► SFT JSONL  ──► Realtime Dataset
Source Docs         ──► auto_research.py          ──► SFT JSONL  ──► Core AI Dataset
Perps Tools         ──► build_trading_factory     ──► SFT JSONL  ──► NVIDIA Trading Dataset

🧬 Model Family

ModelTypeParamsBaseStatus
solanaclawd/solana-clawd-core-ai-1.5b-loraLoRA Adapter~9M (0.6%)Qwen2.5-1.5B-Instructβœ… Live
solanaclawd/solana-tx-foundation-1.5bFull Model1.5BQwen2.5-1.5B-InstructπŸ”„ Training
solanaclawd/solana-tx-foundation-7bFull Model7BQwen2.5-7B-Instruct⏳ Queued
solanaclawd/clawd-fableFull Modelβ€”AliesTaha/fable-tracesβœ… Live
solanaclawd/clawd-fable-loraLoRA Adapterβ€”AliesTaha/fable-tracesβœ… Live
solanaclawd/solana-nvidia-trading-factory-8b-loraLoRA Adapterβ€”Hermes-3-8Bβœ… Live
solanaclawd/clawd-solana-masterpiece-qwen15-loraLoRA Adapterβ€”Qwen2.5-1.5Bβœ… Live

NIM Endpoint Routing

NVIDIA_API_KEY set        β†’  NIM API (nvidia/nemotron-3-nano-30b-a3b)
HF_TOKEN set              β†’  HF Inference API (nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16)
CLAWD_INFERENCE_URL set   β†’  Self-hosted Clawd endpoint
CLAWD_ROUTER_KEY set      β†’  clawd-box-router.fly.dev (free tier)
(fallback)                β†’  Ollama localhost:11434

βš™οΈ Training Pipeline

Architecture

data/solana_clawd_merged.jsonl
  β”‚
  β–Ό
scripts/prepare_dataset.py    ──► HF Dataset splits (90/5/5)
  β”‚                                 data/processed/*.parquet
  β–Ό
scripts/train_lora.py         ──► LoRA adapter (r=16, Ξ±=32, all-linear)
  β”‚                                 data/outputs/solana-clawd-1.5b-lora/
  β–Ό
scripts/launch_hf_jobs.sh     ──► HF Jobs (A100, H200, L4x1)
  β”‚                                 Push to hub: solanaclawd/...
  β–Ό
scripts/evaluate.py           ──► Eval results β†’ outputs/eval/
  β”‚
  β–Ό
dao/register_model.sh         ──► CAAP/1.0 registry β†’ onchain.x402.wtf

Training Hyperparameters

β”Œβ”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”
β”‚  LoRA Rank/Alpha:     16 / 32               β”‚
β”‚  LoRA Dropout:        0.05                  β”‚
β”‚  Target Modules:      q/k/v/o + gate/up/downβ”‚
β”‚  Trainable Params:    ~9M (0.6% of base)    β”‚
β”‚  Epochs:              3 (1 for recovery)    β”‚
β”‚  Learning Rate:       2.0e-4 (cosine, 3% WP)β”‚
β”‚  Batch Size:          2 Γ— 8 grad accum = 16 β”‚
β”‚  Max Sequence:        4096 tokens           β”‚
β”‚  Loss:                Assistant-only masked  β”‚
β”‚  Quantization:        4-bit NF4 (optional)   β”‚
β”‚  Hardware:            A100 80GB / MPS (Mac)  β”‚
β”‚  Train Loss:          0.9008                β”‚
β”‚  Token Accuracy:      82.9%                 β”‚
β”‚  Tokens Trained:      24.54M                β”‚
β””β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”˜

Local MPS Training (Apple Silicon)

# Smoke test β€” 100 steps, float32 (bfloat16 unsupported on MPS)
python3 scripts/train_lora.py \
  --config configs/glm52_lora_config_mac.yaml \
  --num-epochs 1 \
  --no-quant

# Fixes applied for MPS compatibility:
#   device_map: "auto" β†’ {"": "mps"}     (avoid meta-device offload)
#   torch_dtype: bfloat16 β†’ float32      (stable MPS matmul)
#   gradient_checkpointing: false         (PEFT conflict on MPS)

πŸ”§ Configuration Matrix

Config FileBase ModelDatasetPurpose
configs/lora_config.yamlQwen2.5-1.5BCore AI (35K)Primary SFT config
configs/core_ai_lora_config.yamlQwen2.5-1.5BCore AI (35K)Core AI lane
configs/hermes3_lora_config.yamlHermes-3-8BPerps (13 tools)Function-calling + trading
configs/glm52_lora_config.yamlQwen2.5-7BCore AI (36K)Full 7B training
configs/glm52_lora_config_mac.yamlQwen2.5-7BCore AI (27K)MPS-compatible 7B
configs/deep_solana_cpt_config.yamlQwen2.5-1.5BTX Foundation CPTContinued pre-training
configs/deepsol_clawd_code_lora_mac.yamlQwen2.5-1.5BCode SFTCode generation MPS
configs/qwen35_fable5_clawd_lora.yamlfable-tracesClawd Fable SFTFable trace training
configs/qwen35_fable5_clawd_lora_mac.yamlfable-tracesClawd Fable SFTFable MPS config
configs/nvidia_trading_factory_lora_config.yamlHermes-3-8BTrading Factory (142)NVIDIA trading LoRA
configs/nvidia_trading_factory_lora_config_mac.yamlHermes-3-8BTrading Factory (142)Trading factory MPS
configs/nvidia_trading_factory_config.yamlNemotron-3Trading Factory (142)NVIDIA teacher config
configs/autoresearch_wiki_lora_config_mac.yamlQwen2.5-1.5BAutoResearch SFTWiki research MPS
configs/autoresearch_wiki_dataset_config.yamlβ€”AutoResearchDataset generation
configs/clawd_future_drill_lora_config_mac.yamlQwen2.5-1.5BFuture Drill SFTScenario planning MPS
configs/clawd_future_refinement_lora_config_mac.yamlQwen2.5-1.5BFuture Refinement SFTRefinement MPS
configs/clawd_masterpiece_lora_config_mac.yamlQwen2.5-1.5BMasterpiece SFTMasterpiece MPS
configs/eval_config.yamlβ€”Eval datasetEvaluation runner
configs/realtime_dataset_config.yamlβ€”Realtime dataDataset ingest config
configs/hauhau_qwen36_llama_cpp.yamlQwen3.6llama.cppGGUF quantization

πŸ–₯️ NVIDIA Blueprint Integration

#BlueprintDirectoryStatusOutput
1Transaction Foundation Modelnvidia/blueprints/transaction-foundation-model/πŸ”„ TrainingSolana TX tokenizer (vocab 4886), CPT pipeline
2Model Distillationnvidia/blueprints/model-distillation/βœ… ReadyNemotron teacher β†’ CoT distillation
3Enterprise RAGnvidia/blueprints/enterprise-rag/βœ… ReadySolana doc retrieval pipeline
4Quantitative Signal Discoverynvidia/blueprints/signal-discovery/βœ… ReadyMarket signal agent
5Portfolio Optimizationnvidia/blueprints/portfolio-optimization/ + nvidia/cufolio/βœ… ReadycuFOLIO Mean-CVaR
6AI-Qnvidia/blueprints/aiq/βœ… ReadyModel quality scoring

Transaction Foundation Pipeline

BigQuery (crypto_solana_mainnet_us)
  β”‚  query: DEX swaps (Jupiter, Phoenix, Orca, Raydium)
  β–Ό
SolanaTokenizerPipeline (vocab_size=4886)
  β”‚  PROG_N IX_SWAP MINT_N MINT_N AMT_N AMT_N FEE_N SLOT_N SIDE_BUY STATUS_SUCCESS
  β–Ό
CPT JSONL (19,542 examples)
  β”‚
  β”œβ”€β”€β–Ί 01_dataset_baseline.ipynb
  β”œβ”€β”€β–Ί 02_seq_preproc_tokenization.ipynb
  β”œβ”€β”€β–Ί 03_foundation_model_training.ipynb
  β”œβ”€β”€β–Ί 04_inference_embedding_extraction.ipynb
  └──► 05_xgboost_fraud_detection.ipynb

Running NVIDIA Workflows

# Full TX foundation pipeline
python3 nvidia/blueprints/transaction-foundation-model/pipeline.py \
  --stages cpt sft evaluate

# Signal discovery agent
python3 nvidia/blueprints/signal-discovery/quantitative_signal_agent.py \
  --market SOL --mode paper

# AI-Q evaluation
model-kit/bin/clawd-model-kit nvidia aiq --strict

# All NVIDIA checkpoints
model-kit/bin/clawd-model-kit nvidia verify --strict

πŸ› οΈ Perps Tool Library

13 Solana Perpetuals Tools β€” Drop-in function-calling for any OpenAI-compatible agent

ToolWhat It Does
get_sol_priceSOL price + 24h change (CoinGecko)
get_token_priceAny Solana token by symbol or mint
get_perp_marketsPhoenix DEX perp markets (mark, OI, volume, funding)
get_funding_rateHourly + 8h + annualized funding rate
get_orderbookPhoenix order book (top N bids/asks, spread)
check_positionsOpen perp positions for a wallet
check_sol_balanceSOL + USD balance
get_jupiter_quoteBest swap route + price impact (Jupiter v6)
paper_tradeSimulate perp entry (mark, liq, margin, funding)
get_market_overviewSnapshot: SOL price, TPS, epoch, top markets
get_trader_historyRecent fills + realized PnL on Phoenix
send_solTransfer SOL (paper mode by default)
assess_position_riskLiq price, max loss, funding cost, 1-10 risk score
from perps.functions import get_openai_tools, call_function

tools = get_openai_tools()  # all 13 tools in OpenAI format

# Direct call
import json
print(json.dumps(call_function("get_sol_price", {}), indent=2))
print(json.dumps(call_function("assess_position_risk", {
    "market": "SOL-PERP", "side": "long", "size_usd": 500, "leverage": 3
}), indent=2))
# Hermes-3 agent
python3 perps/functioncall.py --query "What's the SOL-PERP funding rate?"

# GOAP multi-step reasoning
python3 perps/functioncall.py --goap \
  --query "Assess the risk of shorting SOL-PERP with $1000 at 5x leverage"

πŸ”— Onchain Registry & DAO

Three-Layer Registration

Layer 1: Off-Chain Index (curl, no wallet)
  curl -X POST https://onchain.x402.wtf/api/register \
    -H "Authorization: Bearer $HF_TOKEN" \
    -d '{"hf_model_id": "...", ...}'
  Returns CAAP/1.0 JSON record

Layer 2: Onchain PDA (Anchor tx, permanent)
  ./dao/register_model.sh --onchain \
    --hf-model "..." --keypair ~/.config/solana/id.json --cluster devnet
  Creates ModelRegistry PDA at seeds ["model", authority]

Layer 3: ZK Attestations (Light Protocol compressed, ~0.00003 SOL)
  pnpm tsx dao/attestation/create_attestation.ts \
    --type dataset --model-id "..." --hash "sha256:..." --compressed

Program Addresses

solana_ai_inference:  3dLst2E3djtCSwG19mFS3REHxtZPngjyga7iYZLDL5xj  (devnet)
SAS Attestation:      ATSPssFHEjvJgAXKkfAWNRqTQW9Wm6JDDVW7Ec1G3zM
Light Protocol Null:  NFLx5WGPrTHHvdRNsidcrNcLxRruMC92E4yv7zhZBoT
$CLAWD Token:         8cHzQHUS2s2h8TzCmfqPKYiM4dSt4roa3n7MyRLApump

DAO Architecture

β”Œβ”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”
β”‚                        CLAWD DAO                             β”‚
β”‚                                                              β”‚
β”‚  Genesis Programs (Attribution/Accounting Only):              β”‚
β”‚  β”œβ”€β”€ ModelRegistry      ── PDA per authority                  β”‚
β”‚  β”œβ”€β”€ DataSubmission     ── $CLAWD credit per example          β”‚
β”‚  β”œβ”€β”€ ValidatorAccount   ── Stake + reputation                 β”‚
β”‚  └── SAS Attestations   ── Compressed ZK credentials          β”‚
β”‚                                                              β”‚
β”‚  User Capital (Genesis NEVER touches):                       β”‚
β”‚  └── Percolator Insurance Pools  ── Market-determined rates   β”‚
β”‚                                                              β”‚
β”‚  Governance: Proposal β†’ 72h vote β†’ 1-week Squads timelock    β”‚
β”‚  Emergency: 3-of-5 multisig (pause only, no withdrawals)     β”‚
β””β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”€β”˜

Query the Registry

# Full index
curl https://onchain.x402.wtf/.well-known/clawd-registry.json | jq .

# Specific model
curl "https://onchain.x402.wtf/api/models?hf_id=solanaclawd/solana-clawd-1.5b"

# Verify attestation onchain (no API trust)
solana account <ATTESTATION_PDA> --url devnet --output json

πŸ“œ Constitution

The Onchain Constitution governs all Clawd agents at runtime. It is not decorative β€” it prescribes how agents choose models, route inference, store data, handle failures, and add integrations.

Core Invariants

1.  Usable without a paid model provider
2.  Core functionality requires no single vendor account
3.  Data remains under operator control by default
4.  Every important inference path leaves evidence
5.  Paid inference is an upgrade, not a dependency
6.  Model routing is configurable at the boundary
7.  Failure is logged, not hidden
8.  Deterministic solutions preferred over model calls
9.  Correctness is checkable after the fact
10. Sovereignty and capability are the same requirement

Backend Selection Protocol

1. Deterministic local computation
2. Cached result
3. Local or self-hosted model
4. Free no-auth router with ZK receipt
5. Free no-auth router without ZK receipt
6. Paid x402 premium model
7. Paid external provider
8. Manual operator escalation

Constitutional Summary

Inference by default. Dependency by choice. Verification over trust. Operator control over vendor gravity. Sovereign by design. On-chain by proof.

Full constitution: docs/onchain_constitution.md (665 lines)


πŸ§ͺ Evaluation

python3 scripts/evaluate.py \
  --config configs/eval_config.yaml \
  --adapter solanaclawd/solana-clawd-core-ai-1.5b-lora \
  --dataset solanaclawd/solana-clawd-eval \
  --out ./outputs/eval \
  --format markdown

What the Model Knows

  • Solana mechanics (PDAs, accounts, instructions, rent, compute budgets, Token-2022)
  • DeFi primitives (AMMs, CLMMs, perpetuals, bonding curves, Jupiter, Phoenix)
  • Memecoin risk (rug detection, holder concentration, deployer forensics)
  • Agent architecture (skill registries, brain/hands split, multi-agent coordination)
  • ZK compression (Light Protocol, nullifiers, Groth16)
  • Code generation (Anchor/Rust, TypeScript @solana/kit, Python)
  • Constitutional reasoning (guardrails, refusal patterns)
  • Perps function calling ← Hermes-3 8B path

Evaluation Metrics

MetricValue
Training Loss0.9008
Token Accuracy82.9%
Tokens Trained24.54M
Samples/sec2.73

πŸ€– Model Arena

The model arena at models.x402.wtf compares any OpenAI-compatible provider, plus Anthropic and Gemini:

OpenRouter:         nvidia/llama-nemotron, openrouter/fusion, kimi-k2.7-code
Anthropic:          claude-opus-4.8-fast
OpenAI:             gpt-5.2, gpt-5.1-codex-max
xAI:                grok-4.3
NVIDIA:             nemotron-3-ultra-550b-a55b
Qwen:               qwen3.7-plus
DeepSeek:           deepseek-v3.2
# Arena API
GET  /api/arena/providers       # Provider templates + metadata
POST /api/arena/runs             # Start chat or code run
GET  /api/arena/runs/{id}/events # SSE realtime events
GET  /api/arena/runs/{id}        # Recorded outputs + benchmarks

πŸ“ Directory Map

train2earn/
β”œβ”€β”€ clawd-training-index/       # Static training index export
β”œβ”€β”€ configs/                    # LoRA/CPT/eval/dataset configs
β”œβ”€β”€ data/                       # LFS-backed datasets, manifests, processed metadata
β”‚   β”œβ”€β”€ core_ai_processed/
β”‚   β”œβ”€β”€ model_kit/
β”‚   β”œβ”€β”€ nvidia_trading_factory_processed/
β”‚   β”œβ”€β”€ realtime_research_processed/
β”‚   β”œβ”€β”€ tx_foundation_cpt_processed/
β”‚   β”œβ”€β”€ incoming/               # Drop zone for model-kit ingest
β”‚   β”œβ”€β”€ perps/                  # Perps strategy data
β”‚   └── strategies/             # Trading strategies
β”œβ”€β”€ dao/                        # Onchain registry + attestations
β”‚   β”œβ”€β”€ attestation/            # ZK compressed attestation scripts
β”‚   β”œβ”€β”€ DAO_DESIGN.md           # Full DAO architecture
β”‚   β”œβ”€β”€ MODEL_KIT_HANDOFF.md    # Model kit β†’ DAO handoff
β”‚   β”œβ”€β”€ register_model.sh       # One-shot registration
β”‚   └── register_model.ts       # Anchor TS client
β”œβ”€β”€ docs/                       # Model, dataset, onchain, and session docs
β”‚   β”œβ”€β”€ model_card.md           # Live model card (624 lines)
β”‚   β”œβ”€β”€ dataset_card.md         # Dataset documentation (272 lines)
β”‚   β”œβ”€β”€ onchainai.md            # Onchain registry skill (414 lines)
β”‚   β”œβ”€β”€ onchain_constitution.md # Constitution (665 lines)
β”‚   β”œβ”€β”€ clawd_fable.md          # Fable trace training
β”‚   β”œβ”€β”€ clawd_solana_svm_ai_compute_design.md  # Full protocol spec (1658 lines)
β”‚   β”œβ”€β”€ hauhau_qwen36.md        # Qwen3.6 quantization
β”‚   └── SESSIONS.md             # Training session logs
β”œβ”€β”€ etc/                        # Mascot images (4K transparent, blueprint grid)
β”œβ”€β”€ memory/                     # Honcho memory server
β”œβ”€β”€ model-kit/                  # Terminal-first training surface
β”‚   β”œβ”€β”€ bin/clawd-model-kit     # CLI entrypoint
β”‚   β”œβ”€β”€ clawd_model_kit.py      # Python CLI wrapper
β”‚   β”œβ”€β”€ frontend/               # models.x402.wtf + register.x402.wtf
β”‚   β”œβ”€β”€ backend/                # FastAPI arena + status + registration proxy
β”‚   β”œβ”€β”€ scripts/                # Verification scripts
β”‚   └── docs/                   # 8 documentation files
β”œβ”€β”€ nvidia/                     # NVIDIA blueprint implementations
β”‚   └── blueprints/
β”‚       β”œβ”€β”€ transaction-foundation-model/  # BigQuery + tokenizer + CPT pipeline
β”‚       β”œβ”€β”€ model-distillation/            # Nemotron teacher β†’ CoT
β”‚       β”œβ”€β”€ enterprise-rag/                # Document retrieval
β”‚       β”œβ”€β”€ signal-discovery/              # Market signals
β”‚       β”œβ”€β”€ portfolio-optimization/        # cuFOLIO
β”‚       └── aiq/                           # Model quality
β”œβ”€β”€ ollama/                     # Modelfile templates and LFS-backed GGUF builds
β”œβ”€β”€ site/                       # Vite/React source for the training index
β”‚   β”œβ”€β”€ src/
β”‚   β”œβ”€β”€ public/
β”‚   └── assets/
β”œβ”€β”€ tools/                      # Static-site and W&B/data sync helpers
β”œβ”€β”€ training/                   # Imported Nemo Clawd training scaffold
β”œβ”€β”€ training-data/              # Source-grounded corpus/SFT/eval workspace
β”œβ”€β”€ wandb/                      # Local/offline W&B runs; ignored by Git
β”œβ”€β”€ TRAINING_DATA_MAP.md        # Machine-wide training asset inventory
β”œβ”€β”€ .gitattributes              # Git LFS rules and text normalization
└── .gitignore                  # Generated/local cache exclusions

Large JSONL datasets, GGUF model builds, vector indexes, model weight formats, and binary image assets are tracked through Git LFS. Generated dependencies and local runtime output are ignored: site/node_modules/, site/.npm-cache/, site/dist/, Python __pycache__/, NVIDIA blueprint .venv/ directories, .DS_Store, wandb/, and local training outputs.


Contributors

Solizardking

11 commits

Languages

Python

44.1%

JavaScript

18.2%

Standard ML

9.1%

Shell

8.1%

TypeScript

7.5%

HTML

7.3%

Rust

2.1%