From 7a59de3afa66d7b6adde85ea0b3ad1327fd5db1d Mon Sep 17 00:00:00 2001 From: Vuong Hoang Date: Wed, 8 Jul 2026 15:22:45 -0700 Subject: [PATCH] memory: record brokkr frozen-scorer composites (Deckard 2.176 deployed) + Deckard GDN-hybrid KV/ctx note char-rp-reasoning A/B closed: Deckard median composite 2.176 (0 loop/0 refuse) beats RpR-v4 3.716; Pantheon-Reasoning 1.383 (cleanest prose but 7/30 refusals, rejected). Deckard is GDN-hybrid (16 KV layers) so its ctx scales cheaply (40K->256K ~+7G). --- persistent-memory.md | 7 +++++++ 1 file changed, 7 insertions(+) diff --git a/persistent-memory.md b/persistent-memory.md index 780dc42..590902d 100644 --- a/persistent-memory.md +++ b/persistent-memory.md @@ -150,6 +150,13 @@ _As of 2026-07-08 — OFF-THE-SHELF INFERENCE STACK is the active work (home-tra llama.cpp reasoning seat = STOCK template natively opens `` or has `enable_thinking` (Qwen3.x/QwQ do; ChatML + Gemma-4 don't). **INFRA:** llama-swap b8840 image can't load Qwen3.6/Gemma-4 archs → use `ghcr.io/ggml-org/llama.cpp:server-cuda` (newer, pulled on ana-ml2) for those; Deckard (Qwen3.5) runs on b8840. + **brokkr frozen-scorer CONFIRMED (median composite, content-only; lower=cleaner):** Deckard **2.176** (0 loop/0 + refuse — DEPLOYED, big win over RpR **3.716** + its loop-tail); Pantheon-Reasoning **1.383** (cleanest prose of the + field — beats even Magidonia char-rp 1.774 — BUT 7/30 explicit refusals → rejected: clean-but-refuses loses to + clean-and-uncensored). **MEMORY-LAYOUT note:** Deckard (Qwen3.5-27B) is GDN-hybrid → only **16 KV-caching layers** → + KV is TINY (1.4G @ 40K vs Magidonia's 10.9G @ 128K, 40 dense layers); Deckard native ctx = 256K, so the reasoning + seat's ctx scales nearly free (40K→128K ≈ +3G, →256K ≈ +7G). GPU0 layout: gen ~35G (256K/16-seq/util0.37), char-rp + Magidonia ~30G (128K), char-rp-reasoning Deckard ~21G (40K), ~11.5G free. **MAX CONTEXT (2026-07-08):** char-rp **128K** (Magidonia FULL native 131072), char-rp-reasoning **40K** (QwQ native 40960, YaRN-free max), **q8_0 KV cache both** (near-lossless, ~2× ctx/GB; verified coherent, no Qwen gibberish). **Funded by gen util 0.40→0.37** (freed ~2.9G of gen's IDLE KV headroom — gen KV usage runs 0-2%,