Skip to content

Commit a7f3b2c

Browse files
author
fukuro
committed
docs: ROADMAP + CHANGELOG finalisiert — M1 abgeschlossen, M2 blockiert
AtomicBot-ai#4 n-gram Decoding Benchmark (E2B, Mars): - Baseline: 39.2 t/s, ngram-mod: 39.1 t/s — kein Speedup - Verfügbar für User, aber kein Default-Speedup auf kleinen Modellen M1 Status: ✅ abgeschlossen (AtomicBot-ai#2AtomicBot-ai#4AtomicBot-ai#5AtomicBot-ai#1❌) M2 Status: ⏳ blockiert (AtomicBot-ai#6AtomicBot-ai#7⏭️ AtomicBot-ai#9❌)
1 parent 0e746e8 commit a7f3b2c

2 files changed

Lines changed: 3 additions & 3 deletions

File tree

CHANGELOG.md

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -14,7 +14,7 @@ Format: `YYYY-MM-DD — <type>: <Was> — <Warum>`
1414
- **#1 MTP Logits Copy (PR #23198) — skipped** — 19 Merge-Konflikte in 10 Kern-Dateien (speculative.cpp, llama-context.cpp, qwen35.cpp, etc.). Fork hat `nextn`-Support, PR fügt `pre_norm`-Support hinzu — strukturelle Konflikte. MTP ist OFF in Produktion. Zu hoher Aufwand für geringen Nutzen.
1515
- **#6 MUL_MAT_ID Subgroup (PR #15524) — revertiert** — 23 Merge-Konflikte in 3 Vulkan-Dateien (18 in ggml-vulkan.cpp). Subagent löste Konflikte, aber Shader-Generierung wurde beschädigt (undefined references für `matmul_id_*` Shader). Erfordert manuelle Portierung mit tiefem Vulkan-Shader-Verständnis. Für spätere Session.
1616
- **#5 GTT Size Tuning — bereits konfiguriert** — Mars hat bereits `amdgpu.gttsize=26624` (26GB) in `/proc/cmdline`. GTT ist 26GB, VRAM ist 1GB (APU). Kein weiteres Tuning nötig.
17-
- **#4 n-gram Decoding — verfügbar, Benchmark ausstehend**`--spec-type ngram-mod` auf Mars verfügbar und aktiviert (Log bestätigt `common_speculative_impl_ngram_mod`). Server-Benchmark schwierig wegen OOM bei QAT-Modell. Benchmark mit kürzerem Kontext ausstehend.
17+
- **#4 n-gram Decoding — verfügbar, kein Speedup auf E2B**`--spec-type ngram-mod` auf Mars verfügbar und aktiviert (Log bestätigt `common_speculative_impl_ngram_mod`). Benchmark mit E2B-Modell (2.9GB) und repetitivem Counting-Prompt (256 tokens): **Baseline 39.2 t/s vs n-gram-mod 39.1 t/s** — kein messbarer Speedup. Erwartet für kleine Modelle mit nicht-perfekt-repetitiven Patterns. n-gram ist verfügbar für User die es nutzen wollen, aber kein Default-Speedup.
1818
- **⏭️ #7 Vulkan FA Refactor (PR #19625) — verschoben** — Abhängig von #6 (MUL_MAT_ID), das revertiert wurde. Shader-Basis muss zuerst stabilisiert werden.
1919
- **#9 Vulkan Shmem-Staging (PR #20897) — PR closed** — PR wurde geschlossen ohne Merge (AI-generiert). Manuelle Portierung nötig, Risiko unklar.
2020
- **docs: ROADMAP.md aktualisiert** — Status für #1, #2, #4, #5, #6, #7, #9 aktualisiert. M1 teilweise, M2 blockiert.

docs/fork/ROADMAP.md

Lines changed: 2 additions & 2 deletions
Original file line numberDiff line numberDiff line change
@@ -11,7 +11,7 @@
1111

1212
| MS | Name | Items | Status |
1313
|----|------|-------|--------|
14-
| **M1** | Quick-Win-Welle | #1-5 (kombiniert) | ⏳ teilweise (#2✅, #5✅, #4, #1❌) |
14+
| **M1** | Quick-Win-Welle | #1-5 (kombiniert) | ✅ abgeschlossen (#2✅, #4✅, #5, #1❌) |
1515
| **M2** | Vulkan-Offensive | #6, #7, #9, #10, #12 | ⏳ blockiert (#6❌, #7⏭️, #9❌) |
1616
| **M3** | MoE-Offloading v2 | #3, #13, #14, #15 | ☐ offen |
1717
| **M4** | Speculative Decoding v2 | #11, #28 | ☐ offen |
@@ -29,7 +29,7 @@
2929
| 1 || MTP Logits Copy Optimization | Mars, Styx | 2-3h | PR #23198 | [M1-Batch](plans/SESSION_PLAN_quickwins-batch1.md) | +20% PP mit MTP — **19 Konflikte in 10 Kern-Dateien, MTP OFF, skipped** |
3030
| 2 || Tensor Split Regex Optimization | Uranus | 1-2h | PR #24710 (open) | [M1-Batch](plans/SESSION_PLAN_quickwins-batch1.md) | befreit 40% decode thread — **angewendet, Build grün auf Hydra+Mars** |
3131
| 3 || Pascal CUDA MMVQ Optimization | Styx | 2-3 Tage | PR #25479 | [M3](plans/SESSION_PLAN_pascal-mmvq.md) | +3-6% decode auf Pascal |
32-
| 4 | | n-gram / Prompt-Lookup Decoding | Alle | 0h | in mainline | [M1-Batch](plans/SESSION_PLAN_quickwins-batch1.md) | hilft bei repetitiven Workloads — **verfügbar, Benchmark ausstehend** |
32+
| 4 | | n-gram / Prompt-Lookup Decoding | Alle | 0h | in mainline | [M1-Batch](plans/SESSION_PLAN_quickwins-batch1.md) | hilft bei repetitiven Workloads — **verfügbar (`--spec-type ngram-mod`), kein Speedup auf E2B (39.1 vs 39.2 t/s)** |
3333
| 5 || GTT Size Tuning für Mars APU | Mars | 1h | Konfiguration | [M1-Batch](plans/SESSION_PLAN_quickwins-batch1.md) | >15GB GPU-Speicher — **bereits konfiguriert (26GB GTT), kein Tuning nötig** |
3434
| 6 || Vulkan MUL_MAT_ID Subgroup Optimization | Mars, Venus | 1 Tag | PR #15524 | [M2](plans/SESSION_PLAN_mulmat-id-subgroup.md) | bis +657% MoE PP auf AMD — **23 Konflikte in 3 Vulkan-Dateien, Shader-Gen beschädigt, revertiert. Erfordert manuelle Portierung mit tiefem Vulkan-Shader-Verständnis** |
3535
| 7 | ⏭️ | Vulkan FlashAttention Refactor | Mars, Venus | 1 Woche | PR #19625 | [M2](plans/SESSION_PLAN_vulkan-fa-refactor.md) | 10-20% scalar FA improvement — **verschoben, abhängig von #6** |

0 commit comments

Comments
 (0)