Skip to content

Commit 0e746e8

Browse files
author
fukuro
committed
docs: ROADMAP + CHANGELOG aktualisiert — M1 teilweise, M2 blockiert
Status nach Solo-Session 05:00-14:00: - AtomicBot-ai#2 Tensor Split Regex ✅ angewendet - AtomicBot-ai#5 GTT Size Tuning ✅ bereits konfiguriert - AtomicBot-ai#4 n-gram Decoding ⏳ verfügbar, Benchmark ausstehend - AtomicBot-ai#1 MTP Logits Copy ❌ 19 Konflikte, skipped - AtomicBot-ai#6 MUL_MAT_ID Subgroup ❌ 23 Konflikte, revertiert - AtomicBot-ai#7 Vulkan FA Refactor ⏭️ verschoben (abhängig von AtomicBot-ai#6) - AtomicBot-ai#9 Vulkan Shmem-Staging ❌ PR closed, manuell portieren
1 parent d6ea2d7 commit 0e746e8

2 files changed

Lines changed: 22 additions & 9 deletions

File tree

CHANGELOG.md

Lines changed: 13 additions & 0 deletions
Original file line numberDiff line numberDiff line change
@@ -8,6 +8,19 @@ Format: `YYYY-MM-DD — <type>: <Was> — <Warum>`
88

99
## 2026-07-11
1010

11+
### Solo-Session (05:00–14:00)
12+
13+
- **feat: #2 Tensor Split Regex static (PR #24710)** — 29 std::regex Patterns von `const` auf `static const` in `src/llama-model.cpp`. Verhindert pro-Token Regex-Recompilation im Tensor-Split-Modus. Build grün auf Hydra (CUDA) und Mars (Vulkan). Commit `bc1eb0207`
14+
- **#1 MTP Logits Copy (PR #23198) — skipped** — 19 Merge-Konflikte in 10 Kern-Dateien (speculative.cpp, llama-context.cpp, qwen35.cpp, etc.). Fork hat `nextn`-Support, PR fügt `pre_norm`-Support hinzu — strukturelle Konflikte. MTP ist OFF in Produktion. Zu hoher Aufwand für geringen Nutzen.
15+
- **#6 MUL_MAT_ID Subgroup (PR #15524) — revertiert** — 23 Merge-Konflikte in 3 Vulkan-Dateien (18 in ggml-vulkan.cpp). Subagent löste Konflikte, aber Shader-Generierung wurde beschädigt (undefined references für `matmul_id_*` Shader). Erfordert manuelle Portierung mit tiefem Vulkan-Shader-Verständnis. Für spätere Session.
16+
- **#5 GTT Size Tuning — bereits konfiguriert** — Mars hat bereits `amdgpu.gttsize=26624` (26GB) in `/proc/cmdline`. GTT ist 26GB, VRAM ist 1GB (APU). Kein weiteres Tuning nötig.
17+
- **#4 n-gram Decoding — verfügbar, Benchmark ausstehend**`--spec-type ngram-mod` auf Mars verfügbar und aktiviert (Log bestätigt `common_speculative_impl_ngram_mod`). Server-Benchmark schwierig wegen OOM bei QAT-Modell. Benchmark mit kürzerem Kontext ausstehend.
18+
- **⏭️ #7 Vulkan FA Refactor (PR #19625) — verschoben** — Abhängig von #6 (MUL_MAT_ID), das revertiert wurde. Shader-Basis muss zuerst stabilisiert werden.
19+
- **#9 Vulkan Shmem-Staging (PR #20897) — PR closed** — PR wurde geschlossen ohne Merge (AI-generiert). Manuelle Portierung nötig, Risiko unklar.
20+
- **docs: ROADMAP.md aktualisiert** — Status für #1, #2, #4, #5, #6, #7, #9 aktualisiert. M1 teilweise, M2 blockiert.
21+
22+
### Vorherige Änderungen
23+
1124
- **docs: ROADMAP-Workflow etabliert**`docs/fork/ROADMAP.md` mit 30 Optimierungs-Ansätzen (M1-M6), Solo-Pläne für M1+M2 in `docs/fork/plans/`. Workflow in AGENTS.md dokumentiert.
1225
- **docs: Commit-Format formalisiert**`<type>: <Was> — <Warum>` (feat, docs, fix, security, refactor, bench)
1326
- **docs: Optimierungs-Recherche (Web + arXiv, 30 Ansätze)** — 4 parallele Subagents, 50+ Quellen, 30 Ansätze kategorisiert nach Tier. Siehe `docs/fork/2026-07-11_OPTIMIZATION_RESEARCH.md`

docs/fork/ROADMAP.md

Lines changed: 9 additions & 9 deletions
Original file line numberDiff line numberDiff line change
@@ -11,8 +11,8 @@
1111

1212
| MS | Name | Items | Status |
1313
|----|------|-------|--------|
14-
| **M1** | Quick-Win-Welle | #1-5 (kombiniert) | ☐ offen |
15-
| **M2** | Vulkan-Offensive | #6, #7, #9, #10, #12 | ☐ offen |
14+
| **M1** | Quick-Win-Welle | #1-5 (kombiniert) | ⏳ teilweise (#2✅, #5✅, #4⏳, #1❌) |
15+
| **M2** | Vulkan-Offensive | #6, #7, #9, #10, #12 | ⏳ blockiert (#6❌, #7⏭️, #9❌) |
1616
| **M3** | MoE-Offloading v2 | #3, #13, #14, #15 | ☐ offen |
1717
| **M4** | Speculative Decoding v2 | #11, #28 | ☐ offen |
1818
| **M5** | Coopmat2 + Multi-GPU | #12, #20, #21 | ☐ offen |
@@ -26,20 +26,20 @@
2626

2727
| # | Status | Ansatz | Systeme | Aufwand | Existiert | Solo-Plan | Gain |
2828
|---|--------|--------|---------|---------|-----------|-----------|------|
29-
| 1 | | MTP Logits Copy Optimization | Mars, Styx | 2-3h | PR #23198 | [M1-Batch](plans/SESSION_PLAN_quickwins-batch1.md) | +20% PP mit MTP |
30-
| 2 | | Tensor Split Regex Optimization | Uranus | 1-2h | PR #24710 | [M1-Batch](plans/SESSION_PLAN_quickwins-batch1.md) | befreit 40% decode thread |
29+
| 1 | | MTP Logits Copy Optimization | Mars, Styx | 2-3h | PR #23198 | [M1-Batch](plans/SESSION_PLAN_quickwins-batch1.md) | +20% PP mit MTP**19 Konflikte in 10 Kern-Dateien, MTP OFF, skipped** |
30+
| 2 | | Tensor Split Regex Optimization | Uranus | 1-2h | PR #24710 (open) | [M1-Batch](plans/SESSION_PLAN_quickwins-batch1.md) | befreit 40% decode thread**angewendet, Build grün auf Hydra+Mars** |
3131
| 3 || Pascal CUDA MMVQ Optimization | Styx | 2-3 Tage | PR #25479 | [M3](plans/SESSION_PLAN_pascal-mmvq.md) | +3-6% decode auf Pascal |
32-
| 4 | | n-gram / Prompt-Lookup Decoding | Alle | 0h | in mainline | [M1-Batch](plans/SESSION_PLAN_quickwins-batch1.md) | hilft bei repetitiven Workloads |
33-
| 5 | | GTT Size Tuning für Mars APU | Mars | 1h | Konfiguration | [M1-Batch](plans/SESSION_PLAN_quickwins-batch1.md) | >15GB GPU-Speicher |
34-
| 6 | | Vulkan MUL_MAT_ID Subgroup Optimization | Mars, Venus | 1 Tag | PR #15524 | [M2](plans/SESSION_PLAN_mulmat-id-subgroup.md) | bis +657% MoE PP auf AMD |
35-
| 7 | | Vulkan FlashAttention Refactor | Mars, Venus | 1 Woche | PR #19625 | [M2](plans/SESSION_PLAN_vulkan-fa-refactor.md) | 10-20% scalar FA improvement |
32+
| 4 | | n-gram / Prompt-Lookup Decoding | Alle | 0h | in mainline | [M1-Batch](plans/SESSION_PLAN_quickwins-batch1.md) | hilft bei repetitiven Workloads**verfügbar, Benchmark ausstehend** |
33+
| 5 | | GTT Size Tuning für Mars APU | Mars | 1h | Konfiguration | [M1-Batch](plans/SESSION_PLAN_quickwins-batch1.md) | >15GB GPU-Speicher**bereits konfiguriert (26GB GTT), kein Tuning nötig** |
34+
| 6 | | Vulkan MUL_MAT_ID Subgroup Optimization | Mars, Venus | 1 Tag | PR #15524 | [M2](plans/SESSION_PLAN_mulmat-id-subgroup.md) | bis +657% MoE PP auf AMD**23 Konflikte in 3 Vulkan-Dateien, Shader-Gen beschädigt, revertiert. Erfordert manuelle Portierung mit tiefem Vulkan-Shader-Verständnis** |
35+
| 7 | ⏭️ | Vulkan FlashAttention Refactor | Mars, Venus | 1 Woche | PR #19625 | [M2](plans/SESSION_PLAN_vulkan-fa-refactor.md) | 10-20% scalar FA improvement**verschoben, abhängig von #6** |
3636

3737
## Tier 2: Mittelfristig (1-3 Wochen)
3838

3939
| # | Status | Ansatz | Systeme | Aufwand | Existiert | Solo-Plan | Gain |
4040
|---|--------|--------|---------|---------|-----------|-----------|------|
4141
| 8 || Mixed Precision KV Cache (Hot/Cold) | Alle | 1 Woche | commit e889fbd | später | Reduziert KV-Größe bei erhaltener Qualität |
42-
| 9 | | Vulkan Shared Memory Staging Kernel | Mars, Venus | 2-3 Tage | PR #20897 | [M2](plans/SESSION_PLAN_vulkan-shmem-staging.md) | >2.5x TG potenziell |
42+
| 9 | | Vulkan Shared Memory Staging Kernel | Mars, Venus | 2-3 Tage | PR #20897 (closed) | [M2](plans/SESSION_PLAN_vulkan-shmem-staging.md) | >2.5x TG potenziell**PR closed ohne Merge (AI-generiert), manuelle Portierung nötig** |
4343
| 10 || UMA Zero-Copy für Mars APU | Mars, Venus | 1-2 Wochen | PR #22462 | [M2](plans/SESSION_PLAN_uma-zero-copy.md) | +112x transfer speed |
4444
| 11 || EAGLE-3 Speculative Decoding | Alle | 2-3 Wochen | PR #18039 | [M4](plans/SESSION_PLAN_eagle3.md) | bis 6.5x speedup |
4545
| 12 || Vulkan Cooperative Matrix (Coopmat2) | Mars, Uranus | 2-3 Wochen | PR #19075 | [M5](plans/SESSION_PLAN_coopmat2-rdna3.md) | 2.5x FA multiply |

0 commit comments

Comments
 (0)