WebGPU-Arena ist dein privates, WebGPU-beschleunigtes Testlabor für lokale LLMs direkt im Browser. Vergleiche zwei Modelle im Blind-Test oder nutze den Einzel-Chat als sicheren Daily-Driver für deine Fragen – 100% ohne API-Keys, ohne Accounts und ohne Cloud-Zwang.
- 🏟️ Arena Mode: Teste zwei Modelle anonym gegeneinander. Wer liefert die bessere Antwort? Dein Voting beeinflusst das globale Leaderboard.
- 💬 Einzel-Chat: Ein hochwertiger, privater Chat-Modus mit Modell-Vorschlägen, Markdown-Support und lokaler Historie.
- Neue Modell-Generation (2025/2026): Qwen3.5 (Vision), Phi-4 mini, Ministral 3 (inkl. Reasoning), Hermes 3, Qwen3 (Thinking-Modus) – die 2024er-Modellreihe wurde archiviert.
- WebGPU Benchmark: Isolierte Hardware-Messung (MatMul, SAXPY, GEMM) unter
/benchmark– GPU vs. CPU im direkten Vergleich. - 3B Model Limit: Unterstützung für Champions wie Qwen3.5 4B, Phi-4 mini und Ministral 3 3B.
- Privacy First: Deine Prompts verlassen niemals dein Gerät.
- WebGPU-Powered: Die KI läuft dank
@mlc-ai/web-llmextrem performant direkt über deine lokale Grafikkarte. - Lokal & Persistent: Deine Chat-Historien und ELO-Scores werden lokal gespeichert.
- PWA-Ready: Installiere die WebGPU-Arena als eigenständige App auf deinem Desktop oder Smartphone.
- No-Key Security: Sicherer, anonymer Daten-Sync via Supabase Edge Functions.
- System-Monitoring: Echtzeit-Anzeige von WebGPU-Status und Browser-RAM-Verbrauch.
Die Arena nutzt für den Browser kompilierte Modelle (WebLLM-Zoo von mlc-ai). Wir setzen auf das 3B-Limit (Flaggschiffe bis 4B), um den idealen Mix aus Qualität und Speed zu bieten:
- Qwen3.5 4B: Das neue Flaggschiff (2026). Vision-fähig, 262k Kontext, schlägt viele 20B-Modelle im Benchmark.
- Phi-4 mini (3.8B): Microsofts Reasoning-Spezialist. Extrem starke Logik und Mathematik.
- Ministral 3 3B: Mistral aktueller Champion (12/2025) inkl. Reasoning-Variante mit Chain-of-Thought.
- Hermes 3 3B: Nous-Research-Finetune – der Nachfolger des Llama-3.2-Champions.
- Qwen3.5 2B: 2026er-Generation im kompakten Format, Vision & Text.
- Qwen3 1.7B: Mit schaltbarem Thinking-Modus – stark in Mathe, Code und Logik.
- Qwen 2.5 3B: Solider Allrounder, exzellente Mehrsprachigkeit.
- Gemma 3 1B: Googles neue 1B-Generation für maximale Speed.
Archiv: Die 2023/2024er-Modellreihe (Llama 3.2, Gemma 2, SmolLM2, Qwen 2.5 0.5B/1.5B, TinyLlama) ist ausgemustert und wird nur noch in der ELO-Historie geführt.
Da die App als reine Frontend-Applikation läuft, benötigst du kein Backend:
# 1. Repository klonen
git clone https://github.com/ogerly/webgpu-arena.git
cd webgpu-arena
# 2. Abhängigkeiten installieren
npm install
# 3. Entwicklungsserver starten
npm run devDieses Projekt ist "Serverless" und wird auf einem Hugging Face Space (Docker/nginx) gehostet: https://huggingface.co/spaces/ogerl/webgpu-arena
Deploy-Prozess:
# 1. Build mit relativen Pfaden (für den Space)
VITE_BASE_URL=./ npm run build
# 2. Inhalt von dist/ in den Space-Repository-Workspace kopieren (inkl. Dockerfile + Space-README)
# 3. Commit + Push an den Space
git push hf mainSicherheit: API-Tokens (HuggingFace, Supabase) leben nur in .env bzw. im Betriebssystem-Credential-Store — niemals im Code, in Commits oder im Space.
Damit die KI im Browser läuft, wird Folgendes benötigt:
- Ein moderner Webbrowser (empfohlen: Google Chrome oder Microsoft Edge).
- WebGPU muss unterstützt und aktiviert sein (falls es standardmäßig nicht aktiv ist, im Browser
chrome://flags/#enable-unsafe-webgpuauf Enabled setzen). - Speicherplatz: Beim erstmaligen Laden werden die Modelldaten im Browser-Cache gespeichert (ca. 0.5 bis 2 GB pro Modell).
Dieses Projekt ist Open Source. Fühle dich frei, die Arena zu forken, Pull Requests zu erstellen oder eigene Modelle (q4f16_1-MLC) hinzuzufügen!
Die Entwicklung der WebGPU-Arena folgt dem AAMS-Prinzip. Dies stellt sicher, dass die Zusammenarbeit zwischen Mensch und KI strukturiert, dokumentiert und jederzeit nachvollziehbar bleibt. (Repository)
- Whitepapers: Architektur-Entscheidungen und "Source of Truth".
- Workpapers: Aktuelle Aufgaben und Implementierungsschritte.
- Archive: Dokumentation abgeschlossener Meilensteine.
Dies ist ein privates Projekt. Die Nutzung der WebGPU-Arena erfolgt auf eigene Gefahr und Verantwortung.
- Keine Gewähr: Es wird kein Anspruch auf Funktionalität, Support oder Datensicherheit erhoben.
- Datenschutz-Garantie: Ich garantiere, dass bei Standardnutzung keine Daten dein Gerät verlassen. Die Anwendung ist konsequent auf lokale Autonomie ausgelegt.
- Verantwortung: Jeder Nutzer ist für die Einhaltung lokaler Gesetze und die Verwendung der generierten Inhalte selbst verantwortlich.
Ich freue mich über jede Form von Austausch! Ob Bug-Reports, Feature-Ideen oder einfach nur ein Gespräch über die Zukunft der lokalen KI – melde dich gerne über GitHub Issues oder direkt bei mir.
Gebaut mit 🤖 Support für maximale Entwickler-Effizienz.