Maximale KI Power für deine Services
Deine eigenen GPUs mit deinen Wunsch-Modellen. 100% Digital souverän, gehosted in Deutschland.
RTX 6000 PRO
fully managed
für deine intensiven KI-Workloads
Bis zu
VRAM
kompatible API
digital souverän
Lass dir in der Ausführung deiner Ideen keine Grenzen setzen. Skaliere dein Setup flexibel zusammen mit deinem Projekt.
Bereit für deine Anforderungen: Nutze eigene Open-Weight Modelle, die perfekt auf dein Projekt zugeschnitten sind.
Viel Leistung, viel Potential
Dedicated AI Power für deine Entwicklungen
Was unsere Kunden sagen
Freie Wahl beim KI Modell
Du bestimmst, welches Modell auf deiner GPU läuft. Dir stehen unsere vordefinierten Modelle zur Verfügung, oder wir installieren ein Modell deiner Wahl - auf bis zu 4 GPUs. (RTX 6000 Pro mit 96 GB)
Trending LLM Leader Board
| Model | Anwendung | Kontext | Benötigte RTX 6000 Pro (96 GB) |
|---|---|---|---|
| Qwen3.5-122B-A10B | Chat, Reasoning, Vision | 256k | 2 GPUs |
| Gemma 4 31B | Text, Bild, Tool Calling | 256k | 1 GPU |
| DeepSeek V4 Flash | Text, Reasoning, Tool Calling | 1 Mio. | 2 GPUs |
| MiMo V2.5 | Text, Bild, Reasoning, Tool Calling | 1 Mio. | 4 GPUs |
| gpt-oss-120b | Text, Tool Calling | 131k | 1 GPU |
Skalieren und Erweitern
Deine AI wächst mit deinen Anforderungen
GPU Power aus Deutschland
Gehosted in unserem Rechenzentrum
Unsere Infrastruktur ist ISO 27001 zertifiziert und erfüllt höchste Sicherheitsstandards.
Keine Speicherung von Trainingsdaten
Du hast die volle über alle Daten, die du den Modellen zur Verarbeitung gibst.
§203 StGB-konform
Anwälte, Ärzte und Steuerberater können Mandats-, Patienten- und Beratungsdaten rechtssicher verarbeiten.
AI in deinem persönlichen Workflow
So arbeitest du mit deinen KI Modellen.
Integriert in deine Arbeit
Du betreibst das AI Hosting eingebettet in deine ganz persönlichen Workflows. Dafür stehen dir mehrere Arbeitsweisen zur Verfügung:
Verlass dich auf uns
Du hast besonders hohe Ansprüche an die Performance deines Projekts. Das verstehen wir und sind deshalb für dich da. Egal, ob es um die Optimierung deiner Architektur, die Modellperformance oder die Verfeinerung deines Setups geht: Du hast einen kurzen Draht zu uns, damit kein Anliegen offen bleibt.
Und wenn du dir nicht sicher bist, welche Ressourcen du für deine Projekte benötigst oder welcher unserer Hosting Tarife der richtige für dich ist, dann melde dich! Unter +49 5772 293 150 stehen wir dir gerne zur Seite.
AI Hosting Tarife
Wähle das perfekte Setup für deine Anforderungen
Inklusive bei jedem Tarif
Betrieb
Deployment, Updates, Verfügbarkeit und technischer Betrieb - wir übernehmen den kompletten Ops-Aufwand.
Unlimited Tokens
Deinem Projekt sind keine Grenzen gesetzt: Mit unserem Dedicated AI Hosting kennst du keine Token-Limits.
Monitoring
Grafana-Dashboards, Metriken und Alerts inklusive: Du behältst die Performance deines Setups immer im Blick.
Testen vor Go-Live
Auf Wunsch führen wir für dich intensive Lasttests durch, bevor dein Projekt produktiv geht.
API
Dein eigener dedizierter Endpunkt, OpenAI-kompatibel und direkt in App, Agent oder Pipeline einbindbar.
Persönliche Betreuung
Deployment, Updates, Verfügbarkeit und technischer Betrieb - wir übernehmen den kompletten Ops-Aufwand.
Connect
OMR AI
AI jetzt ausprobieren
Teste jetzt alle verfügbaren AI Modelle im mittwald Playground:
mittwald AI Community
Du willst den Kontakt zu einer engagierten AI Community? Du möchtest mit unseren AI Engineers diskutieren oder dich mit anderen Developern austauschen? Zusammen sprechen wir über Themen, die eine KI-Nutzung von morgen mitgestalten. Wir freuen uns auf den Austausch mit dir. Komm jetzt in unsere Discord Community oder registriere dich auf unserem DevPortal!
Hier bekommst du Antworten
Wenn eine GPU beispielsweise 96 GB Grafikspeicher besitzt, kann das KI-Modell diesen Speicher nicht vollständig belegen. Ein Teil des Speichers wird benötigt, damit das Modell effizient arbeiten kann.
Durch die Nutzung eines Zwischenspeichers können Antworten schneller erzeugt und auch längere Unterhaltungen verarbeitet werden.
Ein kleinerer Zwischenspeicher führt zu
- Kürzeren Gesprächsverläufen (Kontext),
- geringerer Performance,
- ineffizienter Verarbeitung wiederkehrender Inhalte.
Wir reservieren bewusst einen Teil des Grafikspeichers für den Betrieb deiner Modelle. So erhältst du eine insgesamt bessere Performance und ein deutlich angenehmeres Nutzungserlebnis.
Int8 und Int4 beschreiben, wie KI-Modelle intern gespeichert werden. Vereinfacht gesagt geht es darum, wie viele Informationen für jede einzelne Zahl im Modell verwendet werden.
- Int8 benötigt mehr Speicher und bietet dafür eine höhere Genauigkeit.
- Int4 benötigt deutlich weniger Speicher und ermöglicht dadurch größere Modelle oder eine höhere Geschwindigkeit.
In der Praxis sind die Unterschiede bei vielen Anwendungen gering. Aktuelle KI-Modelle werden speziell darauf optimiert, auch mit FP4 sehr gute Ergebnisse zu liefern.
Die meisten Systeme können wir bereits deutlich schneller bereitstellen.
Je nach gewünschter Konfiguration müssen aber zusätzlich Komponenten eingebaut, Systeme eingerichtet und die gewünschten KI-Modelle installiert und getestet werden.
Deshalb geben wir aktuell 2–4 Wochen als reguläre Bereitstellungszeit an. Sollte es aufgrund außergewöhnlicher Hardware-Lieferzeiten oder einer sehr speziellen Konfiguration einmal länger dauern, besprechen wir das bereits in der Planungsphase deines Projekts.
Dedicated AI Hosting ist deutlich aufwendiger als ein klassisches Hosting-Produkt.
Für deine Umgebung stellen wir dedizierte Hardware bereit, richten die Infrastruktur ein und installieren die gewünschten KI-Modelle. Je nach Tarif sind dafür auch manuelle Konfigurationen notwendig, wie beispielsweise der Einbau zusätzlicher GPUs.
Dieser Einrichtungsaufwand entsteht unabhängig davon, wie lange du das System nutzt.
Mit einer Mindestvertragslaufzeit von 3 bzw. 6 Monaten schaffen wir einen fairen Ausgleich: Du erhältst eine individuell geschaffene Dedicated-Umgebung, und wir können die notwendigen Investitionen in Hardware und Einrichtung planen. Auf diese Weise können wir dir auch langfristig attraktive Preise bieten.
Im AI Hosting kannst du pro Organisation im mStudio einen oder mehrere OpenAI-kompatible APIKeys generieren. Mit diesen API-Keys kannst du unsere aktuell verfügbaren fünf KI-Modelle direkt ansprechen und in eigene Anwendungen, Workflows oder Systeme integrieren.
Zusätzlich hast du die Möglichkeit, automatisch einen Open WebUI-Container zu erstellen. Dieser eignet sich ideal, um die Modelle direkt über eine grafische Oberfläche zu testen, mit ihnen zu chatten oder Prototypen zu entwickeln.
Darüber hinaus kannst du im Container Hosting weitere AI-nahe Services betreiben und mit dem AI Hosting kombinieren, zum Beispiel:
- Vektordatenbanken
- Agenten-Frameworks
- eigene Inferenz- oder Orchestrierungsdienste
Die eingesetzten Modelle sind öffentlich verfügbar und stammen aus Open-Source-Communities oder aus frei nutzbaren Projekten. Es handelt sich dabei um sogenannte Open-Weight-Modelle, die transparent einsetzbar sind und sich problemlos in eigene Anwendungen integrieren lassen.
Um AI Hosting zu nutzen, benötigst du:
- einen Zugang zum mStudio
- eine angelegte Organisation im mStudio
- einen aktiven Paid Plan für AI Hosting
Ein klassisches Hosting-Paket (z. B. Webhosting, vServer oder Dedicated Server) ist nicht erforderlich. Diese Voraussetzung galt ausschließlich während der Beta-Phase.
Sobald deine Organisation angelegt und ein Paid Plan aktiviert ist, kannst du ein Projekt erstellen und im Bereich AI Hosting einen oder mehrere API-Keys generieren.
Die aktuell verfügbaren Modelle findest du jederzeit im Developer Portal. Zum Start stehen folgende Modelle zur Verfügung:
- OSS‑120B (OpenAI)
Open‑Weight‑Modell mit starkem Reasoning und sehr guten agentischen Fähigkeiten. Geeignet für komplexe Aufgaben, Analysen und anspruchsvolle Workflows. - Whisper‑Large‑V3‑Turbo
Leistungsfähiges Speech‑to‑Text‑Modell für Transkription, Voice‑Interfaces und Audio‑Workflows. - Qwen3‑Embedding‑8B
Embedding‑Modell für semantische Suche, Textähnlichkeit, RAG‑Setups und Empfehlungssysteme. - Devstral‑Small‑2‑24B
Speziell optimiert für agentenbasierte Coding‑Aufgaben, Code‑Generierung, Refactoring und Debugging. - Ministral 3 14B
Vielseitiges Sprachmodell für allgemeine Text‑, Chat‑ und Reasoning‑Aufgaben.
Weitere Modelle werden sukzessive ergänzt.
Ja. Alle Anfragen werden ausschließlich innerhalb unserer eigenen Infrastruktur verarbeitet. Es findet kein Datentransfer außerhalb Deutschlands statt – auch nicht in Drittstaaten wie die USA. Eingaben werden nicht zum Training der Modelle verwendet. Alle Prozesse erfüllen die Anforderungen der DSGVO.
Inhalte wie Texteingaben oder Prompts werden nicht dauerhaft gespeichert. Sie dienen ausschließlich der unmittelbaren Verarbeitung und werden anschließend verworfen.
Die eingesetzten Modelle sind nicht lernfähig im Sinne eines Trainings auf Nutzerdaten. Deine Eingaben haben keinen Einfluss auf zukünftige Antworten.
Viele CMS wie TYPO3 CMS oder WordPress unterstützen Plugins oder Extensions mit OpenAI-kompatibler API-Anbindung. Dort kannst du einfach deinen mittwald-AI Hosting-API-Key hinterlegen und die Funktionalität direkt nutzen.
Open WebUI ist eine benutzerfreundliche Open-Source-Oberfläche für die Arbeit mit Sprachmodellen. Du kannst dort:
- direkt mit den mittwald-Modellen chatten
- eigene API-Keys (z. B. von OpenAI) verwenden
- Modelle vergleichen und testen
Der Container lässt sich im mStudio mit wenigen Klicks automatisch erstellen. Um Open WebUI zu betreiben, benötigst du einen vServer oder Dedicated Server.
Das lässt sich im Voraus nie zu 100 % exakt bestimmen – der Tokenverbrauch hängt stark vom Use Case, vom gewählten Modell sowie von Länge und Anzahl der Anfragen ab.
So gehst du am besten vor:
- Wenn du bereits APIs wie z. B. OpenAI nutzt, kannst du dich an deinem bisherigen Tokenverbrauch orientieren.
- Alternativ startest du mit einem Tarif und beobachtest deinen tatsächlichen Verbrauch.
- Deinen aktuellen Tokenverbrauch kannst du jederzeit transparent im mStudio einsehen.
- Alle Tarife haben monatliche Laufzeiten, sodass du flexibel upgraden oder downgraden kannst.
Token-Zahlen sind abstrakt. Die folgende Übersicht zeigt Näherungswerte, was du mit den jeweiligen Tarifen konkret umsetzen kannst. Die Angaben basieren auf dem OSS‑120B‑Modell und dienen ausschließlich zur Orientierung. Der tatsächliche Verbrauch kann je nach Prompt und Antwort variieren.
Eine Übersicht für typische Nutzungsszenarien findest du hier.
Unser Support‑Team steht dir während der regulären Supportzeiten per Ticket, Telefon oder Live‑Chat zur Verfügung.
Zusätzlich findest du im Developer Portal ausführliche technische Dokumentation, Code‑Beispiele und Hinweise zur API‑Nutzung, zu Modellen sowie zu typischen Integrationsszenarien rund um AI‑Hosting.
Darüber hinaus kannst du dich im Agentur Hub mit anderen Agenturen sowie Entwicklerinnen und Entwicklern austauschen.
Aktuell gibt es keine separate Test‑ oder Trial‑Funktion für AI Hosting.
Du kannst jedoch den kleinsten verfügbaren Tarif buchen, AI Hosting einen Monat lang nutzen und anschließend direkt wieder kündigen. Es gibt dabei keine Mindestlaufzeit über den gebuchten Zeitraum hinaus.
So kannst du AI Hosting realistisch im Produktivbetrieb testen – inklusive API‑Keys, Modellen und Limits.