Managed Dedicated AI Hosting

Maximale KI Power für deine Services

Deine eigenen GPUs mit deinen Wunsch-Modellen. 100% Digital souverän, gehosted in Deutschland.

Dedicated AI Hosting Features

Ein Produkt, nicht nur Infrastruktur

Wir hosten deine Ideen. Statt nur eines Servers erhältst du das beste Umfeld für dein Projekt: managed, skalierbar und von der Einrichtung bis zum Go-Live stets für dich da.

Viel Leistung, viel Potential

Dedicated AI Power für deine Entwicklungen

Applikationen
SaaS
Automationen
RAG
Applikationen

Einfach integrierbar

Mach KI zu einem Teil deiner Applikationen. Über die OpenAI-kompatible API ist die Integration einfach. Perfekt für deine Entwicklungen.

Passende Modelle:

gpt-oss-120b

Qwen3.6-35B-A3B-FP8

Ministral-3-14B-Instruct-2512

Steht für moderne Technologien, effiziente Workflows und ein starkes Entwickler-Team.
SaaS

Boost für deine Entwicklungen

Gib deinen SaaS-Produkten den AI-Boost. Alle Modelle kannst du feinjustieren und perfekt auf deinen Use Case abstimmen.

Passende Modelle:

Qwen3.6-35B-A3B-FP8

gpt-oss-120b

Dein individuelles Wunsch-Modell

Das passende Modell für jeden Anwendungsfall.
Automationen

KI arbeiten lassen 

Für Automationen nutzt du unser komplettes Ökosystem. n8n und Vektordatenbanken betreibst du im Docker Container. Content Generierung und embedding löst du über AI.

Passende Modelle:

gpt-oss-120b

Qwen3-Embedding-8B

Ministral-3-14B-Instruct-2512

“Wir entwickeln im Austausch mit Agenturen und Entwicklern, um für diese echten Mehrwert zu schaffen.”

Maik Behring, Product Manager AI Hosting bei mittwald

Steht für moderne Technologien, effiziente Workflows und ein starkes Entwickler-Team.
RAG

Files verarbeiten

Daten mit KI in deinem abgegrenzten Bereich bearbeiten, das machst du mit einem RAG-System. Perfekt für deine Kunden, die etwa interne Dokumentationen durchsuchen wollen.

Passende Modelle:

Qwen-VL-Reranker

Qwen3-Embedding-8B

gpt-oss-120b

Steht für moderne Technologien, effiziente Workflows und ein starkes Entwickler-Team.

Was unsere Kunden sagen

“Wir benötigen große Serverkapazitäten für ein anspruchsvolles KI-Projekt, über die wir lokal nicht verfügen.“

Mit mittwald haben wir einen vertrauensvollen und kompetenten Ansprechpartner gefunden, der gute Performance und das von unseren Kunden gewünschte Maß an Datensicherheit gewährleistet. Bei steigenden Anwenderzahlen können wir das Dedicated AI-Hosting dem Bedarf anpassen und weitere Ressourcen hinzuschalten.

Frank Hotz, Jedermann Verlag

Freie Wahl beim KI Modell

Du bestimmst, welches Modell auf deiner GPU läuft. Dir stehen unsere vordefinierten Modelle zur Verfügung, oder wir installieren ein Modell deiner Wahl - auf bis zu 4 GPUs. (RTX 6000 Pro mit 96 GB)

ModelAnwendungKontextBenötigte RTX 6000 Pro (96 GB)
Qwen3.5-122B-A10BChat, Reasoning, Vision256k2 GPUs
Gemma 4 31BText, Bild, Tool Calling256k1 GPU
DeepSeek V4 FlashText, Reasoning, Tool Calling1 Mio.2 GPUs
MiMo V2.5Text, Bild, Reasoning, Tool Calling1 Mio.4 GPUs
gpt-oss-120bText, Tool Calling131k1 GPU

Skalieren und Erweitern

Deine AI wächst mit deinen Anforderungen

Starte mit einer und erweitere bei Bedarf mit zusätzlicher GPU.

Load Balancing: Schutz vor zu hoher Last.

Betreibe mehrere Modelle parallel oder ein Modell auf mehreren GPUs

GPU Power aus Deutschland

Gehosted in unserem Rechenzentrum

Unsere Infrastruktur ist ISO 27001 zertifiziert und erfüllt höchste Sicherheitsstandards.

Keine Speicherung von Trainingsdaten

Du hast die volle über alle Daten, die du den Modellen zur Verarbeitung gibst. 

§203 StGB-konform

Anwälte, Ärzte und Steuerberater können Mandats-, Patienten- und Beratungsdaten rechtssicher verarbeiten.

AI in deinem persönlichen Workflow

So arbeitest du mit deinen KI Modellen.

Flexible Arbeitsweisen

Integriert in deine Arbeit

Du betreibst das AI Hosting eingebettet in deine ganz persönlichen Workflows. Dafür stehen dir mehrere Arbeitsweisen zur Verfügung:

Onboarding

Von deiner Idee zum Launch

Gemeinsam finden wir die passende Infrastruktur für dein Projekt. Unsere Specialists begleiten dich vom ersten Aufschlag bis hin zum Go-Live - Testläufe inklusive.

01
Erstberatung

Sag uns, was du planst: Zusammen entwickeln wir ein detailliertes Anforderungsprofil für dein Projekt, das Hardware, Modelle und Schnittstellen umfasst.

02
Setup

Anhand deiner Spezifikationen empfehlen wir dir Modelle, Konfigurationen sowie Architektur und erstellen das passende Setup für dein Projekt.

03
Testphase

Niemand mag Überraschungen: Wir erstellen auf Wunsch eine Testumgebung, in der du Konfiguration, Modelle und Performance unter Last testen kannst.

04
Produktiver Betrieb

Sobald du mit Setup und Leistung zufrieden bist, gehen wir zusammen live. Wir halten engen Kontakt, damit dein System von Anfang an reibungslos performt.

Support + Beratung

Verlass dich auf uns

Du hast besonders hohe Ansprüche an die Performance deines Projekts. Das verstehen wir und sind deshalb für dich da. Egal, ob es um die Optimierung deiner Architektur, die Modellperformance oder die Verfeinerung deines Setups geht: Du hast einen kurzen Draht zu uns, damit kein Anliegen offen bleibt.

Zertifizierter Support

Persönliche Ansprechpartner

Austausch mit anderen Agenturen und Entwicklern

Und wenn du dir nicht sicher bist, welche Ressourcen du für deine Projekte benötigst oder welcher unserer Hosting Tarife der richtige für dich ist, dann melde dich! Unter +49 5772 293 150 stehen wir dir gerne zur Seite.

AI Hosting Tarife

Wähle das perfekte Setup für deine Anforderungen

999 €
pro Monat zzgl. USt.*

Managed
Dedicated AI M

1x RTX 6000 PRO

Speicher und Modellgrößen 

96 GB vRAM (ca. 62 GB für Modelle nutzbar)

bis 60B Modelle bei Int8 

bis 120B Modelle bei Int4

Mindestlaufzeit 3 Monate

Bereitstellung 2-4 Wochen

1899 €
pro Monat zzgl. USt.*
Empfohlen

Managed
Dedicated AI L

2x RTX 6000 PRO

Loadbalancing möglich

große Modelle über mehrere GPUs möglich

Speicher und Modellgrößen

192 GB vRAM (ca. 125 GB für Modelle nutzbar)

bis 120B Modelle bei Int8 

bis 250B Modelle bei Int4

Mindestlaufzeit 6 Monate

Bereitstellung 2-4 Wochen

3599 €
pro Monat zzgl. USt.*

Managed
Dedicated AI XL

4x RTX 6000 PRO

Loadbalancing möglich

große Modelle über mehrere GPUs möglich

Speicher und Modellgrößen 

384 GB vRAM (ca. 250 GB für Modelle nutzbar)

bis 250B Modelle bei Int8 

bis 500B Modelle bei Int4

Mindestlaufzeit 6 Monate

Bereitstellung 2-4 Wochen

Bleib nicht ratlos!

Welche Ressourcen braucht Dein Vorhaben und welcher Tarif rechnet sich wirklich? Welches Model eignet sich für welche Aufgabe? 

Wir helfen dir weiter, im direkten Beratungsgespräch oder per Chat.

Inklusive bei jedem Tarif

Betrieb

Deployment, Updates, Verfügbarkeit und technischer Betrieb - wir übernehmen 
den kompletten Ops-Aufwand.

Unlimited Tokens

Deinem Projekt sind keine Grenzen gesetzt: Mit unserem Dedicated AI Hosting kennst du keine Token-Limits.

Monitoring

Grafana-Dashboards, Metriken und Alerts inklusive: Du behältst die Performance deines Setups immer im Blick.

Testen vor Go-Live

Auf Wunsch führen wir für dich intensive  Lasttests durch, bevor dein Projekt produktiv geht.

API

Dein eigener dedizierter Endpunkt, OpenAI-kompatibel und direkt in App, Agent oder Pipeline einbindbar.

Persönliche Betreuung

Deployment, Updates, Verfügbarkeit und technischer Betrieb - wir übernehmen 
den kompletten Ops-Aufwand.

Connect

Testsieger
connect professional Siegel „Überragend“ für mittwald Webhosting, Dezember 2025

OMR AI

Watchlist
connect professional Siegel „Überragend“ für mittwald Webhosting, Dezember 2025

Suchst du einen kleineren Tarif? Dann schau hier vorbei!

Jederzeit flexibel erweiterbar

Deine Anforderungen ändern sich? Dein Dedicated System wächst einfach mit.

Mehr GPU Leistung

Keine Angst vor leistungshungrigen Projekten: Mit bis zu vier dedicated GPUs sind deiner Projektarchitektur keine Grenzen gesetzt.

Weitere Modelle


Dein Setup benötigt mehr als ein Modell, um performant zu arbeiten? Betreibe unterschiedliche Modelle parallel und ohne eigenen Einrichtungsaufwand.  

Modellwechsel

So flexibel, wie du es brauchst: Deine Modellentscheidung ist keine Einbahnstraße. Ein Wechsel des installierten Modells ist jederzeit möglich.

Neue Open-Weight Modelle

Mehr Auswahl für mehr Flexibilität: Wir erweitern unsere Modellauswahl fortlaufend und geben dir die Option, dein eigenes Wunschmodell zu installieren.

AI jetzt ausprobieren

Teste jetzt alle verfügbaren AI Modelle im mittwald Playground:

Keine Anmeldung nötig

Alle Modelle verfügbar

Nutzen für deinen Case sofort prüfbar

mittwald AI Community

Du willst den Kontakt zu einer engagierten AI Community? Du möchtest mit unseren AI Engineers diskutieren oder dich mit anderen Developern austauschen? 
Zusammen sprechen wir über Themen, die eine KI-Nutzung von morgen mitgestalten. Wir freuen uns auf den Austausch mit dir.
Komm jetzt in unsere Discord Community oder registriere dich auf unserem DevPortal!

Zum Developer Portal

KI und Nachhaltigkeit

KI ist jetzt bereits die Technologie der Zukunft. Wir geben dir die Tools für eine verantwortungsvolle und nachhaltige Nutzung.

Nachhaltige Webentwicklung bei mittwald mit verantwortungsvoller Unternehmenskultur

KI verantwortungsvoll einsetzen

KI benötigt Rechenleistung. Deshalb legen wir Wert darauf, eine Bandbreite unterschiedlicher Modellgrößen bereitzustellen. So kannst du das Modell auswählen, das die beste Balance zwischen Ergebnisqualität, Geschwindigkeit und CO₂-Footprint bietet. Für viele Anwendungen reichen schon kleine Modelle. Komplexe Anfragen kannst du gezielt an größere Modelle weiterleiten, um Energieverbrauch, Kosten und Antwortzeiten zu reduzieren.

Hier bekommst du Antworten

Wenn eine GPU beispielsweise 96 GB Grafikspeicher besitzt, kann das KI-Modell diesen Speicher nicht vollständig belegen. Ein Teil des Speichers wird benötigt, damit das Modell effizient arbeiten kann. 

Durch die Nutzung eines Zwischenspeichers können Antworten schneller erzeugt und auch längere Unterhaltungen verarbeitet werden. 

Ein kleinerer Zwischenspeicher führt zu 

  • Kürzeren Gesprächsverläufen (Kontext), 
  • geringerer Performance, 
  • ineffizienter Verarbeitung wiederkehrender Inhalte. 

Wir reservieren bewusst einen Teil des Grafikspeichers für den Betrieb deiner Modelle. So erhältst du eine insgesamt bessere Performance und ein deutlich angenehmeres Nutzungserlebnis. 

Int8 und Int4 beschreiben, wie KI-Modelle intern gespeichert werden. Vereinfacht gesagt geht es darum, wie viele Informationen für jede einzelne Zahl im Modell verwendet werden. 

  • Int8 benötigt mehr Speicher und bietet dafür eine höhere Genauigkeit. 
  • Int4 benötigt deutlich weniger Speicher und ermöglicht dadurch größere Modelle oder eine höhere Geschwindigkeit. 

In der Praxis sind die Unterschiede bei vielen Anwendungen gering. Aktuelle KI-Modelle werden speziell darauf optimiert, auch mit FP4 sehr gute Ergebnisse zu liefern.  

Die meisten Systeme können wir bereits deutlich schneller bereitstellen.  

Je nach gewünschter Konfiguration müssen aber zusätzlich Komponenten eingebaut, Systeme eingerichtet und die gewünschten KI-Modelle installiert und getestet werden. 

Deshalb geben wir aktuell 2–4 Wochen als reguläre Bereitstellungszeit an. Sollte es aufgrund außergewöhnlicher Hardware-Lieferzeiten oder einer sehr speziellen Konfiguration einmal länger dauern, besprechen wir das bereits in der Planungsphase deines Projekts. 

Dedicated AI Hosting ist deutlich aufwendiger als ein klassisches Hosting-Produkt. 

Für deine Umgebung stellen wir dedizierte Hardware bereit, richten die Infrastruktur ein und installieren die gewünschten KI-Modelle. Je nach Tarif sind dafür auch manuelle Konfigurationen notwendig, wie beispielsweise der Einbau zusätzlicher GPUs. 

Dieser Einrichtungsaufwand entsteht unabhängig davon, wie lange du das System nutzt.  

Mit einer Mindestvertragslaufzeit von 3 bzw. 6 Monaten schaffen wir einen fairen Ausgleich: Du erhältst eine individuell geschaffene Dedicated-Umgebung, und wir können die notwendigen Investitionen in Hardware und Einrichtung planen. Auf diese Weise können wir dir auch langfristig attraktive Preise bieten. 

Im AI Hosting kannst du pro Organisation im mStudio einen oder mehrere OpenAI-kompatible APIKeys generieren. Mit diesen API-Keys kannst du unsere aktuell verfügbaren fünf KI-Modelle direkt ansprechen und in eigene Anwendungen, Workflows oder Systeme integrieren. 

Zusätzlich hast du die Möglichkeit, automatisch einen Open WebUI-Container zu erstellen. Dieser eignet sich ideal, um die Modelle direkt über eine grafische Oberfläche zu testen, mit ihnen zu chatten oder Prototypen zu entwickeln. 

Darüber hinaus kannst du im Container Hosting weitere AI-nahe Services betreiben und mit dem AI Hosting kombinieren, zum Beispiel: 

  • Vektordatenbanken
  • Agenten-Frameworks
  • eigene Inferenz- oder Orchestrierungsdienste

Die eingesetzten Modelle sind öffentlich verfügbar und stammen aus Open-Source-Communities oder aus frei nutzbaren Projekten. Es handelt sich dabei um sogenannte Open-Weight-Modelle, die transparent einsetzbar sind und sich problemlos in eigene Anwendungen integrieren lassen.

Um AI Hosting zu nutzen, benötigst du:

  • einen Zugang zum mStudio
  • eine angelegte Organisation im mStudio
  • einen aktiven Paid Plan für AI Hosting

Ein klassisches Hosting-Paket (z. B. Webhosting, vServer oder Dedicated Server) ist nicht erforderlich. Diese Voraussetzung galt ausschließlich während der Beta-Phase. 

Sobald deine Organisation angelegt und ein Paid Plan aktiviert ist, kannst du ein Projekt erstellen und im Bereich AI Hosting einen oder mehrere API-Keys generieren.

Die aktuell verfügbaren Modelle findest du jederzeit im Developer Portal. Zum Start stehen folgende Modelle zur Verfügung:

  • OSS‑120B (OpenAI) 
    Open‑Weight‑Modell mit starkem Reasoning und sehr guten agentischen Fähigkeiten. Geeignet für komplexe Aufgaben, Analysen und anspruchsvolle Workflows. 
  • Whisper‑Large‑V3‑Turbo 
    Leistungsfähiges Speech‑to‑Text‑Modell für Transkription, Voice‑Interfaces und Audio‑Workflows. 
  • Qwen3‑Embedding‑8B
    Embedding‑Modell für semantische Suche, Textähnlichkeit, RAG‑Setups und Empfehlungssysteme. 
  • Devstral‑Small‑2‑24B
    Speziell optimiert für agentenbasierte Coding‑Aufgaben, Code‑Generierung, Refactoring und Debugging.
  • Ministral 3 14B
    Vielseitiges Sprachmodell für allgemeine Text‑, Chat‑ und Reasoning‑Aufgaben. 

Weitere Modelle werden sukzessive ergänzt.

Ja. Alle Anfragen werden ausschließlich innerhalb unserer eigenen Infrastruktur verarbeitet. Es findet kein Datentransfer außerhalb Deutschlands statt – auch nicht in Drittstaaten wie die USA. Eingaben werden nicht zum Training der Modelle verwendet. Alle Prozesse erfüllen die Anforderungen der DSGVO.

Inhalte wie Texteingaben oder Prompts werden nicht dauerhaft gespeichert. Sie dienen ausschließlich der unmittelbaren Verarbeitung und werden anschließend verworfen. 

Die eingesetzten Modelle sind nicht lernfähig im Sinne eines Trainings auf Nutzerdaten. Deine Eingaben haben keinen Einfluss auf zukünftige Antworten.

Viele CMS wie TYPO3 CMS oder WordPress unterstützen Plugins oder Extensions mit OpenAI-kompatibler API-Anbindung. Dort kannst du einfach deinen mittwald-AI Hosting-API-Key hinterlegen und die Funktionalität direkt nutzen.

Open WebUI ist eine benutzerfreundliche Open-Source-Oberfläche für die Arbeit mit Sprachmodellen. Du kannst dort:

  • direkt mit den mittwald-Modellen chatten
  • eigene API-Keys (z. B. von OpenAI) verwenden
  • Modelle vergleichen und testen 

Der Container lässt sich im mStudio mit wenigen Klicks automatisch erstellen. Um Open WebUI zu betreiben, benötigst du einen vServer oder Dedicated Server.

Das lässt sich im Voraus nie zu 100 % exakt bestimmen – der Tokenverbrauch hängt stark vom Use Case, vom gewählten Modell sowie von Länge und Anzahl der Anfragen ab. 

So gehst du am besten vor: 

  • Wenn du bereits APIs wie z. B. OpenAI nutzt, kannst du dich an deinem bisherigen Tokenverbrauch orientieren. 
  • Alternativ startest du mit einem Tarif und beobachtest deinen tatsächlichen Verbrauch. 
  • Deinen aktuellen Tokenverbrauch kannst du jederzeit transparent im mStudio einsehen. 
  • Alle Tarife haben monatliche Laufzeiten, sodass du flexibel upgraden oder downgraden kannst.

Token-Zahlen sind abstrakt. Die folgende Übersicht zeigt Näherungswerte, was du mit den jeweiligen Tarifen konkret umsetzen kannst. Die Angaben basieren auf dem OSS‑120B‑Modell und dienen ausschließlich zur Orientierung. Der tatsächliche Verbrauch kann je nach Prompt und Antwort variieren.

Eine Übersicht für typische Nutzungsszenarien findest du hier.

Unser Support‑Team steht dir während der regulären Supportzeiten per Ticket, Telefon oder Live‑Chat zur Verfügung. 

Zusätzlich findest du im Developer Portal ausführliche technische Dokumentation, Code‑Beispiele und Hinweise zur API‑Nutzung, zu Modellen sowie zu typischen Integrationsszenarien rund um AI‑Hosting. 

Darüber hinaus kannst du dich im Agentur Hub  mit anderen Agenturen sowie Entwicklerinnen und Entwicklern austauschen.

Aktuell gibt es keine separate Test‑ oder Trial‑Funktion für AI Hosting. 

Du kannst jedoch den kleinsten verfügbaren Tarif buchen, AI Hosting einen Monat lang nutzen und anschließend direkt wieder kündigen. Es gibt dabei keine Mindestlaufzeit über den gebuchten Zeitraum hinaus. 

So kannst du AI Hosting realistisch im Produktivbetrieb testen – inklusive API‑Keys, Modellen und Limits.

Dein persönlicher Support

Wir sind für dich am Start. Unter +49 5772 293 150 erreichst du uns persönlich – mit weniger als 90 Sekunden Wartezeit. Egal ob bei Hosting, CMS oder Shop – auf unseren zertifizierten Support kannst du dich verlassen.

Judi
Sales