Zum Inhalt springen
AtheronLABS

Erkanntes Land: Vereinigte Staaten. Preise werden in US-Dollar angezeigt. Nicht richtig?

labs@atheron:~/insights/llm-routes$ compare --route frontier,open-source,custom

Drei Wege zu einem Modell

Spitzenmodell, Open Source oder ein eigenes LLM.

Jede KI-Funktion sitzt auf einem Sprachmodell, und Sie haben drei Wege, eines zu bekommen: ein Spitzenmodell über eine API mieten, ein Open-Source-Modell selbst betreiben oder eines für Sie anfertigen lassen. Jeder ist für irgendwen die richtige Antwort. Dieser Ratgeber hilft Ihnen herauszufinden, welcher Ihrer ist.

KI · Veröffentlicht 2. Oktober 2026 · 8 min read

Drei Wege, ein Sprachmodell einzubauen

Das Modell ist der Motor unter einer KI-Funktion: der Assistent, der aus Ihren Dokumenten antwortet, der Agent, der ein Ticket anlegt, der Klassifikator, der eingehende E-Mails sortiert. Die Software darum herum (Anmeldung, Seiten, der Suchindex, die Werkzeuge, die der Agent nutzen darf, die Tests) ist weitgehend dieselbe, egal welches Modell Sie wählen. Was sich ändert, ist, wie Sie für das Modell bezahlen, wer es betreibt und was Sie daran ändern können.

Die drei Wege im Überblick
WegWas es istWofür Sie bezahlenWas Sie kontrollieren
SpitzenmodellEin führendes kommerzielles Modell, über die API des Anbieters aufgerufen.Tokens: jedes Wort hinein und hinaus, jeden Monat.Ihre Prompts, Werkzeuge und Daten. Nicht das Modell, seine Versionen oder seine Abschaltdaten.
Open SourceEin Modell mit veröffentlichten Gewichten, auf Servern Ihrer Wahl betrieben.GPU-Server, jeden Monat, ob ausgelastet oder ruhig.Die Modellversion, wo es läuft und wohin die Daten gehen.
Eigenes ModellEin Modell, das wir für Sie machen: nachtrainiert, weitertrainiert oder von Grund auf trainiert.Datenarbeit und GPU-Trainingszeit vorab, dann GPU-Betrieb.Alles, einschließlich dessen, was das Modell weiß und wie es sich verhält.

Die meisten Projekte sollten auf dem ersten Weg beginnen und nur wechseln, wenn es einen Grund gibt. Die Gründe sind aber real, und es lohnt sich, sie vor dem Bau zu kennen.

Spitzenmodelle über eine API

Ein Spitzenmodell ist das leistungsfähigste allgemeine Modell, das ein Anbieter verkauft. Sie schicken Text (und oft Bilder oder Dateien) an eine API und zahlen je Token. Es gibt keinen Server zu betreiben, der Anbieter verbessert das Modell mit der Zeit, und Sie können in Tagen einen funktionierenden Prototyp haben.

Die Frage, die die meisten Kunden zuerst stellen, ist, was mit ihren Daten geschieht. Die Antwort hängt vom Anbieter und vom Tarif ab, also lesen Sie die Bedingungen für das genaue Produkt, das Sie nutzen. OpenAI gibt an, dass an seine API gesendete Daten nicht zum Training seiner Modelle genutzt werden, außer Sie stimmen zu, und dass Protokolle zur Missbrauchsüberwachung bis zu 30 Tage aufbewahrt werden [1]. Anthropic gibt an, dass es Eingaben und Ausgaben seiner kommerziellen Produkte, einschließlich seiner API, standardmäßig nicht zum Training seiner Modelle nutzt [2]. Die Bedingungen der Gemini API von Google ziehen eine Linie zwischen Tarifen: Inhalte, die an die unbezahlten Dienste gesendet werden, können zur Verbesserung der Produkte von Google genutzt werden, Prompts und Antworten bei den bezahlten Diensten nicht [3].

Spitzenmodelle lesen auch viel auf einmal. Google nennt für Gemini 2.5 Pro eine Eingabegrenze von 1.048.576 Tokens [4], genug für mehrere lange Dokumente in einer Anfrage. Ein großes Kontextfenster ist nützlich, aber kein Ersatz für Suche: Jedes Mal alles zu senden ist langsam, und Sie zahlen für jedes Token davon.

  • Richtig, wenn: Sie das stärkste verfügbare Schlussfolgern wollen, Ihr Verkehr mäßig oder ungleichmäßig ist und die Datenbedingungen des Anbieters zu Ihren Daten passen.
  • Achten Sie auf: Token-Ausgaben, die mit der Nutzung wachsen, Modelle, die nach dem Zeitplan des Anbieters abgeschaltet werden, und Ratenlimits zu Spitzenzeiten.
  • Planen Sie: einen Prüfsatz, den Sie erneut laufen lassen können, wenn der Anbieter eine neue Version veröffentlicht, sodass ein Upgrade ein Testergebnis ist und kein Sprung ins Ungewisse.

Open-Source-Modelle, die Sie selbst betreiben

Modelle mit offenen Gewichten werden veröffentlicht, damit jeder sie herunterladen und betreiben kann. Sie betreiben sie auf GPUs, die Sie bei einem Cloud-Anbieter mieten, oder auf einem GPU-Server, den Sie kaufen. Die Daten verlassen nie Server, die Sie kontrollieren, das Modell ändert sich nie, außer Sie ändern es, und die Monatskosten sind die Server statt der Tokens.

Offen heißt nicht bedingungslos. Lesen Sie die Lizenz des genauen Modells und der genauen Version. Die Lizenz von Meta für Llama 3.1 etwa verlangt eine gesonderte Lizenz von Meta für einen Lizenznehmer, dessen Produkte am Veröffentlichungstag mehr als 700 Millionen monatlich aktive Nutzer hatten, und bittet Sie, „Built with Llama“ anzuzeigen [5]. Andere Modelle mit offenen Gewichten erscheinen unter der Apache License 2.0, die eine gebührenfreie Lizenz zur Nutzung, Änderung und Verbreitung des Werks gewährt [6]. Ihre Berater sollten die geltende Lizenz lesen, bevor Sie ausliefern.

  • Richtig, wenn: Ihre Daten an einem Ort Ihrer Wahl bleiben müssen, Ihr Verkehr stetig genug ist, um eine GPU auszulasten, oder Sie ein Modell brauchen, das sich nicht unter Ihnen ändert.
  • Achten Sie auf: Die GPU-Rechnung sinkt nicht, wenn niemand das Produkt nutzt, und die stärksten offenen Modelle brauchen große GPUs.
  • Planen Sie: jemanden, der den Betriebsstack aktualisiert, überwacht und absichert. Es ist ein Server wie jeder andere, mit einem Modell darauf.

Ein eigenes LLM

Ein eigenes Modell ist eines, das für Ihren Einsatz verändert oder geschaffen wurde. Es gibt drei Stufen, und der Unterschied im Aufwand zwischen ihnen ist groß.

  1. 01

    Nachtraining

    Ein bestehendes offenes Modell wird auf Beispielen der Aufgabe weitertrainiert: Ihren Supportantworten, Ihrem Berichtsformat, Ihren Klassifizierungslabels. Es lernt einen Stil und eine Fähigkeit, keine Bibliothek von Fakten. Diese Stufe brauchen die meisten Projekte mit eigenem Modell.

  2. 02

    Fortgesetztes Vortraining

    Ein bestehendes Modell liest vor dem Nachtraining eine große Menge Text aus Ihrem Fachgebiet, sodass es das Vokabular und den Hintergrund eines spezialisierten Feldes lernt. Es braucht weit mehr Text und GPU-Zeit.

  3. 03

    Training von Grund auf

    Ein neues Modell, aus Ihren Daten und öffentlichen Daten gebaut. Es ist mit großem Abstand der teuerste Weg und für ein Unternehmen selten der richtige. Sinnvoll ist er, wenn das Modell selbst das Produkt ist.

Auf welcher Stufe auch immer: Die Arbeit, die über die Qualität entscheidet, sind die Daten und die Bewertung, nicht der Trainingslauf. Ein eigenes Modell ist nur so gut wie die Beispiele, aus denen es gelernt hat, und wie gut es ist, wissen Sie nur, wenn Sie es an Fragen testen, die es nie gesehen hat. GPU-Zeit für das Training wird vorab zum Selbstkostenpreis berechnet, außerhalb der Meilensteine, weil sie vor der Arbeit bezahlt wird, die sie nutzt.

Derselbe Assistent, auf drei Arten

Die drei durchgerechneten Beispiele unten sind dasselbe Produkt: eine Web-App, in der Mitarbeitende Fragen an die Dokumente des Unternehmens stellen, und ein Agent, der Dinge nachschlagen und ein Ticket öffnen kann. Nur der Modellweg ändert sich. Jedes zeigt die Spanne nach unserer heutigen Preisliste, die Entwicklung und die monatlichen Betriebskosten, berechnet, wenn Sie die Seite öffnen.

Durchgerechnetes Beispiel, jetzt berechnet

Auf einem Spitzenmodell

Ein Dokumentenassistent mit Werkzeugen, auf einem Spitzenmodell über dessen API, bei mittlerer Nutzung. Die Betriebskosten sind vor allem Tokens.

Entwicklung
≈ 89.000 USD bis 136.000 USD, delivered within 21 weeksCAD 126,700 to 193,700

Preise in Ihrer Währung sind Schätzungen zum heutigen Kurs der Bank of Canada. Alle Rechnungen werden in CAD oder USD gestellt.

Betrieb

Hosting
≈ 558 USD im MonatCAD 795 im Monat
Support
≈ 1.000 USD im MonatCAD 1,425 im Monat
Laufende Modellkosten
≈ 383 USD im MonatCAD 545 im Monat

Durchgerechnetes Beispiel, jetzt berechnet

Auf einem Open-Source-Modell

Derselbe Assistent auf einem Modell mit offenen Gewichten, betrieben auf gemieteten GPUs bei DigitalOcean. Die Betriebskosten sind vor allem der GPU-Server.

Entwicklung
≈ 96.100 USD bis 147.000 USD, delivered within 22 weeksCAD 136,800 to 209,100

Preise in Ihrer Währung sind Schätzungen zum heutigen Kurs der Bank of Canada. Alle Rechnungen werden in CAD oder USD gestellt.

Betrieb

Hosting
≈ 4.360 USD im MonatCAD 6,210 im Monat
Support
≈ 1.000 USD im MonatCAD 1,425 im Monat
Laufende Modellkosten
≈ 4.190 USD im MonatCAD 5,960 im Monat

Durchgerechnetes Beispiel, jetzt berechnet

Auf einem eigenen nachtrainierten Modell

Derselbe Assistent auf einem Modell, das auf den eigenen Beispielen des Unternehmens nachtrainiert und dann auf gemieteten GPUs betrieben wird. Die Entwicklung umfasst die Datenarbeit, die Trainingszeit und die Bewertung.

Entwicklung
≈ 133.000 USD bis 202.000 USD, delivered within 33 weeksCAD 188,800 to 288,000

Preise in Ihrer Währung sind Schätzungen zum heutigen Kurs der Bank of Canada. Alle Rechnungen werden in CAD oder USD gestellt.

Betrieb

Hosting
≈ 4.360 USD im MonatCAD 6,210 im Monat
Support
≈ 1.000 USD im MonatCAD 1,425 im Monat
Laufende Modellkosten
≈ 4.190 USD im MonatCAD 5,960 im Monat

Vergleichen Sie die Betriebskosten ebenso wie die Entwicklung. Die Kosten eines Spitzenmodells bewegen sich mit der Nutzung, also ist ein ruhiger Monat günstig und ein voller nicht. Ein selbst betriebenes Modell kostet jeden Monat etwa gleich viel. Liegen die Monatskosten des Spitzenmodell-Beispiels bei Ihrem erwarteten Verkehr deutlich über den Betriebskosten, beginnt sich der Open-Source-Weg zu lohnen. Ändern Sie den Verkehr im Rechner, um diesen Punkt zu finden.

Was auf jedem Weg gleich bleibt

Welches Modell Sie auch wählen, der Großteil des Projekts ist die Software darum herum, und dieser Teil ändert sich nicht. Die Dokumente müssen weiterhin zerlegt, indexiert und synchron gehalten werden. Die Werkzeuge des Agenten brauchen weiterhin Berechtigungen, damit er eine Bestellung nachschlagen, aber ohne einen Menschen nicht erstatten kann. Antworten brauchen weiterhin ihre Quellen, damit Mitarbeitende sie prüfen können. Und das Ganze braucht weiterhin einen Prüflauf vor jeder Änderung, Protokolle, die zeigen, was das Modell gefragt wurde und was es tat, und einen Weg, es abzuschalten.

Das ist eine gute Nachricht für die Entscheidung. Weil die umgebende Arbeit geteilt ist, ist der Weg eine kleinere Wahl, als es zuerst scheint, und eine, die Sie später ändern können, wenn die App über eine eigene dünne Schicht mit dem Modell spricht. Wählen Sie den Weg, der heute zu Ihren Daten und Ihrem Verkehr passt, und halten Sie sich den Wechsel offen.

Wie Sie entscheiden

  1. 01

    Mit den Daten beginnen

    Wohin dürfen sie? Sagen Ihre Berater oder die Verträge Ihrer Kunden, dass sie Ihre Server oder Ihr Land nicht verlassen dürfen, entscheidet sich der Open-Source- oder eigene Weg von selbst. Sind die Bedingungen einer bezahlten API eines Anbieters akzeptabel, machen Sie weiter.

  2. 02

    Zuerst die Bewertung bauen

    Schreiben Sie fünfzig bis einige hundert echte Fragen mit guten Antworten auf. Jeder Weg wird am selben Satz gemessen, sodass Sie nach Belegen wählen.

  3. 03

    Prototyp auf einem Spitzenmodell

    Das ist der schnellste Weg, um herauszufinden, ob die Funktion überhaupt nützlich ist. Viele Projekte hören hier auf, zu Recht.

  4. 04

    Betriebskosten bei echtem Verkehr berechnen

    Schätzen Sie einen Monat echter Nutzung. Vergleichen Sie Tokens mit einem GPU-Server. Der Kreuzungspunkt hängt von Ihrer Menge ab, nicht von irgendeiner Faustregel.

  5. 05

    Ein offenes Modell am selben Prüfsatz testen

    Schneidet es nah genug ab, gewinnen Sie Kontrolle und eine feste Rechnung. Wenn nicht, wissen Sie, was Ihnen das Spitzenmodell wert ist.

  6. 06

    Ein eigenes Modell zuletzt erwägen

    Trainieren Sie nur nach, wenn das offene Modell nah dran, aber nicht am Ziel ist und Sie die Beispiele haben, um es zu lehren. Trainieren Sie nur von Grund auf, wenn das Modell das Produkt ist.

Fehler, die wir sehen

  • Ein Modell wählen, bevor die Bewertung geschrieben ist. Ohne Testsatz sieht jedes Modell in einer Demo gut aus.
  • Nachtrainieren, um Fakten beizubringen. Fakten ändern sich; ein nachtrainiertes Modell muss neu trainiert werden, um sie zu lernen. Retrieval ist aktuell, sobald es das Dokument ist.
  • Die Betriebskosten ignorieren. Was günstig zu bauen ist, kann teuer im Betrieb sein, und umgekehrt.
  • So tief auf Sonderfunktionen eines Anbieters bauen, dass ein Wechsel eine Neuentwicklung ist. Eine dünne Schicht zwischen Ihrer App und dem Modell hält den Weg zu einer Entscheidung, die Sie überdenken können.
  • Eine Lizenz für offene Gewichte als Freibrief behandeln. Jede hat ihre eigenen Bedingungen.

Wir bauen auf allen drei Wegen und berechnen jeden für sich, also haben wir keinen Grund, einen davon zu drängen. Ist ein Spitzenmodell über seine API die günstigste gute Antwort, was es oft ist, empfehlen wir genau das.

// sources

Woher die Zahlen kommen.

Jede Statistik in diesem Ratgeber verlinkt hierher. Preise kommen aus unserem Rechner, nicht aus einer Quelle.

  1. [1]OpenAI, Your data (API-Dokumentation), 2026. developers.openai.com/api/docs/guides/your-data
  2. [2]Anthropic Privacy Center, Is my data used for model training?, 2026. privacy.claude.com/en/articles/7996868-is-my-data-used-for-model-training
  3. [3]Google, Gemini API Additional Terms of Service, 2026. ai.google.dev/gemini-api/terms
  4. [4]Google, Modellkarte zu Gemini 2.5 Pro in der Dokumentation der Gemini API, 2026. ai.google.dev/gemini-api/docs/models/gemini-2.5-pro
  5. [5]Meta, Llama 3.1 Community License Agreement, 2024. github.com/meta-llama/llama-models/blob/main/models/llama3_1/LICENSE
  6. [6]Apache Software Foundation, Apache License, Version 2.0, 2004. www.apache.org/licenses/LICENSE-2.0

// questions

Kurze Antworten.

Können wir den Weg später wechseln?

Ja, wenn die App über eine eigene dünne Schicht mit dem Modell spricht und Sie einen Prüfsatz behalten. Dann ist ein Wechsel eine Konfigurationsänderung und ein Testlauf, keine Neuentwicklung.

Ist ein Open-Source-Modell weniger leistungsfähig?

Die stärksten Spitzenmodelle führen meist beim schweren Schlussfolgern. Bei fokussierten Aufgaben wie Antworten aus Dokumenten, Klassifizieren oder Extrahieren schneidet ein gutes offenes Modell oft nah genug ab. Ihr Prüfsatz sagt es Ihnen.

Wem gehört ein eigenes Modell?

Ihnen, sobald es bezahlt ist, vorbehaltlich der Lizenz eines Basismodells, auf dem es aufbaut.

// weiter

Haben Sie ein Projekt im Kopf?

Geben Sie es in den Rechner und erhalten Sie in wenigen Minuten eine Spanne. Oder erzählen Sie uns davon, und wir melden uns mit Fragen.

Spitzenmodell, Open Source oder eigenes LLM: wie Sie wählen | Atheron Network Labs