Referenz

Modelle & Aliase

Vier Aliase, benannt nach der Aufgabe, nicht nach der Grösse. Dahinter liegen Modelle, die sich ändern dürfen — genau dafür sind Aliase da.

Stand 2026-08-03. Diese Liste ist eine datierte Momentaufnahme von GET /models. Angemeldet gleicht die Seite sie live ab.

Live abgeglichen. Die Liste unten kommt gerade eben von GET /models, nicht aus der Momentaufnahme.

Stand 2026-08-03. Der Live-Abgleich hat nicht geklappt; angezeigt wird die Momentaufnahme. Sie ist nicht falsch, nur möglicherweise nicht die neueste.

Nach Aufgabe wählen

Ein Alias sagt, wofür ein Modell gedacht ist — nicht, wie viele Parameter es hat. prima-70b wäre heute korrekt und nach dem nächsten Modellwechsel unseres Anbieters eine Lüge. Deshalb heissen sie so, wie sie heissen.

prima-quick

Hohe Stückzahl, mechanische Arbeit

Klassifizieren, extrahieren, umformatieren. Alles, wovon Sie zehntausend Stück am Tag durchschieben und wo die Antwort kurz und eindeutig ist.

festgeschrieben: prima-quick-2026-08

prima-core

Der Standard

Wenn Sie nicht wissen, welches Modell Sie brauchen, nehmen Sie dieses. Formulieren, zusammenfassen, beantworten — gutes Deutsch, schnell.

festgeschrieben: prima-core-2026-08

prima-deep

Schwieriges Urteil

Mehrdeutigkeit, Widersprüche, Fälle in denen ein schnelles Modell eine plausible Begründung erfindet statt nachzufragen. Deutlich langsamer und deutlich teurer — bewusst einsetzen.

festgeschrieben: prima-deep-2026-08

Embeddings sind keine vierte Stufe

prima-embed

Embeddings

Vektoren für Suche, Ähnlichkeit und Clustering. Eine andere Modalität, keine vierte Stufe — abgerechnet pro Anfrage, nicht pro Token.

festgeschrieben: prima-embed-2026-08

prima-embed gehört nicht in die Reihe quick → core → deep. Es ist eine andere Modalität, wird über einen eigenen Endpunkt angesprochen und anders gezählt. Ein Chat-Alias an /embeddings ergibt 400, und umgekehrt genauso.


quick, core oder deep?

Die Unterscheidung zwischen prima-core und prima-deep ist gemessen, nicht behauptet. In einer Testreihe mit absichtlich mehrdeutigen Fällen hat das Modell hinter prima-deep die falsche Übereinstimmung in drei von drei Fällen erkannt, während das schnellere Modell eine plausible Begründung dafür erfunden hat. Umgekehrt war das schnellere Modell beim Entwerfen von Text rund 18-mal schneller.

Praktisch:

  • Nehmen Sie prima-core, solange nichts dagegen spricht.
  • Nehmen Sie prima-quick, wenn Sie sehr viele gleichartige Aufrufe machen und die Antwort kurz und eindeutig ist.
  • Nehmen Sie prima-deep, wenn eine erfundene Begründung teurer wäre als ein paar Sekunden Wartezeit. Rechnen Sie mit zweistelligen Sekunden.

prima-deep hat eine Besonderheit: Der Gateway hebt ein zu knappes max_tokens automatisch auf 8000 an und vermerkt das in der Antwort. Ohne diese Anhebung bricht das Modell mitten im Denken ab und liefert eine leere Antwort mit finish_reason: "length" — eine Rechnung ohne Gegenwert. Der Aufruf schlägt also nicht fehl, er wird grosszügiger ausgeführt, als Sie ihn gestellt haben.


Festgeschriebene Varianten

Zu jedem Alias gibt es ein eingefrorenes Gegenstück mit Datum im Namen. Was prima-core heisst, zeigt immer auf das aktuell beste Modell für diese Aufgabe. Was prima-core-2026-08 heisst, zeigt für immer auf die Zuordnung von August 2026.

gleitendfestgeschriebenModalität
prima-quick prima-quick-2026-08 Chat
prima-core prima-core-2026-08 Chat
prima-deep prima-deep-2026-08 Chat
prima-embed prima-embed-2026-08 Embedding

Wählen Sie die festgeschriebene Variante, wenn eines davon zutrifft:

  • Sie müssen ein Ergebnis später reproduzieren können.
  • Ihre Prompts sind auf ein Modellverhalten hin optimiert und ein stiller Wechsel würde Ihre Auswertung ungültig machen.
  • Sie arbeiten in einem regulierten Umfeld und dokumentieren, was Sie einsetzen.

Und die gleitende, wenn Sie einfach das jeweils beste Modell wollen.

bash
curl https://api.prima.li/api/prima/v1/chat/completions \
  -H "X-API-Key: $PRIMA_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "prima-core-2026-08",
    "messages": [{"role": "user", "content": "Sag nur: OK"}],
    "max_tokens": 30
  }'

Warum es Aliase überhaupt gibt

Unser Modellanbieter darf ein benanntes Modell mit 30 Tagen Vorlauf ersetzen, eine Kategorie mit 90, und ein Beta-Modell jederzeit ohne Haftung zurückziehen. Würden wir Ihnen den Herstellernamen direkt geben, wäre deren Fluktuation Ihr Ausfall. Der Alias fängt das ab: wir tauschen die Zuordnung, Sie merken nichts. Genau deshalb steht in der Antwort auch immer Ihr Alias im Feld model und nie ein Herstellername.


Aliase programmatisch lesen

GET /models beschreibt jeden Eintrag selbst. Nutzen Sie diese Felder, statt Namen in Ihren Code zu schreiben:

json · echte Antwort (gekürzt)
{
  "object": "list",
  "data": [
    {
      "id": "prima-core",
      "object": "model",
      "owned_by": "prima",
      "prima_kind": "chat",
      "prima_floating": true,
      "prima_pinned_variant": "prima-core-2026-08"
    },
    {
      "id": "prima-core-2026-08",
      "object": "model",
      "owned_by": "prima",
      "prima_kind": "chat",
      "prima_floating": false,
      "prima_pinned_date": "2026-08"
    }
    // … acht Einträge insgesamt
  ]
}
FeldBedeutung
prima_kind"chat" oder "embedding" — welcher Endpunkt.
prima_floatingtrue = gleitend, false = festgeschrieben.
prima_pinned_variantAuf einem gleitenden Alias: der Name des eingefrorenen Gegenstücks.
prima_pinned_dateAuf einem festgeschriebenen Alias: wann es eingefroren wurde.
javascript
// Richtig: nach den Feldern gruppieren, die die API selbst mitschickt.
const res = await fetch(BASE + "/models", { headers: { "X-API-Key": key } });
const { data } = await res.json();

const chatAliases = data.filter((m) => m.prima_kind === "chat" && m.prima_floating);
const pinnedFor = (alias) => data.find((m) => m.id === alias.prima_pinned_variant);

// Falsch: eine Liste von Namen im eigenen Code.
// const ALIASES = ["prima-quick", "prima-core", "prima-deep"];  // veraltet beim nächsten Pin-Datum

Momentaufnahme vom 2026-08-03; Messwerte auf dieser Seite geprüft am 3. August 2026.