Stand 2026-08-03. Diese Liste ist eine
datierte Momentaufnahme von GET /models.
Angemeldet gleicht die Seite sie live ab.
Live abgeglichen. Die Liste unten kommt gerade eben von
GET /models, nicht aus der Momentaufnahme.
Stand 2026-08-03. Der Live-Abgleich hat nicht geklappt; angezeigt wird die Momentaufnahme. Sie ist nicht falsch, nur möglicherweise nicht die neueste.
Nach Aufgabe wählen
Ein Alias sagt, wofür ein Modell gedacht ist — nicht, wie viele Parameter es
hat. prima-70b wäre heute korrekt und nach dem nächsten
Modellwechsel unseres Anbieters eine Lüge. Deshalb heissen sie so, wie sie
heissen.
prima-quick
Hohe Stückzahl, mechanische Arbeit
Klassifizieren, extrahieren, umformatieren. Alles, wovon Sie zehntausend Stück am Tag durchschieben und wo die Antwort kurz und eindeutig ist.
festgeschrieben: prima-quick-2026-08
prima-core
Der Standard
Wenn Sie nicht wissen, welches Modell Sie brauchen, nehmen Sie dieses. Formulieren, zusammenfassen, beantworten — gutes Deutsch, schnell.
festgeschrieben: prima-core-2026-08
prima-deep
Schwieriges Urteil
Mehrdeutigkeit, Widersprüche, Fälle in denen ein schnelles Modell eine plausible Begründung erfindet statt nachzufragen. Deutlich langsamer und deutlich teurer — bewusst einsetzen.
festgeschrieben: prima-deep-2026-08
Embeddings sind keine vierte Stufe
prima-embed
Embeddings
Vektoren für Suche, Ähnlichkeit und Clustering. Eine andere Modalität, keine vierte Stufe — abgerechnet pro Anfrage, nicht pro Token.
festgeschrieben: prima-embed-2026-08
prima-embed gehört nicht in die Reihe quick → core → deep. Es ist
eine andere Modalität, wird über einen eigenen Endpunkt angesprochen und anders
gezählt. Ein Chat-Alias an /embeddings ergibt 400, und
umgekehrt genauso.
quick, core oder deep?
Die Unterscheidung zwischen prima-core und
prima-deep ist gemessen, nicht behauptet. In einer
Testreihe mit absichtlich mehrdeutigen Fällen hat das Modell hinter
prima-deep die falsche Übereinstimmung in
drei von drei Fällen erkannt, während das schnellere Modell
eine plausible Begründung dafür erfunden hat. Umgekehrt war das schnellere
Modell beim Entwerfen von Text rund 18-mal schneller.
Praktisch:
- Nehmen Sie
prima-core, solange nichts dagegen spricht. - Nehmen Sie
prima-quick, wenn Sie sehr viele gleichartige Aufrufe machen und die Antwort kurz und eindeutig ist. - Nehmen Sie
prima-deep, wenn eine erfundene Begründung teurer wäre als ein paar Sekunden Wartezeit. Rechnen Sie mit zweistelligen Sekunden.
prima-deep hat eine Besonderheit: Der Gateway hebt ein zu
knappes max_tokens automatisch auf 8000 an und vermerkt das in
der Antwort. Ohne diese Anhebung bricht das Modell mitten im Denken ab und
liefert eine leere Antwort mit finish_reason: "length" — eine
Rechnung ohne Gegenwert. Der Aufruf schlägt also nicht fehl, er wird
grosszügiger ausgeführt, als Sie ihn gestellt haben.
Festgeschriebene Varianten
Zu jedem Alias gibt es ein eingefrorenes Gegenstück mit Datum im Namen. Was
prima-core heisst, zeigt immer auf das aktuell beste Modell für
diese Aufgabe. Was prima-core-2026-08 heisst, zeigt für immer auf
die Zuordnung von August 2026.
| gleitend | festgeschrieben | Modalität |
|---|---|---|
prima-quick | prima-quick-2026-08 | Chat |
prima-core | prima-core-2026-08 | Chat |
prima-deep | prima-deep-2026-08 | Chat |
prima-embed | prima-embed-2026-08 | Embedding |
Wählen Sie die festgeschriebene Variante, wenn eines davon zutrifft:
- Sie müssen ein Ergebnis später reproduzieren können.
- Ihre Prompts sind auf ein Modellverhalten hin optimiert und ein stiller Wechsel würde Ihre Auswertung ungültig machen.
- Sie arbeiten in einem regulierten Umfeld und dokumentieren, was Sie einsetzen.
Und die gleitende, wenn Sie einfach das jeweils beste Modell wollen.
curl https://api.prima.li/api/prima/v1/chat/completions \
-H "X-API-Key: $PRIMA_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "prima-core-2026-08",
"messages": [{"role": "user", "content": "Sag nur: OK"}],
"max_tokens": 30
}' Warum es Aliase überhaupt gibt
Unser Modellanbieter darf ein benanntes Modell mit 30 Tagen
Vorlauf ersetzen, eine Kategorie mit 90, und ein Beta-Modell
jederzeit ohne Haftung zurückziehen. Würden wir Ihnen den Herstellernamen
direkt geben, wäre deren Fluktuation Ihr Ausfall. Der Alias fängt das ab: wir
tauschen die Zuordnung, Sie merken nichts. Genau deshalb steht in der Antwort
auch immer Ihr Alias im Feld model und nie ein
Herstellername.
Aliase programmatisch lesen
GET /models beschreibt jeden Eintrag selbst. Nutzen Sie diese
Felder, statt Namen in Ihren Code zu schreiben:
{
"object": "list",
"data": [
{
"id": "prima-core",
"object": "model",
"owned_by": "prima",
"prima_kind": "chat",
"prima_floating": true,
"prima_pinned_variant": "prima-core-2026-08"
},
{
"id": "prima-core-2026-08",
"object": "model",
"owned_by": "prima",
"prima_kind": "chat",
"prima_floating": false,
"prima_pinned_date": "2026-08"
}
// … acht Einträge insgesamt
]
} | Feld | Bedeutung |
|---|---|
prima_kind | "chat" oder "embedding" — welcher Endpunkt. |
prima_floating | true = gleitend, false = festgeschrieben. |
prima_pinned_variant | Auf einem gleitenden Alias: der Name des eingefrorenen Gegenstücks. |
prima_pinned_date | Auf einem festgeschriebenen Alias: wann es eingefroren wurde. |
// Richtig: nach den Feldern gruppieren, die die API selbst mitschickt.
const res = await fetch(BASE + "/models", { headers: { "X-API-Key": key } });
const { data } = await res.json();
const chatAliases = data.filter((m) => m.prima_kind === "chat" && m.prima_floating);
const pinnedFor = (alias) => data.find((m) => m.id === alias.prima_pinned_variant);
// Falsch: eine Liste von Namen im eigenen Code.
// const ALIASES = ["prima-quick", "prima-core", "prima-deep"]; // veraltet beim nächsten Pin-Datum Momentaufnahme vom 2026-08-03; Messwerte auf dieser Seite geprüft am 3. August 2026.