Priser og data
Priser og prompt-caching
Hvad en forespørgsel koster, og hvordan du betaler mindre.
Du betaler for tokens: det, du sender (input), og det, modellen skriver (output). Priserne er i kroner pr. 1 mio. tokens, uden moms, og står under Oversigt på platformen. Hver model har tre priser:
| Pris | Gælder for |
|---|---|
| Input | Prompt-tokens, der ikke lå i cachen. |
| Cachet input | Prompt-tokens, der blev læst fra cachen. Meget billigere end input. |
| Output | Svarets tokens. |
Prisen for en forespørgsel er
(prompt_tokens − cached_tokens) × inputpris
+ cached_tokens × pris for cachet input
+ completion_tokens × outputprisTallene står i svarets usage. Prisen trækkes fra din saldo, når svaret er færdigt. Du kan se dit forbrug pr. dag på platformen under Forbrug.
Prompt-caching
Caching sker af sig selv. Når en samtale fortsætter, er starten den samme som sidst: systemprompten og de tidligere beskeder. Den del ligger allerede i cachen og koster prisen for cachet input. Forespørgsler i samme samtale bliver sendt til den samme server, så cachen bliver ramt.
Sådan får du mest ud af den:
- Læg det, der ikke ændrer sig, først, fx en fast systemprompt.
- Tilføj nye beskeder til sidst, og lad de tidligere stå, som de var.
Cachen er delt op pr. konto. En anden konto kan aldrig ramme din cache.
Afbrudte svar
| Hvad sker der | Det betaler du |
|---|---|
| Du stopper en stream undervejs | Prompten og det, modellen nåede at skrive. |
| Du afbryder en forespørgsel uden streaming | Hele svaret. Modellen skriver det færdigt alligevel. |
| Modellen holder op med at svare | Intet. |
Forespørgslen bliver afvist (fx 429 eller 503) | Intet. |
Når du stopper en stream, ved vi endnu ikke, hvor meget af prompten der lå i cachen. Indtil vi kan se det, betaler du inputpris for hele prompten i det tilfælde.