Dansk LLM

Priser og data

Priser og prompt-caching

Hvad en forespørgsel koster, og hvordan du betaler mindre.

Du betaler for tokens: det, du sender (input), og det, modellen skriver (output). Priserne er i kroner pr. 1 mio. tokens, uden moms, og står under Oversigt på platformen. Hver model har tre priser:

PrisGælder for
InputPrompt-tokens, der ikke lå i cachen.
Cachet inputPrompt-tokens, der blev læst fra cachen. Meget billigere end input.
OutputSvarets tokens.

Prisen for en forespørgsel er

(prompt_tokens − cached_tokens) × inputpris
+ cached_tokens × pris for cachet input
+ completion_tokens × outputpris

Tallene står i svarets usage. Prisen trækkes fra din saldo, når svaret er færdigt. Du kan se dit forbrug pr. dag på platformen under Forbrug.

Prompt-caching

Caching sker af sig selv. Når en samtale fortsætter, er starten den samme som sidst: systemprompten og de tidligere beskeder. Den del ligger allerede i cachen og koster prisen for cachet input. Forespørgsler i samme samtale bliver sendt til den samme server, så cachen bliver ramt.

Sådan får du mest ud af den:

  • Læg det, der ikke ændrer sig, først, fx en fast systemprompt.
  • Tilføj nye beskeder til sidst, og lad de tidligere stå, som de var.

Cachen er delt op pr. konto. En anden konto kan aldrig ramme din cache.

Afbrudte svar

Hvad sker derDet betaler du
Du stopper en stream undervejsPrompten og det, modellen nåede at skrive.
Du afbryder en forespørgsel uden streamingHele svaret. Modellen skriver det færdigt alligevel.
Modellen holder op med at svareIntet.
Forespørgslen bliver afvist (fx 429 eller 503)Intet.

Når du stopper en stream, ved vi endnu ikke, hvor meget af prompten der lå i cachen. Indtil vi kan se det, betaler du inputpris for hele prompten i det tilfælde.

På denne side