Skip to main content
OpenAI Images Generations API stödjer för närvarande flera bildgenereringsmodeller, inklusive den klassiska dall-e-3, den textrenderande gpt-image-1 med starkare förmåga, den senaste generationen gpt-image-2, samt modeller i nano-banana / nano-banana-2 / nano-banana-pro serien som nås via samma gränssnitt. Alla kan generera högkvalitativa bilder baserat på textbeskrivningar. Detta dokument beskriver huvudsakligen användningsprocessen för OpenAI Images Generations API, med vilket vi enkelt kan använda OpenAI-seriens bildgenereringsfunktioner.

Ansökningsprocess

För att använda OpenAI Images Generations API kan du först gå till sidan OpenAI Images Generations API och klicka på knappen “Acquire” för att få de nödvändiga autentiseringsuppgifterna: Om du inte är inloggad eller registrerad, omdirigeras du automatiskt till inloggningssidan där du kan registrera dig och logga in. Efter inloggning återvänder du automatiskt till den aktuella sidan. Vid första ansökan får du en gratis kvot som gör att du kan använda API:et kostnadsfritt.

GPT-Image-2 Modell

gpt-image-2 är OpenAIs nya generation av bildgenereringsmodell, som jämfört med dall-e-3 och gpt-image-1 har tydliga förbättringar i följande avseenden:
  • Starkare instruktionstolkning: Kan exakt förstå komplexa kompositioner, räkning, positionsrelationer och andra strukturerade instruktioner.
  • Klarare textrendering: Engelska och siffror i affischer, menyer, infografik, logotyper med mera visas nästan helt utan fel.
  • Rikare stiluttryck: Stödjer ursprungligen flera stilar såsom filmiska porträtt, retroaffischer, barnillustrationer, produktfotografi och infografik.
  • Inbyggt stöd för flera proportioner + hög upplösning: Täcker 5 proportioner (1:1, 4:3, 3:4, 16:9, 9:16) med 3 upplösningsnivåer (1K / 2K / 4K).
Anropssättet är helt identiskt med andra modeller, du behöver bara sätta fältet model till gpt-image-2. I returvärdet är url en permanent länk till bilden hostad på platform.cdn.xhuoapi.ai, som kan öppnas direkt i webbläsare eller bäddas in på webbsidor.

Stödda värden för size och prisnivåer

gpt-image-2 kontrollerar endast formatet på size. Så länge det inte är auto eller tomt, måste det matcha WIDTHxHEIGHT (t.ex. 1024x1024, 2048x1152, 800x600); andra format ger 400-fel. Prissättningen delas in i två nivåer:
  • 1K standardpris: Inmatning är någon av 1K-rekommenderade storlekar i tabellen nedan eller vanliga 1K alias från upstream (1254x1254, 1672x941, 941x1672 — dessa är faktiska storlekar som upstream returnerar för 1K, och om de skickas tillbaka räknas de fortfarande som 1K).
  • Andra nivåer (1,5×): Alla storlekar utanför ovanstående 1K-mängd, inklusive rekommenderade 2K / 4K förinställningar samt valfria WIDTHxHEIGHT som du skickar in.
Upstream har hårda begränsningar för anpassade storlekar: bredd och höjd måste vara multiplar av 16, längsta sidan ≤ 3840, total pixelantal ≤ 8 294 400. Överskrids detta nekas förfrågan med 4xx-fel.
Du kan även skicka size: "auto" eller utelämna size-fältet, då väljer modellen själv standardstorlek och debiteras som 1K. Upstream garanterar inte strikt pixeljustering för 1K — om du skickar 1024x1024 kan du få 1254x1254, proportionen är dock densamma. Om du skickar tillbaka den som size räknas det fortfarande som 1K. 4K-anrop tar vanligtvis 4–8 minuter, det rekommenderas att använda callback_url för asynkron återkoppling (se nedan).
Om n-parametern gpt-image-2 stödjer för närvarande inte n > 1: parametern ignoreras tyst, oavsett om du skickar n=1 eller n=10 returneras endast 1 bild per anrop och debiteras som 1 bild. Om du vill ha flera kandidater samtidigt, gör flera parallella anrop (helst med olika prompt eller seed för variation). Samma begränsning gäller för gpt-image-1 / gpt-image-1.5 och nano-banana / nano-banana-2 / nano-banana-pro. dall-e-2 är för närvarande den enda modellen som nativt stödjer n > 1; dall-e-3 stödjer endast n = 1.
Nedan visas några verkliga exempel som illustrerar gpt-image-2 kapacitet.

Scenario 1: Filmiska porträtt

I prompten kan du använda filmtermer (35mm film, grund skärpedjup, neonljus etc.) för att exakt styra atmosfär och känsla. Python-exempel:
Svarsexempel:
Genererad bild:

Scenario 2: Retro reseaffisch (med textrendering)

gpt-image-2 är stabil i typografi och layout, lämplig för affischer, menyer, gratulationskort med text.
Bild från url i svaret:

Modellen återger Art Deco-stilen och texten AMALFI och ITALIA 1958 tydligt och korrekt.

Scenario 3: Komplex komposition och räkning

Prompten testar modellens förmåga att följa strukturerade instruktioner om antal och placering.
Genererad bild:

Antalet böcker (1 / 3 / 7) på hyllorna stämmer exakt med prompten, något som var svårt att uppnå stabilt med dall-e-3.

Scenario 4: Illustrationsstil (landskap)

Genom att ange konstnärliga medier och stämningsord kan modellen styras att skapa stiliserade illustrationer.
Genererad liggande illustration:

Asynkron och callback

gpt-image-2 tar vanligtvis 60–90 sekunder per anrop. Om du inte vill hålla en lång anslutning öppen kan du använda callback_url för asynkron återkoppling, anropsflödet är identiskt med andra modeller.

Nano Banana-serien

nano-banana serien är Gemini-baserade bildgenereringsmodeller som nås via samma /openai/images/generations endpoint, du behöver bara ändra model till någon i tabellen nedan.
Viktigt: stödda parametrar Nano Banana använder en adapter för OpenAI-protokollet och stödjer endast parametrarna: model, prompt, size.
  • size mappas enligt tabellen nedan till intern aspect_ratio; ej listade storlekar faller tillbaka till 1:1:
    • 1024x1024 / 512x512 / 256x2561:1
    • 1792x102416:9
    • 1024x17929:16
  • Stöder inte n, quality, style, response_format, background, output_format etc.; dessa ignoreras.
  • Returnerar OpenAI-format (data[].url), men created är alltid 0, ingen b64_json, och revised_prompt är alltid samma som originalprompt.

Grundläggande anrop

Svar:
Bilden nås direkt via url:

Uppgradera till flaggskeppsmodellen nano-banana-pro

Byt bara model till nano-banana-pro, övriga parametrar är desamma:
Svarsexempel:

Asynkron callback

callback_url fungerar även för nano-banana, anropsflödet är identiskt med andra modeller, se avsnittet Asynkron callback.

Grundläggande användning

Du kan fylla i motsvarande fält i gränssnittet som visas nedan:

Vid första användningen behöver du minst fylla i tre saker: authorization som väljs från dropdown, model där du väljer OpenAI DALL-E modell (här finns huvudsakligen en modell, se våra modeller), och prompt där du skriver in texten för bildgenerering. Till höger visas motsvarande genererade anropkod som du kan kopiera och köra direkt eller klicka på “Try” för att testa.

Python-exempel:
Svar:
Resultatet innehåller flera fält:
  • created: ID för denna bildgenerering, unikt för uppgiften.
  • data: innehåller bildgenereringsresultatet.
I data finns detaljer om genererad bild, där url är länken till bilden.

Bildkvalitetsparameter quality

Du kan ange bildkvalitet med två alternativ: standard för standardbild och hd för bild med finare detaljer och högre konsistens. Exempel på inställning till standard:

Till höger visas motsvarande anropkod som kan kopieras eller testas direkt.

Python-exempel:
Svar:
Bild med standard kvalitet:

Med samma anrop men quality satt till hd får du:

hd ger mer detaljerad och konsekvent bild än standard.

Bildstorleksparameter size

Du kan även ange bildens storlek. Exempel med 1024x1024:

Till höger visas anropkod som kan kopieras eller testas.

Python-exempel:
Svar:
Bild med storlek 1024x1024:

Med storlek 1792x1024: Storleken är tydligt annorlunda. Fler storlekar finns i vår officiella dokumentation.

Bildstilparameter style

style har två alternativ: vivid för mer levande bilder och natural för mer naturliga bilder. Exempel med vivid:

Till höger visas anropkod som kan kopieras eller testas.

Python-exempel:
Svar:
Bild med vivid stil:

Med natural stil:

vivid ger mer levande och realistisk bild än natural.

Bildlänkens formatparameter response_format

response_format har två alternativ: b64_json som kodar bilden i Base64, och url som är en vanlig bildlänk. Exempel med url:

Till höger visas anropkod som kan kopieras eller testas.

Python-exempel:
Svar:
Länk till bilden (kan öppnas direkt): Bild URL Bild:

Med b64_json får du Base64-kodad bild i svaret:

Asynkron callback

Eftersom bildgenerering kan ta tid och HTTP-förfrågan annars håller anslutningen öppen och belastar systemresurser, stödjer API:et asynkron callback. Flödet är: klienten skickar med ett callback_url i förfrågan. API returnerar omedelbart ett svar med task_id som identifierar uppgiften. När uppgiften är klar skickar API en POST med JSON till callback_url inklusive task_id och resultat. Exempel: Webhook är en HTTP-server som kan ta emot förfrågningar. För demonstration används https://webhook.site/ som genererar en unik URL: Kopiera URL, t.ex. https://webhook.site/3d32690d-6780-4187-a65c-870061e8c8ab. Skicka anrop med callback_url:
Svar:
Efter en stund kan du se resultatet på webhook-sidan:
Resultatet innehåller task_id och data med samma bildresultat som synkront anrop, vilket möjliggör koppling via ID.

Felhantering

Vid fel returnerar API lämpliga felkoder och meddelanden, t.ex.:
  • 400 token_mismatched: Felaktig förfrågan, saknade eller ogiltiga parametrar.
  • 400 api_not_implemented: Felaktig förfrågan, saknade eller ogiltiga parametrar.
  • 401 invalid_token: Obefogad, ogiltig eller saknad autentiseringstoken.
  • 429 too_many_requests: För många förfrågningar, överskriden gräns.
  • 500 api_error: Intern serverfel.

Felrespons-exempel

Slutsats

Med detta dokument har du fått en förståelse för hur du använder OpenAI Images Generations API för att enkelt använda officiella OpenAI DALL-E bildgenereringsfunktioner. Vi hoppas detta hjälper dig att integrera och använda API:et bättre. Vid frågor, kontakta gärna vårt tekniska supportteam.