Geriausi DI modeliai tekstams rašyti: palyginimas
Kurį modelį rinktis straipsniams, laiškams, aprašymams ir vertimams: kainos, vieši testų rezultatai ir paprastos išvados.
Trumpa išvada
Claude Opus 5.5
LMArena kūrybinio rašymo teste jis surinko 1517 taškų, o AURORA daugiakalbiame teste – 76,4 %. Rinktis svarbiausiems tekstams, kai priimtina skaitymo 4 $ / rašymo 20 $ už 1 mln. kaina.
Gemini 3.8 Flash
Kūrybinio rašymo teste surinko 1487 taškus ir AURORA šaltinyje pirmavo daugiakalbiuose tęstiniuose pokalbiuose. Skaitymas 0,75 $ / rašymas 3,75 $ už 1 mln. yra gerokai pigesnis už kokybės lyderį.
Claude Haiku 5.5
Artificial Analysis indekse geriausias tikrintas režimas surinko 43 taškus, todėl modelis tinkamas aiškioms, pasikartojančioms užduotims. Skaitymas 0,10 $ / rašymas 0,5 $ už 1 mln. yra mažiausia pateikto sąrašo kaina.
Vieši testai rodo, kad tekstų kokybė nėra vienas bendras dydis. Claude Opus 5.5 pirmauja tarp lyginamų modelių LMArena kūrybinio rašymo teste, o Artificial Analysis bendrame gebėjimų indekse stipriai atrodo ir Claude Sonnet 5.5 bei GPT-6.1 Sol. Gemini 3.8 Flash kūrybinio rašymo rezultatu priartėja prie brangesnių modelių, o pigesni Claude Haiku 5.5 ir DeepSeek V4.1 Flash siūlo pakankamą lygį dideliems kiekiams, jei tekstai vėliau tikrinami.
Brangūs modeliai labiausiai tinka ilgiems, svarbiems ir sudėtingo tono tekstams; vidutinės klasės modeliai – kasdieniams laiškams, straipsnių juodraščiams ir klientų aptarnavimui; pigūs – santraukoms, šablonams ir masiniams produktų aprašymams. Mažesnėms kalboms bendri angliški reitingai nėra patikima garantija: AURORA rezultatai rodo, kad modelių vietos keičiasi pagal kalbą ir užduotį. Atskiro dabartinių devynių modelių lietuvių kalbos palyginimo nerasta; rastas akademinis lietuviškas tyrimas vertino ankstesnius modelius, todėl lietuvių kalbą būtina tikrinti savo tekstais.
Modeliai ir kainos
Ilgi ir sudėtingi tekstai
Straipsniai, ataskaitos, tekstai, kur svarbus stilius.
- Kaina už 1 mln.
- $4 / $20
- 100 straipsnių
- apie $3,20
- 1 000 pokalbių
- apie $14
- Perskaito vienu kartu
- ~1 880 psl.
- Kaina už 1 mln.
- $2 / $10
- 100 straipsnių
- apie $1,60
- 1 000 pokalbių
- apie $7
- Perskaito vienu kartu
- ~1 970 psl.
- Kaina už 1 mln.
- $0,75 / $3,75
- 100 straipsnių
- apie $0,60
- 1 000 pokalbių
- apie $2,63
- Perskaito vienu kartu
- ~1 970 psl.
Kasdieniai tekstai ir laiškai
Greitai ir pakankamai gerai kasdienai.
- Claude Sonnet 5.5Anthropic
Kasdieniams straipsniams, laiškams ir kruopščiai redaguojamiems juodraščiams.
- Kaina už 1 mln.
- $2 / $10
- 100 straipsnių
- apie $1,60
- 1 000 pokalbių
- apie $7
- Perskaito vienu kartu
- ~1 880 psl.
- Kaina už 1 mln.
- $0,68 / $2,09
- 100 straipsnių
- apie $0,35
- 1 000 pokalbių
- apie $1,86
- Perskaito vienu kartu
- ~1 970 psl.
- Kaina už 1 mln.
- $2 / $6
- 100 straipsnių
- apie $1
- 1 000 pokalbių
- apie $5,40
- Perskaito vienu kartu
- ~940 psl.
Dideli kiekiai
Šimtai aprašymų, vertimų ar atsakymų per dieną.
- Kaina už 1 mln.
- $0,100 / $0,50
- 100 straipsnių
- apie $0,080
- 1 000 pokalbių
- apie $0,35
- Perskaito vienu kartu
- ~1 880 psl.
- Kaina už 1 mln.
- $0,20 / $1,20
- 100 straipsnių
- apie $0,19
- 1 000 pokalbių
- apie $0,78
- Perskaito vienu kartu
- ~1 970 psl.
- Kaina už 1 mln.
- $0,30 / $1,20
- 100 straipsnių
- apie $0,19
- 1 000 pokalbių
- apie $0,93
- Perskaito vienu kartu
- ~1 970 psl.
Kainos – iš OpenRouter katalogo, atnaujinama kas 6 valandas. Straipsnių ir pokalbių kainos – apytiksliai pavyzdžiai.
Ką rodo vieši testai
Čia – tik rezultatai, kuriuos radome viešuose šaltiniuose; prie kiekvieno testo nurodyta, iš kur jie. Jei modelio lentelėje nėra, vadinasi, jo rezultato tame teste neradome.
LMArena Creative Writing
2026-10-08Žmonės aklai lygina modelių sukurtas istorijas, eilėraščius ir kitus kūrybinius tekstus; didesnis įvertis geresnis.
- Claude Opus 5.51517 taškų
- Gemini 3.8 Flash1487 taškai
- Claude Sonnet 5.51463 taškai
- GPT-6.1 Sol1462 taškai
- DeepSeek V4.1 Flash1439 taškų
Artificial Analysis Intelligence Index
2026-10-11Sujungia kelis nepriklausomus žinių, samprotavimo, darbo su dokumentais ir praktinių užduočių testus; rezultatai priklauso nuo pasirinkto pastangų režimo.
- GPT-6.1 Sol52 taškai
- Claude Sonnet 5.552 taškai
- Claude Opus 5.551 taškas
- Grok 4.746 taškai
- Claude Haiku 5.543 taškai
- Gemini 3.8 Flash41 taškas
- DeepSeek V4.1 Flash39 taškai
- Mistral Large 438 taškai
AURORA Multilingual Terminal-Bench
2026-10-09Tikrina, kaip modeliai vykdo sudėtingas užduotis skirtingomis kalbomis; tai nėra vertimo testas, bet parodo daugiakalbio instrukcijų supratimo skirtumus.
- Claude Opus 5.576,4 %
- Gemini 3.8 Flash67,3 %
Stiprybės ir silpnybės
Claude Opus 5.5
Stiprybė. Stipriausias pasirinkimas ilgiems, kūrybiniams ir tikslaus tono tekstams.
Silpnybė. Aukšta kaina sunkiai atsiperka masiniams paprastiems aprašymams.
GPT-6.1 Sol
Stiprybė. Aukštas bendras gebėjimų lygis tinka analizei, santraukoms ir struktūruotiems tekstams.
Silpnybė. Kūrybinio rašymo reitinge atsilieka nuo Opus ir Gemini 3.8 Flash.
Gemini 3.8 Flash
Stiprybė. Stiprus kūrybinis ir daugiakalbis modelis už palyginti nedidelę kainą.
Silpnybė. Bendrame Artificial Analysis indekse nusileidžia brangesniems lyderiams.
Claude Sonnet 5.5
Stiprybė. Aukštas bendras rezultatas ir gera kūrybinio rašymo kokybė kasdieniam darbui.
Silpnybė. Kainuoja daugiau už kelis panašiems masiniams darbams tinkamus konkurentus.
Mistral Large 4
Stiprybė. Nebrangus pasirinkimas santraukoms, laiškams ir aiškiai apibrėžtiems tekstams.
Silpnybė. Viešų rašymo ir mažesnių kalbų rezultatų dar mažai.
Grok 4.7
Stiprybė. Artificial Analysis rezultatas rodo pakankamai aukštą bendrą gebėjimų lygį.
Silpnybė. Trūksta tiesioginių viešų vertimo ir lietuviško rašymo testų.
Claude Haiku 5.5
Stiprybė. Labai maža kaina ir neblogas bendras rezultatas leidžia apdoroti didelius kiekius.
Silpnybė. Nėra pakankamai viešų kūrybinio rašymo ir lietuvių kalbos įrodymų.
GPT-5.6 Luna Pro
Stiprybė. Maža kaina patraukli masiniams laiškams, santraukoms ir juodraščiams.
Silpnybė. Viešų nepriklausomų būtent Luna Pro režimo rašymo rezultatų beveik nėra.
DeepSeek V4.1 Flash
Stiprybė. Nebrangus modelis pasiekia konkurencingą bendrą rezultatą ir turi kūrybinio testo įvertį.
Silpnybė. Kūrybinio rašymo rezultatas žemesnis už stipriausius lyginamus modelius.
Kaip pasirinkti
- Paruoškite savo gerų lietuviškų straipsnių, laiškų, vertimų ir klientų pokalbių pavyzdžių rinkinį.
- Visiems kandidatams duokite tą pačią užduotį, tą pačią informaciją ir vienodus tono reikalavimus.
- Atskirai vertinkite lietuvių kalbos natūralumą, faktų tikslumą, tono laikymąsi ir reikalingo redagavimo kiekį.
- Ilgiems svarbiems tekstams palyginkite Opus, GPT-6.1 Sol ir Gemini; masiniams darbams – Haiku, Luna Pro ir DeepSeek.
- Skaičiuokite ne tik modelio kainą, bet ir darbuotojo laiką, sugaištą taisant netikslumus, vertinius ir netinkamą toną.
Dažni klausimai
Ar geriausias angliškas modelis automatiškai bus geriausias lietuviškai?
Ne. Daugiakalbiai šaltiniai rodo, kad modelių vietos keičiasi pagal kalbą ir užduotį, o atskiro dabartinių modelių lietuviško reitingo nėra.
Kurį modelį rinktis vertimams į lietuvių kalbą?
Pirmiausia verta tikrinti Gemini 3.8 Flash ir Claude Opus 5.5, nes daugiakalbiuose testuose jie atrodo stipriausiai. Galutinį sprendimą priimkite pagal savo srities terminus ir redaktoriaus vertinimą.
Ar pigūs modeliai tinka klientų aptarnavimui?
Tinka paprastiems klausimams ir atsakymams pagal aiškią žinių bazę. Skundams, išimtims ir jautrioms situacijoms reikalinga žmogaus kontrolė arba stipresnis modelis.
Kodėl skirtingi testai pateikia skirtingus lyderius?
Jie matuoja skirtingus dalykus: žmonių skonį, kūrybiškumą, bendrus gebėjimus arba darbą kitomis kalbomis. Todėl vienas bendras balas negali patikimai numatyti visų verslo užduočių.
Šaltiniai
- LMArena Creative Writing leaderboard
- LMArena leaderboard dataset
- LLM Leaderboard – Artificial Analysis
- Introducing AURORA, the Multilingual AI Leaderboard
- Towards Multilingual LLM Evaluation for Baltic and Nordic Languages: A Study on Lithuanian History
- GPT-5.6 Luna Pro model information
- Kainos ir dydžiai: OpenRouter modelių katalogas
Tai viešai skelbiamų testų apžvalga, ne mūsų pačių atlikti bandymai. Testai nematuoja lietuvių kalbos atskirai, todėl prieš renkantis verta išbandyti su savo tekstais ir užduotimis.
Parenkame pagal kainą, greitį ir kokybę lietuvių kalba.