AAI Labs
Pradinis
Paslaugos
ProjektaiTyrimaiDI inžinieriai
Įmonė
Daugiau
Susisiekti
Loading…

Paslaugos

  • DI energetikai
  • DI savivaldybėms
  • DI transportui
  • Generatyvinis DI
  • LLM verslui
Visos paslaugos →

Įmonė

  • Apie mus
  • Karjera
  • Projektai
  • Privatumo politika
  • MTEP
  • Kontaktai

Daugiau

  • ES DI aktas
  • DI žodynas
  • Tyrimai
  • Tinklaraštis
  • Naujienos

Produktai

  • AI Team for Hire
  • Merkys.AI
  • Cargobroker.AI
  • Klikt

UAB Taikomasis dirbtinis intelektas © 2026

[email protected]LinkedIn →
Tinklaraštis

Kuriuo atvirojo kodo LLM pigiausia pasitikėti kuriant DI agentus?

2026 m. spalio 2 d.
5 min. skaitymo

2026 m. liepą Berkeley Function Calling Leaderboard (BFCL), viena dažniausiai cituojamų DI įrankių vertinimo platformų, stipriausiu open-weight modeliu įrankių naudojimui atlikti įvardijo Qwen3 235B, kurio tikslumas siekė apie 88,5%. Ši informacija – naudingas atspirties taškas. Tačiau šis vertinimas kiekvieną panaudotą įrankį vertina atskirai ir nieko nesako apie tai, kiek kainuoja modelio naudojimas, ar jis išlieka nuoseklus per ilgą užduotį ir kokios įrangos jam reikia.

Šios spragos svarbiausios, kai DI agentus kuriate su open-weight modeliais, kuriuos galite talpinti savo infrastruktūroje. Agentų klaidos retai susijusios su prastai parašytu tekstu. Dažniausiai jie panaudoja ne tą įrankį, išsigalvoja parametrą arba supainioja kontekstą penkiolikos žingsnių užduoties viduryje. Kiekviena klaida reiškia pakartotinį bandymą arba žmogaus įsikišimą, o abu klaidų taisymo metodai kainuoja ir laiką, ir pinigus.

Modelį patikimu daro skirtumas tarp to, ar jis teisus vieną kartą, ar kiekvieną kartą. Originaliame τ-bench tyrime GPT-4o iš pirmo bandymo atliko apie 61% mažmeninės prekybos klientų aptarnavimo užduočių. Kai tą pačią užduotį reikėjo sėkmingai atlikti visus aštuonis kartus, rezultatas nukrito žemiau 25%.

Todėl per mūsų liepos mini projektus viena komanda uždavė praktinį klausimą: kuriuo atvirųjų svorių modeliu pigiausia pasitikėti įmonei, kuri naudoja savo agentus?

Kodėl kaina už tokeną yra netinkamas įvertis

Pagrindinis komandos rodiklis yra kaina už sėkmingą užduotį: kiek kainuoja vienos užduoties tokenai, padalyta iš to, kaip dažnai modelis užduotį atlieka. Suklydęs modelis turi bandyti dar kartą, todėl tikroji vienos atliktos užduoties kaina yra didesnė, nei rodo kainoraštis. Jei vienas bandymas kainuoja 0,03 USD, o modelis sėkmingas 60% atvejų, kiekviena sėkminga užduotis iš tikrųjų kainuoja 0,05 USD.

Kad modelius būtų galima palyginti, kiekviena kaina skaičiuojama tai pačiai standartinei agento užduočiai: apie 15 panaudotų įrankių, maždaug 60 000 įvesties ir 6 000 išvesties tokenų.

Perėjimas nuo tokenų skaičiavimo prie kainos už rezultatą parodo, kiek iš tikrųjų kainuoja atlikta užduotis.

Kaip buvo atrinkti 13 modelių

Komanda pradėjo nuo compar:IA, viešos Prancūzijos vyriausybės DI palyginimo paslaugos, kurios 2026 m. birželio atnaujinime buvo įvardinti 113 modelių. Šį sąrašą komanda naudojo tik kaip katalogą, ne kaip reitingą, ir pritaikė keturis filtrus:

  • Tik open-weight modeliai, kad modelį būtų galima talpinti savo infrastruktūroje.
  • Viena dabartinė pagrindinė versija iš kiekvienos modelių šeimos, o ne kiekvienas tarpinis leidimas.
  • Integruotas įrankių naudojimo palaikymas.
  • Bent keli paskelbti agentų vertinimų rezultatai.

Liko 13 modelių. Kiekvienas buvo įvertintas pagal viešus šaltinius: įrankių iškvietimo tikslumas pagal Berkeley Function Calling Leaderboard (BFCL); patikimumas pagal BFCL kelių žingsnių testus, testą, ar modelis žino, kada įrankio nenaudoti, ir τ²-bench; kainos pagal tiekėjų kainoraščius. Prie kiekvieno skaičiaus nurodytas šaltinis ir duomenų gavimo data.

Praktinė pastaba: kai kurie iš šių modelių išleisti su „pusiau atviromis” licencijomis, kurių komercinės sąlygos skiriasi. Licenciją patikrinkite prieš diegdami.

Kiek iš tikrųjų kainuoja agento užduotis (2026 m. liepos duomenys)

Tai pačiai standartinei užduočiai pigiausias modelis kainuoja 0,008 USD, o brangiausias 0,127 USD, t. y. 16 kartų daugiau. Štai aštuoni modeliai su išsamiais kainų duomenimis, surikiuoti pagal kainą už sėkmingą užduotį:

#ModelisKaina už sėkmingą užduotįPatikimumasReikalinga įranga
1Qwen3 32B0,008 USD81,2 %Vienas GPU (80 GB)
2MiniMax M30,028 USD88,9 %Kelių mazgų klasteris
3DeepSeek V4 Pro0,039 USD80,7 %Kelių mazgų klasteris
4GLM-4.5-Air0,040 USD46,5 %Vienas GPU (80 GB)
5Qwen3 235B0,046 USD83,9 %Vienas serveris (8×80 GB)
6GLM-5 / 5.10,053 USD89,7 %Kelių mazgų klasteris
7Kimi K2 / K2.60,057 USD80,9 %Kelių mazgų klasteris
8Mistral Large 30,127 USD30,7 %Vienas serveris (8×80 GB)

Išsiskiria trys dalykai.

Pigiausias modelis kartu yra ir geriausias pagal vertę. Qwen3 32B yra mažas modelis, veikiantis viename 80 GB GPU. Viena užduotis kainuoja mažiau nei centą, o patikimumas siekia 81,2%.

Aukštas patikimumas nebūtinai brangus. MiniMax M3 pasiekia 88,9% patikimumą, artimą sąrašo viršūnei, už 0,028 USD už užduotį.

Brangiausias modelis yra mažiausiai patikimas. Mistral Large 3 kainuoja 0,127 USD už užduotį, o jo patikimumas siekia vos 30,7%, mažiausiai iš aštuonių.

Vienas teisingas iškvietimas dar nereiškia patikimumo

Įrankių panaudojimo tikslumas parodo, ar modelis pasirenka tinkamą funkciją ir teisingai užpildo argumentus. Patikimumas parodo, ar jis tai daro per visą kelių žingsnių užduotį, žino, kada įrankio nepanaudoti, ir nuosekliai sėkmingai atlieka užduotį ją kartojant.

GLM-4.5-Air įrankių panaudojimo tikslumas siekia 76,7%, bet patikimumas – tik 46,5%. GLM-5 yra priešingas atvejis: įrankių iškvietimo tikslumas 62,1%, bet tai patikimiausias palyginimo modelis, 89,7%.

Rinkdamiesi tik pagal įrankių panaudojimo rezultatus galite pasirinkti GLM-4.5-Air ir pamatyti, kaip agentas sugenda užduoties viduryje. Rinkdamiesi tik pagal patikimumą galite praleisti modelį, kuris gerai atlieka trumpas, vieno žingsnio užduotis. Todėl palyginime vertinami abu rodikliai.

GLM-4.5-Air ir GLM-5 palyginimas: aukštesnis įrankių iškvietimo tikslumas nereiškia didesnio patikimumo

Nė vienas modelis nelaimi visko

KategorijaNugalėtojasRezultatas
Pigiausias už užduotį ir geriausias pagal vertęQwen3 32B0,008 USD už užduotį
PatikimiausiasGLM-5 / 5.189,7 %
Geriausias įrankių iškvietimasQwen3 235B88,5 %
GreičiausiasLlama Nemotron 70B277 tokenai per sekundę

Greičiausias modelis nėra pigiausias, o tiksliausias nėra patikimiausias. Prieš žiūrėdami į reitingą, nuspręskite, kuris rodiklis jūsų agentui svarbiausias.

Pradėkite nuo turimos įrangos

Daugumai įmonių pirmasis klausimas yra ne tai, kuris modelis geriausias, o tai, kurį iš jų jos iš tikrųjų gali naudoti.

  • Vienas GPU (80 GB): aiškus pasirinkimas yra Qwen3 32B. GLM-4.5-Air veikia ta pačia įranga, bet viena užduotis kainuoja penkis kartus daugiau, o patikimumas gerokai mažesnis.
  • Vienas serveris (8 × 80 GB GPU): Qwen3 235B kainuoja 0,046 USD už užduotį, pasiekia 83,9% patikimumą ir turi geriausią įrankių iškvietimo rezultatą palyginime. Mistral Large 3 reikia panašios įrangos, jis kainuoja beveik tris kartus daugiau ir yra gerokai mažiau patikimas.
  • Kelių GPU klasteris arba API: MiniMax M3 yra pigiausias labai patikimas variantas. Jei patikimumas svarbesnis už kainą, patikimiausias modelis yra GLM-5, kuris kainuoja maždaug dvigubai daugiau.
Open-weight modelių palyginimas pagal įrankių iškvietimą, patikimumą, greitį, užduoties kainą ir reikalingą įrangą

Ilgesnės užduotys keičia pasirinkimus. Kaina auga su kiekvienu tokenu, o kiekvienas papildomas žingsnis yra dar viena galimybė nepatikimam modeliui suklysti. Ilgai veikiantiems agentams patikimumas turėtų būti svarbesnis už kainą.

Ką šie skaičiai gali ir ko negali pasakyti

  • Rezultatai paimti iš viešų vertinimų ir tiekėjų kainoraščių, o ne iš mūsų pačių bandymų. Komandos indėlis yra išsibarsčiusių šaltinių sudėjimas į vieną vietą, papildant juos kaina ir įranga.
  • Viešų vertinimų rezultatai yra geriausias atvejis. Modeliai vis dažniau derinami prie gerai žinomų testų, todėl su savo užduotimis tikėkitės prastesnių rezultatų.
  • Ne kiekvieną modelį apima kiekvienas vertinimas. Kai kurie patikimumo rezultatai remiasi vienu šaltiniu, kiti trimis.
  • Modeliai ir kainos keičiasi kas mėnesį. Šie duomenys atspindi 2026 m. liepos 10 d. būseną.

Kaip pasirinkti modelį savo agentui

  • Įvertinkite užduoties dydį. Apytiksliai suskaičiuokite, kiek įrankių ir tokenų reikia vienai užduočiai.
  • Lyginkite kainą už sėkmingą užduotį, o ne kainą už tokeną.
  • Atsirinkite tai, ką galite naudoti: turimą įrangą ir jums priimtinas licencijos sąlygas.
  • Prieš apsispręsdami, išbandykite atrinktus modelius su savo užduotimis. Vieši rezultatai susiaurina pasirinkimą, o galutinį sprendimą lemia jūsų darbo procesai.

Modelis, kuris pigus už tokeną, bet dažnai klysta, nėra pigus agentas. Šiame palyginime pigiausias modelis, kuriuo galima pasitikėti, buvo mažas, viename GPU veikiantis modelis, o ne vienas didžiųjų pažangiausių modelių. Vieši vertinimai padeda sudaryti trumpąjį sąrašą, bet galutinis pasirinkimas turėtų priklausyti nuo bandymų su jūsų pačių užduotimis.

ŠIAME PUSLAPYJE

  • Kuriuo atvirojo kodo LLM pigiausia pasitikėti kuriant DI agentus?
  • Kodėl kaina už tokeną yra netinkamas įvertis
  • Kaip buvo atrinkti 13 modelių
  • Kiek iš tikrųjų kainuoja agento užduotis (2026 m. liepos duomenys)
  • Vienas teisingas iškvietimas dar nereiškia patikimumo
  • Nė vienas modelis nelaimi visko
  • Pradėkite nuo turimos įrangos
  • Ką šie skaičiai gali ir ko negali pasakyti
  • Kaip pasirinkti modelį savo agentui

Susiję straipsniai

Aštuonios valandos per mėnesį iki MVP: kaip DI mini projektai suburia mūsų komandas

2026-10-02

DI agentai versle: kaip keisis darbas su programomis

2026-09-28

Priminimai mažina neatvykimų skaičių. Kodėl tada eilės netrumpėja?

2026-09-28