AAI Labs
Pradinis
Paslaugos
ProjektaiTyrimaiDI inžinieriai
Įmonė
Daugiau
Susisiekti
Loading…

Paslaugos

  • DI energetikai
  • DI savivaldybėms
  • DI transportui
  • Generatyvinis DI
  • LLM verslui
Visos paslaugos →

Įmonė

  • Apie mus
  • Karjera
  • Projektai
  • Privatumo politika
  • MTEP
  • Kontaktai

Daugiau

  • ES DI aktas
  • DI žodynas
  • Tyrimai
  • Tinklaraštis
  • Naujienos

Produktai

  • AI Team for Hire
  • Merkys.AI
  • Cargobroker.AI
  • Klikt

UAB Taikomasis dirbtinis intelektas © 2026

[email protected]LinkedIn →
Tyrimas2026

Local LLM Benchmark: Administrative Tasks

A DGX Spark evaluation of 13 locally run language models across a 21-task administrative work suite, covering calendaring, document parsing, financial and time-tracking calculations, email triage, and professional writing.

Skaityti tyrimą

Santrauka

Ataskaitoje vertinama 13 lokaliai paleidžiamų kalbos modelių pagal administracinio darbo užduočių rinkinį. Užduotys apima kalendoriaus valdymą, dokumentų analizę, finansinius ir darbo laiko skaičiavimus, el. laiškų triage ir profesionalių tekstų rengimą. Visi modeliai buvo paleisti per „Ollama“ vienoje DGX Spark sistemoje su 128 GB bendrosios atminties.

Vertinimas jungia deterministinius „Python“ patikrinimus struktūruotiems rezultatams ir lokalų Llama 3.1 70B teisėją atviro tipo rašymo užduotims. Toks skirstymas leidžia palyginti modelius ne tik pagal bendrą rezultatą, bet ir pagal tinkamumą skirtingoms administracinio darbo kategorijoms.

Autoriai

Dmytro Klepachevskyi, Žygimantas Girdauskas, Robert Mackevič, Tadas Šubonis

Kas vertinta tyrime

Benchmarkas sukurtas pagal praktines biuro užduotis, kuriose modelis turi suprasti instrukcijas, naudoti įrankius arba struktūruotus rezultatus ir pateikti patikrinamą darbą. 21 užduoties rinkinys apima tiek rutinines administracines operacijas, tiek atviro tipo rašymo užduotis.

Kiekvienas modelis buvo paleistas tame pačiame agento karkase ir vertintas pagal tuos pačius kriterijus. GPU apkrovos paveikti bandymai buvo pakartoti izoliuotai, kad rezultatai atspindėtų modelių elgseną, o ne resursų paskirstymo artefaktus.

Pagrindinės išvados

Gemma4:31b ir Gemma4:12b pasiekė stipriausius bendrus rezultatus ir statistiškai buvo lygiaverčiai geriausi modeliai šiame benchmarke. 12B modelis daugeliui diegimų yra praktiškesnis pasirinkimas, nes pasiekia beveik tokią pačią kokybę su gerokai mažesniais atminties poreikiais.

Qwen3.6 buvo stipriausias modelis struktūruotam dokumentų darbui. Tai vienintelis modelis rinkinyje, sėkmingai įveikęs PDF-to-calendar užduotį, ir geriausiai pasirodęs tarp ne Gemma modelių automatiškai vertinamose struktūruotose užduotyse.

Modelio dydis nebuvo patikimas rezultatų prognozavimo veiksnys. Kai vykdymo sąlygos buvo sukontroliuotos, keli mažesni modeliai pranoko didesnius. Tai rodo, kad šios klasės administraciniuose procesuose užduoties atitikimas ir išvesties elgsena yra svarbesni už parametrų skaičių.

Kodėl tai svarbu

Administracinio darbo automatizavimui nepakanka sklandžiai generuoti tekstą. Naudingas modelis turi sekti kelių žingsnių instrukcijas, pateikti struktūruotus failus arba įrankių kvietimus ir išlikti patikimas realiomis aparatūros sąlygomis. Šis benchmarkas padeda praktiškai įvertinti tuos skirtumus renkantis modelį.