Santrauka
Ataskaitoje vertinama 13 lokaliai paleidžiamų kalbos modelių pagal administracinio darbo užduočių rinkinį. Užduotys apima kalendoriaus valdymą, dokumentų analizę, finansinius ir darbo laiko skaičiavimus, el. laiškų triage ir profesionalių tekstų rengimą. Visi modeliai buvo paleisti per „Ollama“ vienoje DGX Spark sistemoje su 128 GB bendrosios atminties.
Vertinimas jungia deterministinius „Python“ patikrinimus struktūruotiems rezultatams ir lokalų Llama 3.1 70B teisėją atviro tipo rašymo užduotims. Toks skirstymas leidžia palyginti modelius ne tik pagal bendrą rezultatą, bet ir pagal tinkamumą skirtingoms administracinio darbo kategorijoms.
Autoriai
Dmytro Klepachevskyi, Žygimantas Girdauskas, Robert Mackevič, Tadas Šubonis
Kas vertinta tyrime
Benchmarkas sukurtas pagal praktines biuro užduotis, kuriose modelis turi suprasti instrukcijas, naudoti įrankius arba struktūruotus rezultatus ir pateikti patikrinamą darbą. 21 užduoties rinkinys apima tiek rutinines administracines operacijas, tiek atviro tipo rašymo užduotis.
Kiekvienas modelis buvo paleistas tame pačiame agento karkase ir vertintas pagal tuos pačius kriterijus. GPU apkrovos paveikti bandymai buvo pakartoti izoliuotai, kad rezultatai atspindėtų modelių elgseną, o ne resursų paskirstymo artefaktus.
Pagrindinės išvados
Gemma4:31b ir Gemma4:12b pasiekė stipriausius bendrus rezultatus ir statistiškai buvo lygiaverčiai geriausi modeliai šiame benchmarke. 12B modelis daugeliui diegimų yra praktiškesnis pasirinkimas, nes pasiekia beveik tokią pačią kokybę su gerokai mažesniais atminties poreikiais.
Qwen3.6 buvo stipriausias modelis struktūruotam dokumentų darbui. Tai vienintelis modelis rinkinyje, sėkmingai įveikęs PDF-to-calendar užduotį, ir geriausiai pasirodęs tarp ne Gemma modelių automatiškai vertinamose struktūruotose užduotyse.
Modelio dydis nebuvo patikimas rezultatų prognozavimo veiksnys. Kai vykdymo sąlygos buvo sukontroliuotos, keli mažesni modeliai pranoko didesnius. Tai rodo, kad šios klasės administraciniuose procesuose užduoties atitikimas ir išvesties elgsena yra svarbesni už parametrų skaičių.
Kodėl tai svarbu
Administracinio darbo automatizavimui nepakanka sklandžiai generuoti tekstą. Naudingas modelis turi sekti kelių žingsnių instrukcijas, pateikti struktūruotus failus arba įrankių kvietimus ir išlikti patikimas realiomis aparatūros sąlygomis. Šis benchmarkas padeda praktiškai įvertinti tuos skirtumus renkantis modelį.