Santrauka
Šiame tyrime lyginami pažangūs modeliai agentiniuose gamybiniuose procesuose. Vertinama ne tik tai, kuris modelis gerai samprotauja, bet ir tai, kuris modelis patikimai naudoja įrankius, išlaiko ilgalaikes užduotis ir leidžia efektyviai kurti praktinius sprendimus.
Vertinimas parengtas kaip praktinis pasirinkimo gidas. Jis susieja modelių elgseną su konkrečiais diegimo scenarijais ir atskiria bendrą samprotavimo kokybę nuo tinkamumo agentų architektūroms.
Autoriai
TippyBot Research, AAI Labs
Kas vertinta tyrime
Darbe nagrinėjamas samprotavimo gylis, patikimumas ilgesnėse užduotyse, tikslumas dirbant su įrankiais ir praktinis inžinerinis našumas. Kaina vertinama kaip esminis apribojimas, nes gamybiniuose sprendimuose modelio pasirinkimą lemia ir kokybė, ir eksploatavimo kaštai.
Pagrindinės išvados
Pagrindinė išvada yra ta, kad geriausias modelis agentinei sistemai ne visada yra tas, kuris turi stipriausią bendrą reputaciją. Skirtingi modeliai geriau tinka skirtingiems darbams: vieni stipresni sudėtingam samprotavimui, kiti – įrankių naudojimui, greitam vykdymui arba ekonomiškam masteliavimui.
Todėl tyrimas modelių vertinimą pateikia kaip diegimo sprendimą: tinkamiausias modelis yra tas, kurio klaidų pobūdis, kaina ir delsa atitinka konkretaus agentinio darbo poreikius.
Kodėl tai svarbu
Agentinės sistemos atskleidžia trūkumus, kurių dažnai nematyti paprastuose pokalbių benchmarkuose. Modelis turi išlaikyti nuoseklumą per daug žingsnių, tinkamu metu kviesti įrankius ir susitvarkyti su tarpiniu neapibrėžtumu. Šis darbas padeda rinktis modelius pagal tokias sąlygas, o ne vien pagal bendrus reitingus.