Alibaba predstavila SkillWeaver: AI okvir koji troši 99% manje tokena i zna kad da ne sluša velike modele
Zamislite AI agenta koji pred sobom ima stotine alata i treba da odluči koji će koristiti za svaki korak složenog zadatka. Ako mu samo prospete ceo katalog pred noge, zbuniće se, pojesti čitav kontekstni prozor i koštati vas malo bogatstvo u tokenima. Alibabini istraživači smislili su rešenje za upravo ovaj problem – i ušteda je gotovo neverovatna.
Njihov okvir nazvan SkillWeaver smanjuje potrošnju tokena za preko 99 odsto u poređenju sa naivnim pristupom gde se agentu servira cela biblioteka alata. Umesto toga, on pravi graf izvršenja za svaki zadatak i za svaki čvor bira samo one alate koji su zaista potrebni.
U čemu je fora sa SAD-om
Srce cele priče je tehnika koju su nazvali Skill-Aware Decomposition ili skraćeno SAD. I da, skraćenica je nesrećna, ali mehanizam je genijalan. Umesto da LLM jednim potezom pogodi koji alat treba da koristi, SAD uvodi povratnu petlju.
Evo kako to izgleda u praksi: model prvo napravi grubu podelu zadatka na korake, zatim sistem pretraži biblioteku alata i nađe one koji liče na ono što treba, pa ih vrati modelu kao "nagoveštaje". Model onda prepravi svoju podelu tako da koristi isti rečnik i nivo detalja koji odgovaraju stvarnim alatima u biblioteci. Znači, ne pogađa iz prve – već iterativno doteruje plan dok ne legne na postojeće alate.
Ovo je ključno jer LLM-ovi često prave previše generične opise koraka, a biblioteka alata koristi specifičan tehnički rečnik. SAD pomiri ta dva sveta.
Tri faze koje sve menjaju
SkillWeaver obrađuje zadatke kroz tri jasno odvojene faze. Prvo ide dekompozicija – LLM razbije složeni upit na niz podzadataka, gde svaki zahteva tačno jedan alat. Recimo, "Skini dataset, transformiši ga i napravi vizuelne izveštaje" postaje tri odvojena koraka.
Druga faza je pretraga – sistem koristi embedding model da za svaki podzadatak izvuče kratku listu najboljih kandidata iz biblioteke. Treća faza je kompozicija – planer procenjuje kandidate ne samo po tome koliko su dobri pojedinačno, već i koliko se dobro uklapaju jedan sa drugim. Proverava da li izlaz iz prvog alata može da posluži kao ulaz za drugi, i na kraju pravi konačni plan u obliku usmerenog acikličnog grafa (DAG) gde nezavisni zadaci mogu da se izvršavaju paralelno.
Šta kažu brojke
Istraživači su napravili sopstveni benchmark – CompSkillBench sa 300 višekoračnih upita različite težine – i biblioteku od 2.209 stvarnih alata iz javnog MCP ekosistema. Rezultati su više nego ubedljivi.
Osnovni model sa 7 milijardi parametara (Qwen2.5-7B) postigao je tačnost dekompozicije od samo 51 odsto bez SAD-a. Kad su uključili povratnu petlju, tačnost je skočila na 67,7 odsto. Sa većim Qwen-Max modelom stigla je do 92 odsto.
Još zanimljiviji nalaz je da veći modeli mogu da budu gori kad ih pustite bez vođstva. Model sa 14 milijardi parametara u osnovnoj postavci imao je nižu tačnost od svog manjeg rođaka jer je preterano razbijao zadatke na mikroskopske, bespotrebne korake. Kad su uključili SAD, nagoveštaji o alatima su ga "prizemljili" i tačnost mu je skočila. Drugim rečima, uskladiti agenta sa rečnikom konkretnih alata često vredi više nego platiti veći i skuplji model.
Ušteda koja se meri u hiljadama dolara
Što se tiče tokena, razlika je dramatična. Naivni pristup gde se svi alati strpaju u prompt velikog modela trošio je procenjenih 884.000 tokena po upitu – i uprkos tome postigao tačnost od samo 21,1 odsto u pronalaženju prave kategorije alata. SkillWeaver je spustio potrošnju na otprilike 1.160 tokena po upitu. To je smanjenje od 99,9 odsto.
Za developere ovo direktno znači drastično niže API troškove i brže vreme odgovora.
Šta developeri mogu da urade već danas
Iako izvorni kod SkillWeaver-a još nije objavljen, istraživači su radili sa standardnim alatima koji se lako reprodukuju. SAD se svodi na pametan prompt endžiniring i povratnu petlju – a šabloni za promptove su već podeljeni u radu. Developeri mogu da ih implementiraju kroz LangChain, LlamaIndex ili čak obične Python skripte.
Za deo sa pretragom korišćen je open-source embedding model all-MiniLM-L6-v2, a istraživači su otkrili da zamena za malo jači enkoder (BGE-base-en-v1.5) odmah diže tačnost bez ikakvog dotreniranja. Vektorizacija biblioteke od 2.209 alata trajala je svega 15 sekundi, a svako pretraživanje indeksa dodaje manje od 15 milisekundi latencije.
Jedno ograničenje o kome treba voditi računa: SkillWeaver trenutno nema oporavak od grešaka. Ako API poziv u drugom koraku pukne, ceo lanac staje. Za produkcijsko okruženje developeri moraju sami da dograde fallback, retry i mehanizme oporavka na vrh faze kompozicije.
