Alibaba predstavila SkillWeaver: AI okvir koji troši 99% manje tokena i zna kad da ne sluša velike modele


Alibaba predstavila SkillWeaver: AI okvir koji troši 99% manje tokena i zna kad da ne sluša velike modele

 

Alibaba predstavila SkillWeaver: AI okvir koji troši 99% manje tokena i zna kad da ne sluša velike modele

Zamislite AI agenta koji pred sobom ima stotine alata i treba da odluči koji će koristiti za svaki korak složenog zadatka. Ako mu samo prospete ceo katalog pred noge, zbuniće se, pojesti čitav kontekstni prozor i koštati vas malo bogatstvo u tokenima. Alibabini istraživači smislili su rešenje za upravo ovaj problem – i ušteda je gotovo neverovatna.

Njihov okvir nazvan SkillWeaver smanjuje potrošnju tokena za preko 99 odsto u poređenju sa naivnim pristupom gde se agentu servira cela biblioteka alata. Umesto toga, on pravi graf izvršenja za svaki zadatak i za svaki čvor bira samo one alate koji su zaista potrebni.

U čemu je fora sa SAD-om

Srce cele priče je tehnika koju su nazvali Skill-Aware Decomposition ili skraćeno SAD. I da, skraćenica je nesrećna, ali mehanizam je genijalan. Umesto da LLM jednim potezom pogodi koji alat treba da koristi, SAD uvodi povratnu petlju.

Evo kako to izgleda u praksi: model prvo napravi grubu podelu zadatka na korake, zatim sistem pretraži biblioteku alata i nađe one koji liče na ono što treba, pa ih vrati modelu kao "nagoveštaje". Model onda prepravi svoju podelu tako da koristi isti rečnik i nivo detalja koji odgovaraju stvarnim alatima u biblioteci. Znači, ne pogađa iz prve – već iterativno doteruje plan dok ne legne na postojeće alate.

Ovo je ključno jer LLM-ovi često prave previše generične opise koraka, a biblioteka alata koristi specifičan tehnički rečnik. SAD pomiri ta dva sveta.

Tri faze koje sve menjaju

SkillWeaver obrađuje zadatke kroz tri jasno odvojene faze. Prvo ide dekompozicija – LLM razbije složeni upit na niz podzadataka, gde svaki zahteva tačno jedan alat. Recimo, "Skini dataset, transformiši ga i napravi vizuelne izveštaje" postaje tri odvojena koraka.

Druga faza je pretraga – sistem koristi embedding model da za svaki podzadatak izvuče kratku listu najboljih kandidata iz biblioteke. Treća faza je kompozicija – planer procenjuje kandidate ne samo po tome koliko su dobri pojedinačno, već i koliko se dobro uklapaju jedan sa drugim. Proverava da li izlaz iz prvog alata može da posluži kao ulaz za drugi, i na kraju pravi konačni plan u obliku usmerenog acikličnog grafa (DAG) gde nezavisni zadaci mogu da se izvršavaju paralelno.

Šta kažu brojke

Istraživači su napravili sopstveni benchmark – CompSkillBench sa 300 višekoračnih upita različite težine – i biblioteku od 2.209 stvarnih alata iz javnog MCP ekosistema. Rezultati su više nego ubedljivi.

Osnovni model sa 7 milijardi parametara (Qwen2.5-7B) postigao je tačnost dekompozicije od samo 51 odsto bez SAD-a. Kad su uključili povratnu petlju, tačnost je skočila na 67,7 odsto. Sa većim Qwen-Max modelom stigla je do 92 odsto.

Još zanimljiviji nalaz je da veći modeli mogu da budu gori kad ih pustite bez vođstva. Model sa 14 milijardi parametara u osnovnoj postavci imao je nižu tačnost od svog manjeg rođaka jer je preterano razbijao zadatke na mikroskopske, bespotrebne korake. Kad su uključili SAD, nagoveštaji o alatima su ga "prizemljili" i tačnost mu je skočila. Drugim rečima, uskladiti agenta sa rečnikom konkretnih alata često vredi više nego platiti veći i skuplji model.

Ušteda koja se meri u hiljadama dolara

Što se tiče tokena, razlika je dramatična. Naivni pristup gde se svi alati strpaju u prompt velikog modela trošio je procenjenih 884.000 tokena po upitu – i uprkos tome postigao tačnost od samo 21,1 odsto u pronalaženju prave kategorije alata. SkillWeaver je spustio potrošnju na otprilike 1.160 tokena po upitu. To je smanjenje od 99,9 odsto.

Za developere ovo direktno znači drastično niže API troškove i brže vreme odgovora.

Šta developeri mogu da urade već danas

Iako izvorni kod SkillWeaver-a još nije objavljen, istraživači su radili sa standardnim alatima koji se lako reprodukuju. SAD se svodi na pametan prompt endžiniring i povratnu petlju – a šabloni za promptove su već podeljeni u radu. Developeri mogu da ih implementiraju kroz LangChain, LlamaIndex ili čak obične Python skripte.

Za deo sa pretragom korišćen je open-source embedding model all-MiniLM-L6-v2, a istraživači su otkrili da zamena za malo jači enkoder (BGE-base-en-v1.5) odmah diže tačnost bez ikakvog dotreniranja. Vektorizacija biblioteke od 2.209 alata trajala je svega 15 sekundi, a svako pretraživanje indeksa dodaje manje od 15 milisekundi latencije.

Jedno ograničenje o kome treba voditi računa: SkillWeaver trenutno nema oporavak od grešaka. Ako API poziv u drugom koraku pukne, ceo lanac staje. Za produkcijsko okruženje developeri moraju sami da dograde fallback, retry i mehanizme oporavka na vrh faze kompozicije.

Podeli: