EPISODE · Aug 22, 2026 · 1H 12M
Bannato da GLM: hybrid routing con LiteLLM
from Risorse Artificiali. Appunti e spunti dal mondo dell’Intelligenza Artificiale · host RisorseArtificiali
Bannato da GLM per aver messo LiteLLM davanti a Claude Code. Paolo racconta tutto: il pool di modelli, il middleware locale, il classifier dell'automode spostato su Gemma per non bruciare la quota del modello principale. Poi il fallback verso il cloud rigira le chiamate già modificate, GLM le legge come traffico di un harness non supportato, e parte il ban. Con mail di supplica annessa.Prima di quella storia, Stripe che compra OpenRouter per 7 miliardi di dollari. La lettura di Paolo è che il routing sia una posizione da API Gateway: chi smista il traffico degli agenti può vendere servizi premium sul volume, esattamente come Stripe ha fatto con i pagamenti. Da lì i protocolli di pagamento tra agenti, AP2 sopra A2A, e lo scenario in cui a produrre reddito sono gli agenti stessi.Poi i modelli. Qwen 3.8 27B denso è la prima volta che un modello locale su 16-24 giga di VRAM regge un coding agent vero e non solo il completamento: onniscienza peggiore del 3.6, capacità agentiche molto migliori, e il consiglio di tenerlo su low o medium thinking effort. GLM 5.3 guadagna 6-7 punti di intelligenza generale su Artificial Analysis, l'inferenza di Z.ai è diventata veloce, e resta il dubbio su cosa faccia girare davvero Ollama quando le risposte non combaciano.Nella seconda parte: perché parlare ai modelli in italiano non spreca i token che pensi, il trick di chiedere l'output in inglese B2 o C1, le skill Wait What e handoff, il report di Hugging Face sullo stato dei modelli open (attention e adoption non sono la stessa cosa, solo l'1% sta sopra i 70 billion), Light Learner, il jailbreak del taccuino, e le quattro skill dell'AI engineer secondo Andrew Ng.CAPITOLI00:00 Stripe compra OpenRouter per 7 miliardi02:59 A2A, AP2 e il routing dei pagamenti08:18 LiteLLM: i modelli locali in un pool13:20 Bannato da GLM: il classifier locale16:22 Sandbox invece di validatori, e i cyborg19:55 Qwen 3.8 27B: coding su 16 giga26:01 GLM 5.3 e il dubbio su Ollama32:20 Parlare ai modelli in italiano: latent space39:23 Wait What, Grill with Docs e handoff46:15 Report Hugging Face sui modelli open50:54 Attention non è adoption: download contro like56:26 Kimi K3, licenze e modelli sopra 70B1:02:00 Light Learner e il jailbreak del taccuino1:06:30 Andrew Ng: le 4 skill dell'AI engineerAscolta su Spotify: https://open.spotify.com/episode/45PF4g7gH6tHATi1SCm0u2?utm_source=youtube&utm_medium=description&utm_campaign=ep68_dropTutti gli episodi e le trascrizioni: https://risorseartificiali.com/?utm_source=youtube&utm_medium=description&utm_campaign=ep68_dropLinkedIn: https://www.linkedin.com/company/risorseartificialiSe la puntata ti è servita iscriviti al canale. E se avete voglia di precisare la spiegazione sul latent space, i commenti sono lì apposta.Risorse Artificiali, AI Engineering in italiano. Puntata #68
Embed this episode
Ready to play
Bannato da GLM: hybrid routing con LiteLLM
No transcript for this episode yet
Similar Episodes
No similar episodes found.
Similar Podcasts
No similar podcasts found.