Go back

Pointer[290]: Dentro DeepSeek V4

48m 24s

Pointer[290]: Dentro DeepSeek V4

La puntata 200 del podcast affronta tre temi principali. Il primo è un aggiornamento su Midos: dopo i test dell’AI Security Institute, GPT-5.5 ha mostrato capacità simili a Midos in attacchi informatici complessi, facendo sorgere dubbi sul motivo del mancato rilascio di Midos, forse legato a strategie di marketing o alla scarsità di GPU. Il secondo tema riguarda il calo dell’8% delle iscrizioni ai corsi triennali di Computer Science negli Stati Uniti, il primo in 15 anni. Ciò è attribuito ai licenziamenti nelle Big Tech e alla sostituzione dei junior developer con strumenti di AI, spingendo gli studenti verso lauree ibride o corsi verticali sull’intelligenza artificiale. Nonostante un tasso di disoccupazione più alto tra i laureati in informatica, i salari rimangono elevati. Infine, si parla di DeepSeek V4, un modello con architettura Mixture of Experts e Multi-Token Prediction, disponibile in versione Pro e Flash, che promette innovazioni nell’efficienza computazionale. La discussione sottolinea l’impatto dell’AI sul mercato del lavoro e la necessità di adattare i percorsi formativi.

Transcription

6489 Words, 38506 Characters

Italian
[Musica] Ciao questa è la puntata 200, 90 del pointer potcas, se oggi mancano esattamente 10 e a quella in cui uno tra le sandre uggie farla stessa cosa che ho fatto io con dersta, la puntata 200, cioè non è come, questa era un'esperta, ma sia, oio, come va? Bene, bene, tutto, secondo più o meno quello che si drabbe, ma verrà, tutto si muove dai, diciamo così. Ok, e allora prima di cominciare con il soglio, guardiamo i nostri contatti, potete trovare sui vari social, su link, su Instagram, siamo anche nella puntata 200, la puntata 200 è la nostra chat su telegram, e lì c'è molta discussione, riguardo ai agent, coding agent, quindi se si è l'interessare a questo mondo, la puntata 200 è il posto dove volete, volete essere probabilmente, non è saggeratamente spammosa, quindi vi consiglio entrare, trovate il link nelle note della puntata, l'altra cosa che vi dico prima di cominciare, come insolio è che se volete supportarci trovate nelle note della puntata anche lì in carano strappagli una supportaci, che per il BSR va la memoria con te potete ascoltare i suoi supportaci, vi sono vari modi, potete comprare qualcosa da Amazon partendo allo nostro link socializzato e ci arriverà una piccolissima percentuale, se anche noi mettiamo il link a qualcosa, poi comprare altro, comunque ci fate lo stesso felici, perché una piccoli percentuale ha ancora vi upicolo del normale, però arriva comunque, e l'altra cosa che potete fare per farci conoscere è, sicuramente, lasciare delle recensioni su Apple Podcast o Spotify, che è un qualcosa che non succede molto spesso, quindi se ci volete fare felici, lasciare decennatrice in recensioni. Prima di iniziare la puntata di andare a vedere un po' del dettaglio, due argomenti, due macroargomenti, un piccolo follow up, perché, perché nelle scorsi settimane, abbiamo parlato molto di Midos, e in particolare abbiamo citato un fatto, che era quello del le ai security institute, che aveva preso Midos, aveva la mia messo alla prova, con alcuni task di sicurazione informativa, aveva fatto partecipare a del CTF, quindi le capture de flag, quindi questi, diciamo, gare di programmazioni, qualche modo in cui però si deve andare, magari a trovare una uline rabilità all'interno non software. In queste capture de flag, ho assfruttare una moderabilità, forse non so, non so, non so, molto spesso, però comunque, in queste capture de flag, MidGPT 5.5, che era un modello in questo momento che stavano, è riuscito comunque ad arrivare a una qualità media, rispetto a Midos superiore, che quindi questa è una cosa che già, non ci vanno un po' ante il sale o rechie, e la seconda cosa che è ancora più interessante, se ti ricordi in saccia ai puntiata, abbiamo detto che un test che vanno fatto era quello di vedere, come Midos riusci, se Midos fosse riuscito o meno, a completare un attacco che prevedeva diversi step, 302 step, nessun modello, prima di Midos, era riuscito a completare questo tipo di attacco e a mettere in ziano i vari pezzi, Midos c'era riuscito 3 volte su 10 e avano calcolato delle metri che, ora, GPT 5.5 è riuscito 2 volte su 10 a pinerlo stesso, lo stesso attacco, quindi è il secondo modello a riuscirci dopo Midos, e in realtà anche in media GPT 5.5 è più o meno lì, siamo lì come risultati. Il che ci lascia delle domande, la prima su tutti è, ma allora Midos, perché non è stato rilasciato, era davvero così tanto, bevigoso, se GPT 5.5 in realtà riesce a ottenere risultati simili o anche migliori in questi casi, oppure era molto una questione di marketing e si volia un ponna sconda, per il fatto che probabilmente, antrofica un po', qualche difficoltà in più rispetto a altri, comparedi da magari di avere a disposizione della derbar, quindi del altro GPU, e quindi magari invece di lasciare il modello per tutti si ascielta una strada del non possiamo rilasciarlo, perché troppo pericoloso. Il dubbio non sono rimane, ora vediamo magari come volverano dei prossimi settimani anche antrofica, con alti modelli o, magari ti lascio proprio di mitos, però, secondo me, un appunto follow-up da menzionare, vi spiegaranno parlato di mitos, aviamo parlato di questi bench, perché sono, ritrovo abbastanza interessanti, come bench, perché, forse, dimostrano più le capacità del modello, rispetto al bench, un archestandard, in cui vediamo quant'è bravo il modello a ragionario, quant'è il bravo il modello a scrivere codici. Sì, no, sono gli interessanti, fati questa storia del rilasciare al pubblico, potrebbe effettamente una strategia per evitare che, di sovraccare all'ultrurmente le GPU che è una descrizione curioso, curioso, non ci ha rifetto su questo aspetto. E anche in realtà, a fare molto ai, per il senso che, se non so se è cavilato, ma nel corso delle ultime settimane, dopo che mito si è rassadori lasciato, e mi sono ritrovato molte persone che magari, magari usano o sati GPT, però non è che ci ha avessero in sacquanta conoscenza di tutto il mondo, di E-A-L-R-M, che magari mi diceva "nah, ma questo mito, se perché comunque è finito un po' anche sulla giornale che magari legge la persona che non è, non so, Tecrance, cioè magari anche sull'ansa è finito, immagino. Quindi, tanta gente ha parato di mitos e tanta gente ha parato del fatto che non viene rilasciato perché è troppo pericoloso. Quindi probabilmente, è stata anche una strategia di marketing abbastanza funzionante, che poi diciamo per ora, almeno, non sta funzionando perché tutti parlano di antropi, come la dianna che ha si luttato, mito, si, il modello, che non può essere rilasciato perché è troppo pericoloso. Sì, sì, sì, sì, no, certo. Sanno, chiamamente, combattendo per manipolare una percezione sui loro prodotti. Sì, sì, sì. E il lancio, allora, il primo vario che ho argomento della puntata, che in qualche modo, non è proprio, per una volta, appunto, non è legato alle AI, direttamente, nel senziono in parla di AI, ma in realtà, in qualche modo, lateralmente, comunque, le AI ha che fare anche con questo argomento. Sì, sì, allora, mi ha capitato questa serie di linca all'interno di un menu list. Ora vi dico subito il tema ovvero che c'è stata una flessione dell'un'impressione del sul numero percentuale di iscrizioni del -8% per la prima volta in 15 anni, diciamo, è la triennale di informatica nei istationiti, cioè, per la prima volta, in 15 anni, ci sono state meno persone che hanno voluto iscriversi, rispettaranno precedente al corso di computer science. E' quasi dato, è un 8% per cento, adesso, in condalcone fonti, e il -6% secondo altre, a seconda insomma di come sono stati calcolati, i valori sono dati sicuramente molto forti, e all'interno di questi articoli che poi vi lasciamo in una puntata, i ragionamenti che vi hanno fatto che principalmente, dato che gli americani, comunque, i US, diciamo, mandare il figlio, la figlia, l'università, a un costo molto significativo, tipicamente, si cerca di indirizzare il figlio, la figlia, verso quelle professioni, che garantiscono un lavoro dopo aver, ottenuto il titolo, e soprattutto, ansiesperabilmente, questo lavoro si anche ben pagato. E all'interno di questo, diciamo, di questa mischela, chiaramente, nei gli ultimi anni, computer science, è sicuramente stata la scelta che svettava. In questa direzione, però, però, in questo momento, invece, si sta già percevendo, che questa cosa, potrebbe avere, essere stata incrinata, da un po' il riflesso di quello che stanno facendo le Big Tech, dal punto di vista delle off, cioè, in America, stanno servando queste grandi Big Tech, che prima, a suonimono tante persone, le pagavono bene, a fare, diciamo, ogni sei mesi delle off, delle off importanti, quindi, dell'inendora, una stabilità, e poi anche, rimergi questa problematica, sul fatto che, le Big Tech si stanno rendendo conto, in questo momento storico, diciamo, taracciando una linea tra tutti, diciamo, per tutte le condizioni del sistema, il, il, che non sono troppo incentivate oggi nella Summere, il Junior develo, perché il Junior software inginir, perché il loro costo è comunque maggiore rispetto a quello che riesce ad dare uno strumento di L&M, di agenti coding per i task che hanno all'interno dell'azienda, quindi li conviene molto di più pagare i tokens piuttosto che pagare un Junior software inginir. E questo, diciamo, questa paura, questo sentimento si è tradotto già su quindi dei studenti che dopo il college, dopo l'ozzo, ma la sito, dopo le superiore, deve andare a scegliere che cosa fare all'università all'interno del Bacheler, per il Bacheler quindi per la Tiennale. E trovo questo dato indicativo perché mi aspetterei che, diciamo, questo si riflettera anche in Europa e anche in Italia un certo punto, nel senso che la cosa bella del Italia è che per mette l'istruzione a chiunque, diciamo, aggivo la l'istruzione a chiunque, però ci possiamo aspettare che questo effetto si reperqueterà anche in Italia, a un certo punto, chiaramente le situazioni in Italia sono diverse, nel senso in l'università in Italia è molto più, diciamo, esseguibile da chiunque, più o meno, però assolutamente molto di più rispetto a quello che per vede gli stati uniti dove i famigli si indebiteranno per mandare il fiore all'università, quindi si è un capitale allocato che deve essere in qualche modo può essere messo a frutto dopo perché sono altamente fatto un investimento che non ha funzionato tutti se è endivitato, in Italia e leggermente diverse la cosa. E questo sta portando l'America a vedere un movimento degli studenti in due direzioni. Uno, gli studenti tendono a essere sempre più interessati a un computer science che prevede al suo interno strumenti di integenza artificiale, però capire come poter utilizzare questo new tool per il lavoro che si trovano domani a fare quando usciranno, ma oltre a questo si tenda sempre più guardare con interesse quei digri ibridi, quelle laureibridi, ad esempio bioinformacca o FinTech dove, in trambicasia, ha un background di computer science e poi sopra costruisci in la direzione verticalizzati su l'altra specializzazione che può essere bioinformatica e bioinformatica la parte FinTech. Trovo tutto questo molto interessante perché spesso poi gli ondate che si verifino in America in qualche modo si riperquacono anche l'Europa e poi il mente deve so se era un'ottimo momento per le università, per brizzare a ripensare probabilmente i loro corsi, per poter adattare la, diciamo, diciamo, questa esigenza nel prossimo futuro. Qui si sta osservando in America di studenti che sono interessati a fare dei corsi verticali tipo, non so, per fare l'idea, Mulan dove, diciamo, un percorso intensivo di X-Messi su AI per come strumento per fare codice, diciamo, stanno ponendo molto valore in questo tipo di formazione. Questo però non è un qualcosa di molto verticale che potrebbe essere, diciamo, buttato via nel corso di qualche an, nel senso che magari tutti i formi diventi molto bravo su una cosa che oggi sembra essere promettente, poi tra un anno cambia il modo in cui si fanno le cose e tu sei diventate sperto su una cosa che è già vecchia. Si diciamo che probabilmente è una roba da mediare nel senso che ora c'è un po' una psicosi su questa uova daietà di fare codice di sviluppare applicazioni, però in un secondo momento mi aspetterei che si rientrarne la normalità dove si tendereà comunque a riapprezzare tutto quello che riguarda, magari anche le matere di più di base, soprattutto le quale costruire approcci che estrutano le ai per sviluppare applicazioni così via. Poi diciamo, passiamo a messi apri proprio una grandissima riflessione che credono nessuno ancora oggi, veramente una risposta è le ai che impacta brazzo di occupazione. Secondo, una seconda di questi report che c'è all'interno di questi link, in questo momento il computer science in America è una delle più, diciamo, dei percorzi che sta sperminando il maggior numero di disoccupati. È tipo, non è la prima ma è tipo la terza dopo qualche materia letteraria, non mi ricorda esattamente quali sono, probabilmente mi erano più so quel che appunto non sto beccando. In questo momento, però è anche questo non è una casamente interessante perché in quel graph si è ecco trovato. Ok, diciamo un tasso di unemployment percentuale che è simile ai le laure di, diciamo, vicine all'ambito della comunicazione e, per esempio, storia, ma la spesa interessante è che il salario medio di comunque il coloro che lavoro non è in computer science è molto, molto alto, molto, molto più alto rispetto a chi lavorerà in una parte di comunicazione storia. Quindi quello che indicavano all'interno dell'articolo è che probabilmente si sta semplicemente togliendo, diciamo, dalla catena, diciamo, del lavoro quelle posizioni eccesso che non servono più come prima. La domanda è dove andranno a lavorare queste persone. Sì, questa è la vera domanda, che che probabilmente duriamo farci sempre di più nei prossimi mesi. La cosa curiosa è che ho usci legge o ieri, o questa manina, ricorda, un surredit, che è questo grafico che è un grafico che è in realtà terzo che sia pubblicato da Indeed, riguarda quanto sono le job description, i job posting che si trovano alla N su Indeed in l'issadumid. E se tu guardi il grafico, diciamo, dell'ultimi, del ultimi due anni, allora tu vedo che, effettivamente, c'è stato un calo di Anzi Noscosa, non degli ultimi due anni. Se tu vedo il grafico da 2020, due mila venti due a due milioni due quando c'era il picco, allora adesso tu vedo che effettivamente ci sono moltissimi meno, moltissimi meno ferti di lavoro. La nota, quello che facciamo andare in questo post è che in realtà oggi siamo alla stessa quantità di ferti di lavoro che c'era novembre 2023, quindi siamo ricrescendo un po'. Se guardi il grafico completo a partire dal 2020 e ora il primo, la prima tagchetta sulla se del X è l'uglio 2020, in realtà credo parte da se il braio 2020, tutto il grafico che ci ho condamanti, ma io non è stato anche nel nostro della puntata, poi il braio 2020 è quello che loro segnano come centro, in questo grafico, e poi vi immagina di che durante l'anzi durante diciamo la pandemia perché nel 2022, tra Covid, detta, si interesse a zero, eravamo saliti a quantità di giopposting sull'asse delle ripi, non c'era due cento venti, rispetto ai cento da cui eravamo partiti, nel frattempo nel 2020 eravamo anche scesi a 60. Ora siamo all'incirca di nuovo, diciamo, su 80, più o meno, quindi tolto il periodo del boom, in realtà non siamo che il sacquanto lontani rispetto a quello che era magari il primo febbraio 2020, diciamo che quello che noi vediamo ora come strano è il fatto che vediamo che nel 2022 c'era una state tutte queste sssuzioni, però la normalità d'appuà non era quella del 2022 ma la normalità era quella che magari eravamo nel 2020, o prima in cui comunque eravamo troppo lontani dalle quantità di offerte che ci sanno adesso, quindi ok, c'è stata una riduzione sicuramente questo, però è minore rispetto a quanto magari uno possa pensare se vede solamente una parte di quel grario. Sì, sì, sì, diciamo che è barri pesato, vici. Vabbè visto il grafico per intero, poi ora il grafico qua quello che ho visto io si ferma il 2020, non so se c'è una versione che banche più indietro, potrebbe anche essere magari prima del 2020 e ravamo a livelli ancora più alti, però quello che è inne e gabile che nel 2020 ho scelto questo picco e quindi noi se oggi facciamo il confronto con il 2022, chiaramente diciamo, sì ci sono molte sieme e meno offerte, sì, ma nel 2022 comunque c'era stata una quantità in manza di offerte, una quantità in manza di assunzioni e poi dopo si è ridotto, moltissimo e magari ora piano piano si sta semplicemente tornando all'anormarità. Guarda, lo voglio sperare. Quando parlavi pensavo al meme quello di quella specie di animale, che sta in una calza che brucia, se si si si fa in "sisì il canino", è in realtà un altro, che avevo pensato di quella cosa, non so chi sia la versione adesso, non ho bisogno di scarl ritrovarlo, però quello di in cui c'è quello che fuma in maniera molto stressata, mentre vele qualcosa da su un telefono qualcosa e anche quello che mi faceva a pensare a questa cosa, mentre parlavi insomma non era proprio rassigurante la situazione, però vedremo, vedremo, vediamo un po' come il mondo nei prossimi mesi e anche il settore dell'informatio. Siamo. E' un po' di toi re-laboro le persone e ci parli di un nuovo lm di una versione per caso. Si, allora l'avrevo un po' promesso alla scorsa del timana, nel senso che ho detto che era uscita di "Six 4", che facevito a quello che era stato un po' probabilmente la del m, più chi accierato almeno della prima parte del 2025, poi dopo nel tempo nel 2005, abbiamo anche altri modelli di cui abbiamo parlato moltissimo, però nel l'epoca di "Six" era stato a l'epoca, sembra un passata navita, ma in realtà era un po' convidendo. E' in quel momento di "Six" aveva lasciato il segno perché era stato un, era un modello rilasciato da un laboratorio e diciamo, la stricasciata "Ancoban Weight" che comunque non era come per forma, si sa quanto lontano dei modelli "Clow surs", ma soprattutto aveva introdotto delle tecniche che poi sono state rutilizzate da tantissimi altri modelli, quindi c'è stato il momento di "Six" con che ha portato una grande innovazione in questo ambido. Ora, "Six" è stata silenziosa per un po', a settembre, se non ricordo male, abbiamo visto la versione 3.2, nel corso di ultimia, se avevano rilasciato alcuni paper, per 3Q1, anche di una architettura che viene utilizzata anche in questo paper, perché la "Miningfold" constreria in "Hiver Connections", e l'arliamo tra poco. Ora sono tornati, qualche giorno fa con la versione 4 di "Lipsick", vediamo la cosa che avevete nella punta del precedente, non avevo in quel momento avuto tempo di leggere il paper, ora ho letto una parte del paper, abbastanza per parlare, almeno della prima parte del paper, principalmente, quindi dell'architettura di "Lipsick", e in particolare del modo in cui hanno implementato l'attention di "Lipsick" per arrivare un obiettivo preciso. Quindi, per ora abbiamo a discussione 2 modelli, uno che è di "Lipsick V4 Pro", che da 1.6 trillioni di parametri, l'altro è la versione flash che mi ha solamente 240 miliardi. In entrambigasi ci abbiamo un'architettura mix or of expert, nel primo caso nel Pro sono 49 miliardi i parametri che si attivano nel secondo caso sono 13 miliardi. Ci abbiamo sempre un'architettura transformer, viene utilizzata un'intemnale del modello di questa fettura, c'è un modulo di "Musti Dog and Prediction", che è un sistema che permette nel momento in cui si fa il training questo modello di generare più di un tocan alla volta, quindi il primo, poi qualcuno di successivi, in modo da prevedere non solo il prossimo, ma anche i futuri, in modo che nel momento in cui facciamo il training abbiamo indietro da questi tocan, andiamo a generare una quante di abbi segnali più ricca rispetto a quella che avremmo generando un solo tocan, ma utilizzando la sensazione di dati. Come ho detto, utilizzano Mix or of Expert, in particolare di "Psych Moe", il che vuol dire che abbiamo tanti modelli piccoli che non sono dei modelli generalisti, ma sono modelli molto molto molto specifici. Alcuni di questi modelli i realtà sono specifici per alcune fichure del testo e quelli vengono attivati sempre, mentre poi ci sono chiaramente degli altri esperti più piccoli e più specifici che vengono attivati solamente in alcuni casi e che a cui vengono inviati a detto o che è un tramite router che è stato allenato in modo tale che non vengono mandati i dati sempre gli stessi esperti, ma che ci sia, che non ci sia ne una overutilization di alcuni esperti ne una andere overutilization. Chiaramente, essendo più piccoli questi esperti possono essere attivati, cioè, se ne passano attivare un po' di più perché sono un po' più piccoli. Rispetto a DeepSick V3, utilizzano questa manifold constrainable connections, quindi quello che vi dice o prima, quello che vanno presentando in qualche paper, qualche mese fa, cosa vuol dire questo? Vuol dire che, nel momento in cui abbiamo un t. nella tirettura transforme, noi abbiamo un tirettura di vari layer che vanno uno da con l'altro. Abbiamo un input all'interno che va all'interno di questi layer, il layer fa una certa, e se è una certa funzione transforma questo input e da la output. Cosa succede? Però che, se noi facessimo solamente questo e mandassimo la output nel layer stucessivo, poi nel layer stucessivo ancora, quello che potrebbe succedere è un problema di vanishing gradient. Quindi quello che fa, in realtà l'archiettura del transformer già di suo, è che l'input di un certo layer basi all'interno del layer, ma poi si prende anche questi input, si manda oltre questo layer si sovma all'output di quel layer. E quella è la cosa più semplice, nel senso che nella situazione più semplice è quello che facciamo è semplicemente sommare l'output di un certo layer con il suo input. Una versione un pochettino più recente e che cerca di migliorare alcuni aspetti di questi residual connection dei transformer è chiamate "Iter Connections". In questo caso quello che si fa è cercare di espandere queste informazioni che abbiamo, e in particolare quello che si fa, invece di fare direttamente la soma, questi valori che non andiamo a sommare quindi l'input e l'output, le andiamo a moltiplicare con delle matrici. Il problema, in questo caso, è un problema poi di produsabilità numerica, specialmente quando andiamo a mettere tantile ai eruno dopo l'altro. Di Psyc, con questo manifold constraint hyperconnection, MHC, è andato a, per solo avere questo problema, perché una delle matrici che viene utilizzata, perché questo metodo mette un vincolo su una delle matrici che viene utilizzata di terno di questa soma. Questo vincolo permette a questi segnali che vengono calcolare in questo modo di non esplodere, quindi non abbiamo i problemi stabili la numerica che abbiamo invece nel caso della soluzione pescita di con hyperconnection. Quindi cosa vuol dire è che abbiamo la possibilità di fare molte più moltiplicazioni e avere quindi più lei eruno sovra all'altra. Detto in maniera molto povera. Ora, la cosa su cui però mi voglio concettere un po' di più, questa era soltanto un po' un'intruzione riguardo alla architettura, quindi simili tutti, e in po' di differenza con la versione 3 di Psyc. La cosa che però lo metto in un modo, quindi vi danza all'interno del paper, è che probabilmente è quella che poi vi permette sia di avere i prezzi che sono molto bassi. Se andate suome router, fate un compronto, vedete che Psyc sia diversivamente bassi rispetto, per esempio, a GPT o rispetto ad altri modelli. Nonostante con quelle qualità di questo modello di questo tip, che non siano chi sa quanto lontani rispetto ai modelli "Closures". Quindi è uno di quelli che ha diminuito un po' la distanza tra modelli o "Pensure" e modelli "Closures". Qui è la questa fissure che è partita interessante, è il modo in cui Dipsi cria a avere un contesto di 1 milioni di token. Tutti due modelli di cui ho parlato finora, quindi si al prossimo si lascia a non contesto di 1 milioni di token. Nonostante questo rispetto a Dipsiq 3, Dipsiq 4, a comunque, utilizza comunque meno memoria e riasce a seguire meno Flowing Fondent operation per ogni token da l'inult. Quindi rispetto a di psichi U3, di psichu 4 utilizze solamente il 27% delle floating point operation e il 10% della kevi cache, quindi della memoria. Perché è importante che di psich abbia un contesto di 1.000 nitorgre, quindi perché è importante avere un contesto così lungo oggi è ancora vi importante perché abbiamo, ci piace da guardare con agenti, quindi avere questi agenti che possono avere a disposizione un contesto lungo è sicuramente in qualcosa che gli rende più meglio funzionanti e poi è un qualcosa che può tornare a utile anche in alcuni contesti in cui facciamo, per esempio, lavoriamo con dei documenti, se abbiamo documenti molto grandi, noi possiamo magari andare a analizzare questo documento dato la disponibilità di questo contesto. Quindi di psichu 4 riesce ad essere molto efficiente da questo punto di vista in modo tale da sfruttare al meglio anche il test time, test time scaling, come fanno questo, come hanno riso di psich così tanto efficiente hanno introdotto due mechanismi di attention differenti e in particolare loro poi li mettoni insieme in un sistema hybrido di attention mechanism nel senso che all'interno di questo di psichu 4, all'interno dell'archiettura di questo modello trovate alternati o comunque messi in alcuni posizioni di interno di questo modello, due tipi di attention, principalmente che sono una chiamata compressed part attention csa e una chiamata evili compressed attention a cc csa, sono in realtà abbastanza similitaroloro, entrambi hanno lo obiettivo di ridurre la dimensione della keivicash e la i floating point operation per ottenere in altru un single token. Quindi la prima di questi due mettoni insieme di attention andiamo a vedere oggi al podcast e csa, poi vi spiego velociissimmente anche il secondo che è realtà molto simile, non è facile spiegarlo secondo me senza del slide o comunque senza avere dietro una lavagna per alcune parti, però cercheremo di fare del nostro meglio. Allora cosa succede con csa? Allora immaginate che state interagendo con la CSA, all'interno di questa è la lemma, l'intrana di lipstick arriva un prompt, questo prompt contiene un po' di token, chiaramente, o dove sono le varie parti della nostra farase che abbiamo ad adimini. Ogni uno di questi token devono essere delle inserite dall'interno di una keivicash che permette di evitare di ricalcolare, quindi abbiamo parlato un falcon tata fa, di ricalcolare tutte le varie matrici di chi evveli per tutti i vari token che abbiamo insin precedenza, ogni volta che abbiamo un token nuovo, e detto in maniera veloce. Cosa succede in questo caso? Con CSA, l'obiettivo prima, il primo obiettivo è quello di comprimere questa keivicash, ogni volta ogni m token che arriva in input. Quindi per ogni token che arriva in input, quello che viene fatto è generare due keivientris e due matrici di compressione. Come di otteniamo, prendiamo la rappresentazione del token, la moltipliciamo con questo caso 4 matrici che sono due per creare le keivientris e due per creare matrici di compressioni e otteniamo questi 4 valori. Queste matrici che non utilizziamo in questo momento sono chiaramente dei parametri che vengono allenati durante il training. Ogni volta che cioè noi per ogni token quindi abbiamo questi elementi. Per ogni volta che abbiamo m di queste entri salinterno delle nostre keivicash, dobbiamo fare una compressione. Come facciamo utilizziamo le compression matrix che abbiamo calcolato nella fase precedente. Quindi ne aviviamo due e due keivientris. Ora vi starei tagliando perché due è non una, perché in realtà in questa fase di compressione quello che si va a fare, preso il blocchetto degli armetoken, di vogliamo comprimere ma non vogliamo solamente fare una compressione che va a considerare l'informazione che rappresenta l'interno del blocchetto corrente di armetoken ma vogliamo considerare anche il precedente blocchetto. Quindi ecco perché ci abbiamo due matrici di due keivientris e due matrici di compressione. Quello che si ottiene da fine di questa prima fase è questa keivichash compressa e per ogni blocchetto di armetoken abbiamo quindi una singola rappresentazione. A questo punto c'è la seconda fase della tensione fatta con CSA, quindi con compress parts attention, ovvero dobbiamo più di ammettabliare la sparse attention e viene applicata quella che viene chiamata di Psyx parts attention di SA. Ora qui torniamo un attimino indietro, come funziona attention? Quello che viene fatto è che ogni volta che abbiamo un tocanimo input, questo tocan è davendaria considerare tutti i tocan presenti, cosa vuol dire che davendaria vedere, quali i tocan presenti sono più legati o interessanti per quel tocanimo. Il problema è che questa, il mechanismo di attention, ha un costo quadratico, o o dn quadro, dove è nella dimensione dell'input, quindi questo è un problema perché se ci abbiamo un contesto lunghissimo, non riusciamo a ottenere degli autut in tempi ragionevoli. Quello che fa di Psyx parts attention invece è considerare i tocan precedenti, ma selezionando solamente quelli che sono più rilevanti in quel momento per quel determinato input, quindi per ognuno dei vari tocan precedenti andiamo a farlo ranking, considerando il tocan corrente e prendiamo solamente i topkey, quindi in realtà quando andrò a fare la fase di attention vera e provare in cui andrò a fare le varie multiplicazioni, non stavo considerando tutto il contesto, tutto quello che ho visto in precedenza, ma stavo considerando solamente una parte di quello che ho visto in precedenza perché andrò a prendere quelli che chiaramente ci avevano una similiarità maggiore, questi topkey tocan precedenti. Nel caso, ora torniamo a csa, nel caso di csa, di un po' non so gli inglese, perché nel caso di csa che è l'algo di attention, dobbiamo utilizzare questo stesso sistema di Dipsix part attention, quindi, prima di tutto, è moltiplicare e ottenere una rapprendazione più denza di questo tocan. E poi lo dobbiamo andare a moltiplicare con una seconda matrice che ci da una lista di quelli vectors. Questi quelli vectors sono quelli che dobbiamo dare utilizzare nella fase in cui vogliamo capire quali sono le parti dell'input precedente che sono rilevanti, quindi io già avrò un po' di questi quelli vector, e per ogni uno di questi quelli vector levando a calcolarmi anche un peso che mi dice quanto è importante quel quelli vector. Questo a coppia, il peso importanza quindi è quel vector, lo andiamo a questo punto di utilizzare per capire quali sono le varie blocchetti che abbiamo compresso in precedenza, che sono più rilevanti per quel tocan. Quindi noi prima abbiamo la nostra che vi caci, l'abbiamo compresso, e ci abbiamo tanti blocchetti che sono stati compressi. Ognuno di questi blocchetti, noi identificiamo con un certo valore e nel momento in cui andiamo a fare questa operazione capiamo quali sono di questi blocchetti, quelli che sono più rilevanti per il tocan corrente. E qui facciamo la stessa cosa che abbiamo detto prima, però prendiamo i topkey, i topkey blocchi, e questi topkey blocchi a questo punto sono quelli su cui andremo effettivamente a suvolgere la fase, il meccanismo diciamo tutta la parte di calcolo dell'attention. Quindi nella fase, ora vi salta sui unico passaggi che sono un pochettino più delicati, ma nella fase in finale diciamo di questo metodo, quello andiamo a fare a prendere questi topkey blocchetti che abbiamo estrati e strato e facciamo a questo punto un calcolo standard dell'attention in cui c'è un'altra cosa interessante perché questi blocchetti che noi abbiamo estratto hanno in condivisione sia la chiave, sia la chiave, sia la chiave, chiave valore, diciamo, sono lo stesso, la stessa cosa, in questo caso. Quindi anche se facciamo il calcolo standard dell'attention, se vengono a vedere il paper, quando calcono all'attention tra i vari argomenti dell'attention, ci abbiamo chiave valore e chi, veri e quelli, la quelli è quella che abbiamo calcolato prima, chi e veri invece sono quelli che rappresentano i vari blocchetti, stesso stesso identico valori nel transbicampi. Questa era chiave, quindi era la prima dei due sistemi di e attention. L'altro che è a caccia. che è da come diceva anche il nome è più compresso perché è lini compresa attention a caccia. Semplicemente la stessa identica cosa? Solo che la m in questo caso è molto più grande rispetto alla m che abbiamo usato con CSA. La m come vi dicevo prima era la quantità di token che dobbiamo adere all'interno di un blocco quando andiamo a fare la compressione. Qui se m è molto più grande in questo caso, quindi facciamo la compressione più cicciosa, quindi compriamo di più, compriamo più elementi tutti insieme e soprattutto l'altra cosa che è diverse in questo caso. Ricordate che prima vorrei dire calcoliamo due che ai vientri se due matrici di compressione. In questo caso ne calcolo una, calcolo una ma decidi compressione e una che ai vientri. Questo perché in realtà non ci manteniamo nel modello di cui andiamo a fare la compressione informazioni sul blocco precedente ma assolutamente su quel attuale. Queste sono le due, diciamo, queste è quello che maccolpita un po' di più rispetto nel paver di Vipsicle almeno fino ad oiletto che è in realtà poco più l'Abre che mi sono affermato alle prime tipoventi cinque pagine circa, che era comunque non poco, considerando che il tutto quanto è una quarantina di pagine, mi manca ancora da leggere la parte di training post training però secondo me questa è la parte forse un po' il tino più rilevante che ci spiega un po' anche il perché sia della bassa latenza che ha questo modello nel momento in cui ci dà degli output sia soprattutto anche il fatto di poter gestire un contesto così lungo con le cifre che costavo il modello. Quindi l'ho trovato istruttivo, leggerlo, spero di averlo un po' ripetuto per quanto possibile, sono niente a voce in modo più o meno comprensibile, poi se avete domande o vogliamo discutere ancora gli amici in la po' intersciate la possibilità e vi lascio poi nelmeno della puntata il link al tecnico report dove spiega un po' tutto se sei interessaria studiare per un po' meglio. Lui ti volo fare una domanda che dovessero tutto molto interessante perché è uno dei top lm open source, la domanda ti volo fare, e a dunque questi cosi che ci ha raccontato e che sono implementate in deep seek. Secondo ti sono già anche implementata all'interno del modello e del link load source. Allora questa è una bella domanda. Il fatto che deep seek rilasci un po' tutto sia che spieghi cosa effettivamente fanno, magari ci fa pensare che nel futuro qualcosa di simbina ci sarà. La cosa che avevo detto qualche punto da faccio genio, perché avevamo parlato di qualcosa di simbina non so come che era arrivato. Però una cosa interessante che Renerza l'avevo visto per se sul reddit non ricordo, era che Gemini Flash credo, se non mi ricordo male, adesso magari mi sbaglio, ma era Gemini Flash, 3.1 Flash e 3 Flash, anche lui ha un contesto, credo di un milione di token, e anche in quel caso ci abbiamo un prezzo basso. Quindi quello che le persone dicevano è che probabilmente Google già qualche sistema per ottenere qualcosa di simile o comunque per ottenere, c'è, c'è delle soluzioni tramite delle guandi riesce a gestire un contesto così lungo, e però avere poi buona latenza e un prezzo normale. Quindi magari non è la scen, non è detto sia la stessa identica cosa, anche perché questo di Gemini Flash era un sito qualche, mi se fa, mentre di psichio, qualche lì orno fa. Però magari anche Google o a Penia, io antrofiche hanno la loro versione di Evili, Spark attention e riescono in qualche modo a avere qualcosa di simile. Immagino, Evili, con sex attention. Cioè, il piangere di essere dove stanno mettendo le mani, dove stanno ottimizzando, c'è poter provare ai potizzare. Cioè, il fatte comunque dato che gli altri competitor non relaxano troppo in formazione riguarda difficile dire se OpenAI c'è altamente qualcosa di simile. Però otti fa pensare che probabilmente qualcosa dell'abbia, anche perché ci sono arrivati e ricercatori di DeepSick che per carità hanno dimostrato di essere molto competenti anche in passato. Però a maggior ragione ci dovrebbero riuscire quelli di OpenAI, di antrofiche, di Google, che ci hanno miliardi di finanziamenti in più, un sommo penso che qualcosa del genere ci lo debba n'avere già, anche perché comunque consideriamo che OK che magari il prezzo finale per l'utente è più basso, ma sono anche più bassi poi i vari consumi che ci hanno loro, perché se DeepSick e Google 4 ci sono bisogno del 10% da memoria rispetto a avutre comunque loro nel momento in cui magari servono i simmodelli riescono a servire di più o comunque usare meno memoria, se servono meno, se se è necessario avere meno operazioni, nello stesso modo ne possono fare di più o servire meno di più. Quindi immagina che lo stesso modo anche OpenAI e similari vogliano fare in modo di avere questo stesso tipo di optimizzazioni e che magari ce ne aviano già da me in si fa. Sì, certo, certo. Poi probabilmente vedendo un po' line molto sempre di DeepSick, diciamo, è stato sempre fatto un po' di distillation sugliamo tutti gli altri alleleano, perché ci soppare che i screenshot in cui fanno ora questo un centriante, perché c'è un conto discorso di brina, però era per radire che comunque bravi, però anche la pratica questa radica di distillation continuo anche in questo caso perché ci sono posti sin screenshot, in cui fanno vedere che è momento in cui gli agli DeepSick chi sei, magari non sempre di risponde o se ti rispondi, non con i casi, ti diciamo che sono Sonnet, sono. Quindi anche in questo caso come era successo in passato probabilmente ne stata anche una fase di distillation, di model distillation da Giaoshoot del modello grande di Appropic a DeepSick. Ok, io non so se c'è il suo domande, altrimenti possiamo andare in chiusura. Ok, allora spero che vi sia piaciuto anche questa puntata, se continuo a leggere il bel di DeepSick quando riesco e se trovo anche quasi interessanti nella seconda parte magari mi ero alliamo nella ruota che è appuntata altrimenti avremo qualche altro contenuto per voi, mi raccomando se vi decine la po' screenshot e trovate il link nella puntata, fa deciso avere cosa ne pensare di questo tipo di puntata un po' più tecniche e ci sintiamo la settimana prossima con un nuovo puntata del Ponte Podcast. Ciao! Ciao! Ti ringraziamo per aver ascoltato il Ponte Podcast e ci auguriamo con la puntata di assata di tuo gradimento. Se ha cositti che diamo di condividere questa puntata sui social e di far conoscere il nostro progetto ai due amici e colleghi, se non vi perderli di prossimi episodi iscriviti al nostro Ponte Podcast. Il Ponte Podcast è disponibile sulla Ponte Podcast, Google Podcast e Spotify. Se ci segui sui Apple Podcast, ti chiediamo di scrivere una recensione, ci aiutereà a crescere e a raggiungere un pubblico sempre maggiore. Se voi contattarci, puoi farlo tramite i miei l'alindilizzo Info che hoci la puntata podcast.it. O tramite social. Siamo su Twitter, Facebook, Link, Link e Instagram. Grazie per averci ascoltato e alla prossima!

Podcast Summary

Key Points:

  1. Nella puntata 200 del podcast si discute del follow-up su Midos e GPT-5.5
  2. Negli Stati Uniti si registra un calo dell’8% nelle iscrizioni ai corsi triennali di Computer Science per la prima volta in 15 anni, dovuto a licenziamenti nelle Big Tech e alla sostituzione di junior developer con strumenti di AI.
  3. Gli studenti americani si orientano verso lauree ibride (bioinformatica, FinTech) o corsi verticali sull’AI, mentre i dati mostrano un tasso di disoccupazione elevato tra i laureati in informatica, ma con salari medi ancora alti.
  4. DeepSeek ha rilasciato V4 Pro (1,6 trilioni di parametri) e V4 Flash (240 miliardi), con architettura Mixture of Experts, manifold constrained connections e Multi-Token Prediction per migliorare l’addestramento.

Summary:

La puntata 200 del podcast affronta tre temi principali. 5 ha mostrato capacità simili a Midos in attacchi informatici complessi, facendo sorgere dubbi sul motivo del mancato rilascio di Midos, forse legato a strategie di marketing o alla scarsità di GPU. Il secondo tema riguarda il calo dell’8% delle iscrizioni ai corsi triennali di Computer Science negli Stati Uniti, il primo in 15 anni.

Ciò è attribuito ai licenziamenti nelle Big Tech e alla sostituzione dei junior developer con strumenti di AI, spingendo gli studenti verso lauree ibride o corsi verticali sull’intelligenza artificiale. Nonostante un tasso di disoccupazione più alto tra i laureati in informatica, i salari rimangono elevati. Infine, si parla di DeepSeek V4, un modello con architettura Mixture of Experts e Multi-Token Prediction, disponibile in versione Pro e Flash, che promette innovazioni nell’efficienza computazionale.

La discussione sottolinea l’impatto dell’AI sul mercato del lavoro e la necessità di adattare i percorsi formativi.

FAQs

La puntata 200 del podcast, intitolata Pointer Podcast, discute di vari argomenti, tra cui il modello Midos e il suo mancato rilascio, la flessione delle iscrizioni a corsi di informatica negli Stati Uniti e l'uscita del nuovo modello DeepSeek V4.

Midos è un modello di intelligenza artificiale che ha ottenuto risultati simili a GPT-5.5 in test di sicurezza informatica, ma non è stato rilasciato. Si ipotizza che ciò sia dovuto a una strategia di marketing o a limitazioni hardware di Anthropic, come la scarsità di GPU.

Per la prima volta in 15 anni, le iscrizioni ai corsi di informatica negli Stati Uniti sono diminuite dell'8%, a causa della percezione che le Big Tech stiano riducendo le assunzioni di junior developer, preferendo l'uso di strumenti AI.

Gli studenti stanno mostrando interesse per corsi che integrano l'intelligenza artificiale e per lauree ibride come bioinformatica o fintech, mentre diminuisce l'interesse per i corsi tradizionali di computer science.

DeepSeek V4 è disponibile in due versioni: Pro con 1.6 trilioni di parametri e Flash con 240 miliardi. Utilizza un'architettura mix of expert, con 49 miliardi di parametri attivi per Pro e 13 per Flash, e introduce il Multi Token Prediction per un training più efficiente.

Le manifold constrained connections sono una tecnica introdotta in un paper precedente di DeepSeek, utilizzata in V4 per ottimizzare l'attenzione del modello e migliorare l'efficienza nel processamento dei dati.

Chat with AI

Loading...

Pro features

Go deeper with this episode

Unlock creator-grade tools that turn any transcript into show notes and subtitle files.