El episodio aborda la inteligencia artificial local y privada, destacando su creciente importancia debido a preocupaciones de privacidad, especialmente tras la prohibición de ChatGPT en empresas como Samsung y Apple. Se explican las ventajas: privacidad total, cero costos recurrentes (sin suscripciones ni tokens) y funcionalidad sin internet, ideal para entornos remotos o sensibles. Sin embargo, se aclara que los modelos locales no igualan la calidad de los modelos en la nube como ChatGPT o Gemini, y su rendimiento depende del hardware disponible. Se clasifican los modelos según su tamaño en parámetros: desde 1-4 mil millones para tareas simples en PCs con 8 GB de RAM, hasta 30-70 mil millones que requieren 48-64 GB de RAM, como en las Mac Mini. La cuantización (Q4, Q8) permite comprimir modelos para ahorrar memoria. Herramientas como GPT4All, LM Studio y Ollama facilitan la ejecución local, mientras que LLM Checker recomienda modelos según el hardware. Se mencionan novedades de Nvidia (RTX Spark) y Microsoft (Surface RTX Spark Box) con 128 GB de RAM, y se sugieren opciones empresariales como servidores físicos o nubes privadas con pago por hora. El futuro apunta a una integración más profunda de IA local en sistemas operativos y aplicaciones, como ya ocurre con Apple Intelligence.
En este episodio vamos a estar hablando de inteligencia artificial privada. Sin conexión internet, totalmente local. Tanto en una máquina como en un servidor o en entornos virtuales privados, vamos a ver todas esas alternativas porque en estos días tuvimos varias noticias de varias empresas que se están metiendo o están reforzando el tema de la inteligencia artificial local. Tuvimos eventos de Microsoft eventos de Nvidia en estos días donde cada una de estas empresas mostró sus apuestas por la inteligencia artificial local y privada con nuevas máquinas, nuevas placas. Eso es lo que quiero hablar en este vídeo. Ya hice varios episodios hablando sobre herramientas de inteligencia artificial local, sobre herramientas de inteligencia artificial privadas. Ustedes les gustaron mucho, tuve muchas preguntas, muchos comentarios y por eso estoy haciendo este nuevo episodio para responder a todos esos temas y también para hacer una actualización porque a día de hoy tenemos otras opciones que en ese momento no estábamos. Para empezar vamos a decir que hay muchas empresas que prohibieron el uso de chatchivity a sus empleados. Tenemos el caso de Samsung, Apple, BBW, Telefónica, Amazon. Montones de esas empresas prohibieron el uso de chatchivity porque por temas de filtraciones. Entonces quiero que ustedes también piensen que opciones tienen para sus propias empresas, porque por ejemplo en el caso de España también muchas empresas españolas prohibiden a sus empleados el uso de inteligencia artificial por esta misma tema, por temas de privacidad. Entonces, ¿qué opciones tenemos? Bueno, eso es lo que quiero que veamos hoy. ¿Por qué vamos a ver esto hoy o qué cosas son las que quiero arrecorrer? Bueno, ¿por qué usar inteligencia artificial privada? ¿Cómo funciona? Si tu computadora aguanta o qué computadora necesitas para poder usar una inteligencia artificial local y privada o qué servidores? ¿Qué herramientas tenemos para poder usar eso en local hoy en día? Y también ver un poco de que máquinas se necesitan y que precios pueden tener estas máquinas. Empecemos por el primer punto que es, en cuanto a las razones por las cuales tener una propia inteligencia artificial local privada, es básicamente por la privacidad. Nada sale de tu máquina, nada sale de tu empresa ni contratos ni datos de clientes, información médica, información financiera, todo queda en el disco de la máquina y esa es, creo yo, la razón número uno por la que las empresas eligen la inteligencia artificial privada. Después, lleno la parte de costos, una vez que vos te descargas estos modelos de internet, Dios vos o tu empresa, descargas estos modelos que son modelos que ya están entrenados así que ese entrenamiento hubo alguien más que invertió cientos de miles o millones de dólares en entrenado, una vez que vos te descargas eso, no tenés ningún costo más, no tenés ni que pagar suscripciones, no tenés que pagar costos de tokens ni por uso, simplemente necesitas tener electricidad para que tu máquina esté encendida. El otro tema es la independencia que te da donde poder usar estos modelos locales tanto en el medio de la nada, sin tener que estar pagando quizás una conexión satirital a internet, poder usarlo en un avión, porque eso corre en tu máquina. Entonces, esas son estas ventajas de tener una inteligencia artificial local que puede ser en tu máquina o puede ser en un servidor privado de la empresa. Hace un tiempo hice un episodio hablando sobre Gipit e Forold, que era una de las herramientas que comenté, que se podía usar para todo esto, hoy vamos a ver cual es otras opciones tenemos, pero lo que quiero dejar en claro es que cuando estamos hablando de tener una inteligencia artificial local privada, sin internet, en tu máquina, quizás en tu PC, escritorio, o en tu notebook, en tu laptop, estamos hablando de que no vas a lograr tener la calidad de los modelos de frontera como el último modelo de Gipit e Cloud o de Gemini, ni quizás dependiendo del hardware que tengas la velocidad a la que te responden esos modelos ni que sirva para todos los tipos de trabajo. Eso tenemos que tenerlo en cuenta. Lo que sí, para esperar es que depende del hardware que tengas, depende de la máquina que tengas la placa, podés tener resultados decentes, pero lo más importante es que vas a tener una privacia total y que no vas a tener que estar pagando suscripciones ni costo de uso. Eso es lo que quiero decir acá, porque tampoco me voy a acá a venderte humo de que la inteligencia artificial local es lo mismo que usar los modelos de que están en la nube y gratis. No, no es así. Y siendo la inteligencia artificial local que tenemos, bueno, tenemos modelos que quizás meta la empresa de Facebook o Google o alivaba de los chinos o deep seek entrenan y que los liberan el internet y que esos boss los puedes descargar y una vez que los descargas los tenés como un archivo más en tu máquina y que a través de estas aplicaciones como Gipit e Foroel o como el M estudio o como o llama, es cargar esos modelos y tener una memoria para correr la inteligencia artificial local. Acá pasas a hacer el dueño de ese modelo de inteligencia artificial y lo correz boss en tu máquina en tu casa. Ahora vamos a hablar un poco de el tamaño de la capacidad del hardware, hay distintos tipos de estos modelos que tienen distintos tamaños, siempre se hablan en v millones de tokens, bueno, esas ov millones en realidad, v millones de parámetros, tiene que ver con el tamaño del modelo y cuanto más tamaño por lo general tenemos en mejor calidad, pero tenemos que ver qué es lo que soporta nuestra máquina correr. Tenemos modelos de, por ejemplo, dentro de un billón de parámetros a cuatro billones de parámetros, esos son modelos muy acotados que pueden servir para tareas muy simples, que quizás lo puedas correr en una máquina con poca memoria, podría ser quizás cualquier notebook con, no sé, ocho llegas de RAM, pero creo que el uso es muy acotado, no creo que sea demasiado útil, salud para cosas muy puntuales, muy pequeñas y muy específicas. Ya, yendo a más de siete billones de parámetros a 14 billones de parámetros, ahí creo que se pueden tener un uso mucho más decente, ahí en ese caso quizás si tienes una máquina que tenga 16 GB de RAM en adelante, bueno, puedes cargar estos modelos en memoria y tener un uso un poco más decente. Por ejemplo, en mi caso, yo tengo una Macbook Pro con un procesador M3, tengo 20 GB de RAM y con eso puedo correr este tipo de modelos en local. Ya después, si queremos modelos de más alta calidad, estamos hablando de 30 a 70 billones de parámetros, tenemos mejor calidad de modelo. Ahí necesitamos, por ejemplo, una Mac Mini, las Mac Mini fueron las que más explotaron y las que más se vendieron últimamente para poder correr este tipo de modelos, un boom, una explosión, se empezaron a gochar las Mac Mini por todos lados, porque mucha gente las empezó a comprar para correr este agente OpenClose, bueno, la corrien con modelos locales en estas Mac Mini. Entonces necesitámoslo de hablar de 48 GB de RAM, 64 GB de RAM para correr este tipo de modelos. Y ya modelos más potentes de 120 billones de parámetros, por ejemplo, esos ya son quizás más cercanos a los modelos que podemos usar en la nube, y para eso necesitamos equipos mucho más potentes con 128 GB de memoria. Hay un concepto que quería comentar también hablando de todo esto de la inteligencia artificial local, que es la cuantización. La cuantización es una manera de comprimir estos modelos para que ocupen menos memoria sacrificando un poquito de la calidad. Para hacer una analogía, podríamos decir que la cuantización podría ser como el MMP3 de los audios. Si nosotros queremos un audio que tenga mucha calidad, pero que ocupa el poco espacio, por eso es que se creó el formato de MMP3. Y a partir del MMP3 explotó el tema de la música en internet y de escarga de canciones y el stream y todo eso, porque podíamos tener buena calidad de audio, pero en poco tamaño en megas. La cuantización es algo así. Y hay distintos tipos de cuantización. Si nos ponemos técnicos, tenemos la cuantización Q4, donde ahí tenemos más compresión, después tenemos Q6, Q5, donde quizás hay más equilibrio y Q8, donde está comprimido, pero casi sin perdido. Una cuestión bastante técnica, pero también para que lo entiendan si quieren probaría local y van a buscar modelos para descargarse y para correr, que sepan que los que dicen Q son modelos comprimidos. Algo interesante. Hay una aplicación si tompa quete que ustedes pueden instalar en su máquina, se llama LLM checker, hay otros también que pueden corrar, que les detectan. ¿Qué máquina tienen ustedes que hardware tienen? Y en base a eso les dicen cuáles son los mejores modelos de inteligencia local que podrían correr y que funcionen bien. En mi caso, yo por ejemplo, me talé este LLM checker, me dice que tengo una Apple con un M3 de X20 GHz y que me dice que puedo corrar modelos de hasta 12 GHz en memoria. Y me recomienda, por ejemplo, el Q-Wen 3 como uno de los mejores modelos que puedo corrar. Entonces lo que le digo es que antes de empezar a probar pueden bajarse algunas estas herramientas, voy a dejar algunos links para que prueben estas herramientas, le dían, les detectan que hardware tienen ustedes y les recomiende que los que pueden ver. En cuanto a herramientas en las cuales correr estos modelos locales, hice un episodio específico a su tiempo hablando de GPDforol, le voy a dejar linkado también para que lo puedan ir a ver esa zona. Tenemos a LM estudio también como OTAL Territories y holama o llama como le quieran decir como OTAL Territories. Ahora les voy a comentar un poco que se pueden hacer con todas estas cosas. GPDforol ya lo comenté es como una interfaz gráfica, una aplicación cita que sería como tener un chat GPD local donde podemos ir abriendo a distintos chats, podemos también cargar documentos y o referenciar a carpetas y que lea los documentos de ahí y usando uno de estos modelos que nos descargamos tener chat locales con información totalmente privada. LM estudio es una aplicación similar a GPDforol quizás más moderna, más actualizada donde tiene más opciones también, creo que en cierto punto podemos meternos a más parámetros de configuración y más complejidad. También la pueden probar, es muy similar.
y en el caso de "Ollama" esa, algo que corre en la terminal, es la aplicación como más técnica y que se suele usar muchas veces si queremos hacer automatizaciones dentro de un ambiente local y que se corran scripts o gente que hace flujos en N8N, bajándose la versión de N8N, también community para correr en local y que hacen que esos flujos de N8N ejecuten también la parte de inteligencia usando o llama. Entonces, estas son como tres aplicaciones, tres alternativas que tenemos que usar. Así que, depende para qué van a usar ustedes y qué tipo de usuario van a dar, cuál de estas aplicaciones son las que les recomiendo usar. Recordamos, GPT4OL es esta que tengo un episodio específico y lo que deja alinqueado. El M estudio es una que está bastante más diseñada del interfaz más linda estéticamente, tiene más opciones de configuración, creo que se actualiza mucho más y también creo que tiene un catálogo más grande de modelos que se pueden descargar y o llama para cuestiones más técnicas, como por ejemplo conectarla con un N8N local y poder hacer frujo de automatizaciones con inteligencia, todo totalmente privado. Como les decía antes, utilicen alguno de estos chequeadores para que les diga qué hardware tienen y qué modelos les recomienda usar y también quería mencionar estas novedades que les decía el principio, porque envidia, por ejemplo, en el evento que hizo hace poco, habló de RTX Spark es la PC NACIA para la inteligencia artificial local, estamos hablando de memoria de 128 GB unificada que permitiría correr modelos de hasta 120 visiones de parámetros y un petaflock de cómputo en un escritorio, esto es una locura, estas máquinas se dice que pueden llegar a tener un precio de entre mil 500 dólares y 3000, van a estar saliendo de acá unos meses y los proveedores van a ser para máquinas del HP Lenovo ASUS, la Microsoft Surface y MSI son precios no oficiales esto que les digo, hay que ver después a cuanto salen, yo no creo que pueden salir a mucho menos de 3000 dólares, podamos hablando de una locura de máquina y también este tema Microsoft en el evento que estuvo haciendo nuestros días, el Microsoft Bill también habló mucho de el Windows local con inteligencia artificial, de hecho Satiana de la dijo nuestro objetivo es entregar inteligencia sin medidor, esto quiere decir que puedan usar de manera ilimitada en cada hogar o en cada escritorio, esto por el tema de que últimamente se está hablando mucho del consumo de tokens, que bueno los que están usando mucho uso de inteligencia artificial se le están acabando y los tokens que tienen habilitados, Microsoft en sí va a tener esta máquina la Surface RTX Spark Box también, un tremendo máquina y bueno tenemos que empezar a ver como todo esto también impacta en el mercado porque tanto AMD y Intel Qualcomm son empresas que también están en este barco de la inteligencia artificial local, así que vamos a empezar a tener mucho más competencia, tenemos que empezar a pensar que las nuevas máquinas, las nuevas laptop de stop que se vengan van a hacer máquinas que ya vengan preparadas para inteligencia artificial local que van a ser bastante más caras a los que estamos acostumbrados a pagar por una máquina de estas, salvo las de Apple que ya venían con esto, con los procesadores m, estos nuevos procesadores, alineas de procesadores que tienen las últimas mac ya vienen preparadas para correría local, pero bueno cada vez vamos a tener más cierra local y cada vez vamos a tener más sin organización entre el sistema operativo, entre las aplicaciones, descripitorio y la inteligencia artificial sin necesidad de que estemos conectados en internet, sin necesidad de que los datos nuestros salgan de nuestra máquina o de nuestra red privada, sin que eso también tenga un costo de suscripciones o de pago de tokens, sino que van a estar incluidos dentro del uso que vemos de la máquina y bueno para eso vamos a necesitar máquinas más potentes, así que para cerrar algo más que quiero decir es que no sólo tenemos que pensar en inteligencia artificial local o privada en una computadora escritoria, en una laptop, en una notebook, sino que también podemos tener eso mismo en servidores privados, pueden ser servidores físicos que tengamos en nuestra empresa o servidores privados que tengamos en la nube, entonces tenemos una nube privada con un servidor donde solo tenemos acceso y donde corremos nuestros propios modelos y no necesitamos quizás comprar el hardware, comprar la máquina física, sino que la podemos alquilar alquilar por horas alquilar por tiempo de uso, entonces esa también es una opción a tener en cuenta y es una opción muy viable para las empresas sin tener que hacer un inversión inicial, sino que pueden pagar por el uso y ahí es vos prendes, empezás a usar, no necesitas más lo apagas y solamente estás pagando por las horas que uses, entonces lo que haces es alquilar el GPU, hay varias empresas que ofrecen este tipo de servicio y también son una opción para empresas que estén pensando en tener inteligencia artificial privada, sin necesidad de tener que hacer la compra de servidores, así que bien que tenemos con eso, tenemos tres opciones, si tenemos por un lado, si tenemos hardware propio, costo fijo, lo pagamos, lo podemos usar, no tenemos más costos, nube privada como les decía recién, ahí tenemos el costo por hora, vamos a pagar por la cantidad de horas que tengamos prendidas de esa máquina y si no, seguir usando lo que se difundió más hasta el momento que es el pago por uso o el pago por tokens, donde pagamos una licencia y tenemos un solimitado o pagamos por tokens y es como subirse al taxi, no, pagamos por lo que usamos, así que para cerrar hacer como un recap, un resumen de todo esto, si quieren hacer uso diario con datos sensibles, pueden usar inteligencia artificial local en su máquina, fíjense de instalar algunos estos chequeadores como lmchaker para ver que hardware tienen y qué tipo de modelos son los más recomendados, si van a hacer un uso sporádico de modelos grandes, o en la empresa, ahí pueden pensar en usar una nube privada, con donde paguen por hardware por horas para usar modelos mucho más grandes, si tienen una compu vieja, quizás están pensando en renovar, busquen o miren estas nuevas máquinas que están saliendo, que vienen muy preparadas para correr inteligencia artificial local, creo que el futuro cada vez más los sistemas operativos y las aplicaciones van a venir muy integradas para usar este tipo de inteligencia artificial local, como por ejemplo lo que nos vendió Apple con su Apple Intelligence, que bueno, todavía estamos esperando que arranque, pero Windows también va a ir por lo suyo, y no tienen la opción de seguir usando chachypt, cloud chimingay, que son lo que tenemos hasta el momento que está más difundido, y que si no tienen problemas de privacidad o de confidencialidad en su empresa y les permite usar, creo que es la opción más viable para todo el mundo. Pero bueno, como era un tema que me habían hecho muchas preguntas, quería volver a hacer un episodio sobre esto y también comentar esto que les decía, últimamente muchas empresas están empezando a tocar este tema de inteligencia artificial local, esta semana tuvimos a Microsoft en vidia, así que creo que también va a haber mucho movimiento por el lado de empresas con inteligencia artificial local en lo que se viene. Eso fue todo por hoy, espero que les haya gustado, como siempre pueden dejar 5 o 3 sitas en Spotify, me gusta suscribirse en YouTube en Spotify, donde sea que tengo sumiendo esto, porque nos ayudan a que podamos seguir haciendo este contenido, y ahora sí, nos seguimos hablando en el próximo episodio, donde seguiremos hablando de este hermoso mundo de la inteligencia artificial.
Podcast Summary
Key Points:
La inteligencia artificial local y privada (sin conexión a internet) es cada vez más relevante, con empresas como Microsoft y Nvidia lanzando hardware y soluciones dedicadas.
Las principales ventajas son la privacidad total (los datos no salen del dispositivo), la eliminación de costos recurrentes (suscripciones o tokens) y la independencia de conexión a internet.
Empresas como Samsung, Apple, Amazon y Telefónica han prohibido el uso de ChatGPT por filtraciones, impulsando la búsqueda de alternativas locales.
La calidad de los modelos locales depende del hardware
Herramientas como GPT4All, LM Studio y Ollama permiten ejecutar modelos locales, y aplicaciones como LLM Checker ayudan a identificar el hardware compatible.
La cuantización (ej. Q4, Q8) comprime modelos para ahorrar memoria, sacrificando algo de calidad, similar al formato MP
Nuevos dispositivos como la RTX Spark de Nvidia y la Surface RTX Spark Box de Microsoft ofrecerán 128 GB de memoria para modelos avanzados, con precios estimados entre $1,500 y $3,00
Alternativas para empresas incluyen servidores físicos locales, nubes privadas (pago por hora) o el modelo tradicional de pago por uso/tokens.
Summary:
El episodio aborda la inteligencia artificial local y privada, destacando su creciente importancia debido a preocupaciones de privacidad, especialmente tras la prohibición de ChatGPT en empresas como Samsung y Apple. Se explican las ventajas: privacidad total, cero costos recurrentes (sin suscripciones ni tokens) y funcionalidad sin internet, ideal para entornos remotos o sensibles. Sin embargo, se aclara que los modelos locales no igualan la calidad de los modelos en la nube como ChatGPT o Gemini, y su rendimiento depende del hardware disponible.
Se clasifican los modelos según su tamaño en parámetros: desde 1-4 mil millones para tareas simples en PCs con 8 GB de RAM, hasta 30-70 mil millones que requieren 48-64 GB de RAM, como en las Mac Mini. La cuantización (Q4, Q8) permite comprimir modelos para ahorrar memoria. Herramientas como GPT4All, LM Studio y Ollama facilitan la ejecución local, mientras que LLM Checker recomienda modelos según el hardware.
Se mencionan novedades de Nvidia (RTX Spark) y Microsoft (Surface RTX Spark Box) con 128 GB de RAM, y se sugieren opciones empresariales como servidores físicos o nubes privadas con pago por hora. El futuro apunta a una integración más profunda de IA local en sistemas operativos y aplicaciones, como ya ocurre con Apple Intelligence.
FAQs
Es una inteligencia artificial que funciona sin conexión a internet, totalmente en tu máquina o servidor privado, garantizando que los datos no salgan del dispositivo.
Ofrece privacidad total al no compartir datos con terceros, elimina costos de suscripciones o tokens, y permite usarla sin conexión a internet, ideal para entornos sensibles.
Depende del modelo: para modelos pequeños (1-7 mil millones de parámetros) bastan 8 GB de RAM; para modelos medianos (7-14 mil millones) se requieren 16 GB o más; para modelos grandes (30-70 mil millones) se necesitan 48-64 GB de RAM.
Es una compresión que reduce el tamaño del modelo sacrificando un poco de calidad, similar al MP3 en audio. Se representa con términos como Q4, Q6 o Q8, donde mayor número implica menos pérdida.
Las principales son GPT4All (interfaz gráfica simple), LM Studio (más moderna y configurable) y Ollama (para terminal y automatizaciones técnicas).
Puedes usar aplicaciones como LLM Checker que detectan tu hardware y recomiendan los mejores modelos para tu máquina.
Chat with AI
Loading...
Pro features
Go deeper with this episode
Unlock creator-grade tools that turn any transcript into show notes and subtitle files.