Go back

Episode 4 - Martin Ciruzzi (MeliData y PyMes)

22m 35s

Episode 4 - Martin Ciruzzi (MeliData y PyMes)

En este episodio de Kibina Puyidas, Juan Rossi entrevista a Martín Cirussi, ingeniero y líder de los proyectos Melidata y PIMES en Mercado Libre. Martín explica que Melidata es un sistema de big data que recolecta, procesa y pone a disposición datos de usuarios para crear mejores productos, como pruebas A/B, manejando 1200 millones de eventos diarios. Por otro lado, PIMES (Pesos y Medidas) se enfoca en estimar de forma precisa el peso y tamaño de los productos para cobrar tarifas de envío justas, evitando soluciones simples como usar solo categorías. El equipo comenzó con tres personas y hoy cuenta con diez, distribuidas entre Buenos Aires y Córdoba. Martín destaca que el principal desafío es predecir ítems sin historial, usando machine learning y datos de centros de distribución, mientras se filtran errores humanos. También menciona la colaboración con el equipo de Binpack para optimizar envíos de múltiples productos en una misma caja. Finalmente, en un ping-pong de preguntas, Martín revela su lenguaje favorito (Java), su pasión frustrada por el fútbol, su emoji preferido (el que golpea la cabeza) y que no le gusta el chocolate.

Transcription

3758 Words, 20625 Characters

Spanish
[Música] Bienvenidos a Kibina Puyidas, el podcast de Mercado de Libre, donde hablamos sobre tecnología, desafíos y experiencias dentro de la compañía. Mi nombre es Juan Rossi, y estoy con Martin Cirusi, quien es líder del proyecto de Medidad, y Pymes. Martin, bienvenido, que es de Juan Todell. Bien, por suerte, gracias por sumarte. Queréis contarnos un poquito quién sos. Bueno, para que yo que no te conocen. Dale, sí, obvio. Bueno, como dijo mi nombre es Martin Cirusi, soy ingeniero de la FUA, Inche de San Lorenzo, ahí por la Turalesa, y trabajo en Mel y básicamente es unos 3, 4 años, entonces yo sí me he de yo creo. Nada, entre como desarrollador, semi-senior, nada, como un Java, Diverlo, pero casi que cual un que, cuando entraste, ¿qué proyecto entraste? Entre el hecho en el primero que mencionaste es que es el proyecto de Mel yata, y ya es Mel yata. Bueno, Mel yata en sí es básicamente, como no vamos a resumir, el proyecto de big data de la compañía, o uno de los que más volumen de datos tiene, básicamente busca conocer que hace un poco nuestros usuarios, recolitar esa información y poder encima de eso hacer productos para mejorar su experiencia día a día, ¿no? Entonces, nosotros grabamos básicamente de la recolección de esos datos, el procesamiento y la disponibilización hacia productos propios y productos de otros inipos de mercado libre, ¿no? Claro. Y cómo fue, digamos, el proceso de voz saliste, digamos, de la facultad a tu isto, un trabajo antes y después se entró hasta la mañana. Sí, sí, dice una pasantilla, si después que defectivo en Oracle y después de un par de años ahí trabajando, creo con dos tres años, entre a Mel y por un conocido también del mismo trabajo, ¿no? Claro. Bueno, que esa fue como ingresa. Y cómo fue, digamos, venías, digo, conocidas, también trabajando en hora, por ahí venías manejando a veces, pongo volumen de grandes datos. Sí, pero en el estilo, pero imagino que salió distinto de lo que era, es primero una cultura de realmente diferente, es ingeniería que ver y le habrá que trabajar en un producto muchísimo más acotado, ¿no? En mercado libre un poco, vamos por un producto de contraloval, en enero que el que hubo decidió bueno che, acabo de trabajar en productos base de datos y este es tu producto, este es tu scope. Claro. En mercado libre, hay una visión poquito más global de eso y, de hecho, por el proyecto de en cuatro trabajos, como que tengo conexiones con todas las salistas de Mel y no de mercado de envío, mercado pago, mercado libre, marketplace en sí. Y cómo funciona hoy mi medida, digamos, ustedes, sus focos es más lo que, como decía, es la recorrección y de herramientas a los desarrolladores para que puedan recorrecar y entender cómo se comportan los usuarios dentro de la plataforma, o aparte hacen un poco de la análisis de esa data, un poco de todo. A ver, el gran objetivo es que Mel y pueda ser mejores productos a partir de sus datos, ¿no? Y eso puede ser algodismo de recomendaciones, de ser, digamos, reaccionante eventos para rápidamente podemos comentarte, a una vea que nos parezca importante en el sitio y digo, algunos de los productos son de otros equipos de Mel y otros son internos como, por ejemplo, nuestra plataforma de evitesting, ¿no? Que te permite a cualquier, o le permite cualquier desarrollador de mercado libre, pero har una idea, decir que el famoso caso de evitesting, no quiero ser simplista, pero decirle che si el botón mostrarles los botones en el momento de comprar un botón rojo y un botón azul, ¿no? Es un poco obvio que, o a la sensación de que el botón azul va a ser la opción que mejor converse o genere, pero otros casos podrían no ser tan obvios. Y lo que le permitimos es al tipo probar esas dos variantes y darle un un veredicto de cuál han duro mejor, ¿no? ¿Cuál generó más compras, más ventas o, bueno, cualquier otro sindicado que haya en el mercado libre en sí. ¿Y qué volumen de datos se manejado bien en mi lidata? Bueno, a ver, para tener una idea más o menos, estamos recolectando algo así como 1200 millones de eventos diarios, eso, digamos, termina siendo algo así como un terreno de datos comprimido por día, básicamente. ¿Montón de información? No sé, diamánic dupero, pero si realmente y ni siquiera somos quizás de las apes que más traficoración en mercado libre, así que tal lo cual y cómo es un equipo grande que tamaño no tiene, ¿no? Y bueno, cuando empecé deramos tres personas y hemos crecido a una seis y siete personas hoy en día, o sea, es un equipo chicos podría decir intermedio para normal digamos el tamaño para el entro de lo que es mercado libre para ir por una iniciativa total, pero estaba digamos, tiene una responsabilidad enorme para hacer tampoco a personas. Sí, tiene un impacto grande y tiene mucho, digamos, dentro de la compañía, está buenísimo y digamos, el equipo está todos en Buenos Aires, acá en Argentina, o cómo se organizan. Sí, sí, hoy estamos todos en laficina de áreas, próximamente, por los dotos ahora que si inauguró y creo que siempre tenemos ahí, tenemos colocados todos en este caso. En el caso de Meliet, ¿no? Bueno, y cuando te presentó uno de los proyectos con los que me has contado que estaba trabajando en la pímesa, pero ¿qué es pímesa? Bueno, sí, pímesa es haberla sigla, tiene que ver con pesos y medías, ¿no? Aunque mucho piense que tienen que ver más con pequeñones empresas, hacemos con un doble sentido ahí, pero en este caso no tiene nada de ni de pequeño ni de medial, ¿no? Y bueno, pímesa básicamente se encarga de estimar de la mejor forma que podamos, ¿cuánto va a pesar y medir precisamente un item de mercado libre? Y esto tiene muchos objetivos, el principal es ser lo más justos posibles con toda la división de mercados con nuestros seres, digamos, y nuestros baías en la división si quieres más de mercado en vio, ¿no? Lo que buscamos ser es lo más justo posible para cobrarle al que vende un piano, el costo de un piano que, típicamente, es alto y al que venden a piotite tenis, vendenle, digamos, cobrarle a corde, ¿no? Así funciona nuestros carrios con nosotros y de una forma así queremos funcionar también de forma justa con nuestros usuarios, tal cual digo, uno por ahí esperaría siempre que fuese de esa forma cual está perfecto pero imagino que debe ser que vea una complejidad que uno suma de preso en vio, lo metes en una caja y listo, como por eso digo que el problema es fácil denunciar, ¿no? Pero mercado libre tiene millones de items y no es tan fácil como, bueno, no se poner ahí manualmente a decir, esto es una piotite tenis, pesa en el orden de los gramos y este es un piano, es algo que no escala, ¿no? Y algo que sería muy fácil, sería, por ejemplo, usar lo que me acabo de ir son las categorías, no es el chip, los televisores, más o menos, van a a pesar y medir, no sé, cuándo pesa un televisor, kilos, cinco kilos, menos, bueno, sí, con todos ponente que sea el hecho es que hay televisores de 14 pulgadas y de el cual no se ve ya está, 70, 80 pulgadas y seguramente ahí ya no se lo mismo, ¿no? Exártelo, entonces, soluciones básicas, hay un montón, tal cual, y no solo como decidas, no solo el peso, sino que el tamaño te va a cambiar mucho la caja donde viene que ir eso, como tiene que ser tratado de ese producto, digo, imagino que algo de un valor un poco más alto, tal vez se ha tratado de una forma más frágil, o tenga algún otro tipo de costo o algo en el envío. Por eso digo que el problema se denuncia muy fácilmente, la resocione es mucho más difícil y si querés estar magnífica por el cable europeo con un montón de carros distintos, decenas de ellos, que todos tienen particularidades distintos, o perro un montón de países, que también tienen particularidades distintas y por si fuera poco digamos, hoy ya está cansando el millón de envíos diarios, ¿no? Claro. Entonces, bueno, eso le da una complejidad extra, casi a cualquier problema que enfrenta. Sí, tal cual. Y veamos como un asio de equipo, pues imagino que esto me dio desde los comienzos de mercado libre donde se hacían envíos de una forma su tenia que hacer como entraste o sea en la ecuación de ambos de esto. Bien, el año pasado básicamente, bueno, por el crecimiento que estamos tenemos teniendo en mercado libre, se decidió como crear un equipo que tuviera especial foco en la estimación de percimedía, ¿no? Lo venía haciendo el equipo de mercado envíos como algo global, pero ya te digo, resolviendo de la mejor forma que podían, pero no con el foco de, no sé, la repente utilizar técnicas de machine learning para poder estimar su percimedidas o o, bueno, de poner recontra foco en un problema que lo necesita, ¿no? Y así es como, digamos, tomando prestado a algunas personas de diferentes equipos, se creó el equipo de unas tres cuatro personas que empezó a trabajar en este problema, ¿no? Un poco partiendo esta solución, si querés base, que podría ser, che, un baseline, trabajemos con estimar en base a la categoría, que de alguna forma era la norma en ese momento. Y bueno, entonces fuimos tratando de tomar, digamos, solución es un poquito más complejas para mejorar al fin y a cabo algo que es muy fácil de medir, ¿no? Que es la precisión de cuánto estimamos que va a empezar un intememeli y cuánto efectivamente termina pesando. ¿Ok, y en el equipo grande, el que se formó? Bueno, se fue formando medio en este último año y fue tratando de un de gente, ¿no? Digo, pedimos gente que trabajo con nosotros gente del equipo de Vista Intelligence de la Narcabaligria, gente del equipo más core de Machine Learning y obviamente la gente de Shipping que viene trabajando en eso y de ese mix empezó a surgir un equipo que hoy en día ya básicamente somos como 10 personas, algunas mitad del equipo están en Buenos Aires y la otra mitad está en Córdoba y bueno trabajamos con muchísimo foco y ya digamos haciendo algo dimos un poco más complejos para poder estimar este producto. Y vos venías digamos de un iniciativo en la cual ya estaba trabajando con data y tenías de foco pero ahora cambia este algo que si bien tenéis que trabajar el tenés el desafío de entender un montón de datos y ver cómo justamente a partidos, los datos, las decisiones correctas para lo que son los pesos y las medidas los envíos pero imagino que fue un desafío, un cambio de turado, cómo fue eso. Si el como denominador de dos proyectos es que trabajamos con datos pero al fin y al cabo son dos unidades distintos de mercado envíos, conociamos poco y nada y tuvimos que ir aprendiendo el camino desde toda operación de mercado libre de mercado envío, disculpa y bueno fue un proceso, como todo cambio todo challenge desafío al principio te sentís como bueno no sé cómo voy a resolver esto, pero en equipo y de una forma crean ideas, llegamos a la verdad que tener un buen impacto medio bajando un poco también los costos de envío para dentro de sus usuarios y me he fin a cabo como te dije, siendo más justo. No está buenísimo y creo que va mucho con lo que la compañía siempre trata de impulsar el hecho de decir bueno tomemos riegos, empezamos a trabajar en cosas nuevas y sepamos que puede salir mal pero estamos poniendo todas las fichas en que sale bien y siempre hay mucho apoyo dentro de la compañía para eso. No olvides de que yo estoy acá pero en realidad ya fue un equipo que tenía todo el mismo incidente incertidumbre, decir bueno como podemos hacer, tratamos de hacer algunos baseline básicos para poder decir un buen impacto más o menos rápido, un moderno rápido, tratar de generar valor lo más rápido posible, pero sí, desde ese día hoy que tenemos un montón de incertidumbre sobre cómo vamos a resolver todo una serie de problemas, asociados a los pesos inmedias, ¿no? Hoy en día entiendo que ya hay ciertas cosas que están implementando y que están teniendo resultados, cómo fueron en cargamos en esa problemática y que forma hoy en día está funcionando eso. Bueno básicamente Melyk como decir vos tiene un montón de datos, ¿no? De los pesos inmedias, algunos de su propia operación, otros datos que digo de su propia operación de por mercadolire pasan baquetes, se pueden empezar y medir aunque sean un millón, no olvides de los centros de distribución y totalmente, también tenemos información que algunos cargamos, algunos operadores o socios de mercadolire también nos dan, entonces bueno a partir de toda esa data lo que empezamos a hacer es tratar de empezar a usarla para poder predecir, ¿no? Y en algunos casos es bastante sencillo porque quizás vos juan tener este televisor y le diste mil veces y es muy fácil tener la estadística de cuánto pesí medio en cada caso, pero se suma nuevos vendedores y no os comproves todo el tiempo, ¿no? Y si yo me pongo a vender el día mañana, bueno, mi mesita de luz que tenía en día, ahí en mi casa y que la quiero vender, mercadolire no tiene ninguna forma de saber cuál es el pesí medio de ese item, ¿no? Así que cómo vamos a ofrecer a temercar en bios, si nos sabemos a qué precio te lo podemos cobrar, ¿no? Y ahí es donde empieza a jugar, empieza a ampliar la vanico de soluciones para tratar de estimar, yo me mirá este mesita de luz, es muy parecida a todas estas otras mesitas de luz que vendimos y que tenemos en nuestra historia y que bueno, tuvieron estos pesos y medidas. Claro que ahí le digamos también toma en el input obviamente que da el vendedor de cuánto viene en los productos y ese tipo de valores, digamos, hoy en día no, lo conocemos, pero en general eso es, digamos, hay que tener una cierta medida de confianza, ¿no? Porque vente, si abrí, si lo primero que me preguntaste es, ¿che cuánto vende podría pasar que no ingrese correctamente ese dato y digamos alguna forma hasta fomentar el fraude, ¿no? De decir, ¿che, el tipo de vendedor de luz y dice que empieza a dijeramos? Bueno, hay que ponerle a una capa para establecer confianza en ese dato que hoy todavía no existe. Tal cual y hoy digamos, por lo que me decía, o sea, toman todos esos datos históricos, pero cómo eliminan, digamos, de las ecuaciones, los casos donde antes de tener como la anomalía se quiere, a Link de Kargo Maldito, o qué input digamos para el toman de los centros de distribución para decir, no, esto está sin corrector, lo estoy mandando una caja mucho más grande como mejor a su afutura. Tal, a ver, todo, hacer muchos esos humanos nobles, siempre están, digamos, los datos siempre pueden estar viseos de errores y en general eso sucede, digo, en laboratorio o cualquier día que este problema tiene, tendiendo que ver, está mucho más sencillo si los datos ya de entrada fueran siempre correctos, lo cual no es el caso. Y bueno, y uno aprendiendo cosas, ¿no? A ver cómo manejar esos olairs, como saber que si venís teniendo un promedio de 10 kilos y llegar algo de 50 kilos y probablemente no tengas que creerle eso. Pero además, digo, no sea, aprende a eliminar cosas más livianas que la idea o cosas más pesadas que el plomo, porque en general son cosas que no tienen razón de ser, no? En general son errores humanos. Y bueno, así vamos perfeccionando y uno de los desafíos más grandes que tenemos es poder taguero o de alguna forma saber cuánt buen o mal es un pesaje, si, si, si, a ver si usarlo o no para nuestros algoritmos. Y además creo que eso es, es un una variabil de extra, digamos, en marcado libre una de las funcionalidades que se le dieron ya hace unos cuantos meses, son los exclusivos y venios, es la posible que llamamos carrito, el hecho de que puedas comprar más de un producto, digo, si esos productos los creen van a dar en una misma caja, no es, no es línea, digo, hay productos por ahí, por más que por peso si medidas te entran en una caja, por un tema más volumétrico, no, no necesariamente van juntos. No entiendo todo ese problemático, se llama Bingpack y eso también como entra por ahí en la ecuación. Bueno, el equipo de Bingpack y no bien días es un equipo separado y que de una forma cenuta del input de nuestro proyecto de peso si medidas, no, como así es, le meto otra otra dimensión de complejidad más, que es decir, bueno para, yo para ahí no, no solo vendo mi mesita de luz, sino que le abendo al compañía del velador y quiero saber si pueden entrar en la misma caja. Eso es otro problema de otra complejidad también muy grandes y necesita tener buenos datos para, pues, estoy madrío, si ya debase no puedes estimar la volumetría de las dos cosas por separado, menos hasta poder saber si van a entrar juntos en la misma caja y además hay toda una serie de restricciones bastante fuertes para, de repente no sé saber que la comida no puede ir en el mismo, en la misma caja que un sillon, porque si se abre el paquete de llerva, vamos a manchar toda la disillun, si que son dos problemas recomplejos, de una forma están interconectados y uno sirve o el nuestro caso, servimos de input al siguiente, bueno, en este caso de la solución de otro equipo de mail, está buenísimo y como por ahí veo a veces que entiendo que teniendo un centro de distribución propio, la velocidad de esos envíos es algo súper importante, yo compro que quiero que me llegue lo antes posible y a esa variable supongo que a veces se suma el hecho de que no siempre se elige la caja correcta y a futuro digamos que obviamente hay un montón de desafíos por delante, pero cuáles son para ellos donde más foco están haciendo ahora, ¿a qué cuáles son los desafíos que ven a futuro más cercano? A ver, en el proyecto de PIMES en particular, como veía, atravesamos la primer 20% del problema más fácil o que más fácil, genera, podemos generar impacto y ahora nos empezamos a meter como en el otro, en la otra proporción del problema donde ya las ideas convencionales o los fases ya le hemos explorado y donde tenemos que salir a estimar sobre items que no tenemos historia, sobre items con particulares ya recontra específicas o con un ruido enorme a nivel estadístico, sí querés. Y ahí es que otra vez profundizar el ingenio y otra vez quizás ya no lo vas a poder atacar el problema de forma estadística y debajo de empezar a basar en modelos de Machine Learning para decir, bueno, estimar de la mejor forma que puedas, sé que no tenés datos, sé que no tenés historia de este item, pero trataba de encontrar las conexiones, las correlaciones con otra parte de la data para poder estimar de la forma que puedas esto y otra vez que se parezca o que tenga la precisión de los otros algoritmos que ya teníamos su producción, ¿no? Bueno, siempre nos gusta para ver si está del tema. de dar un cierre a las entrevistas, de hacer un ping-pong de preguntas y respuestas, te voy a hacer algunas preguntas, decimos lo primero que se te venía a la cabeza y. ahí vamos, vamos viendo que sale, dale. Primera pregunta, "¿Penguaje favorito y por qué?" Bueno, casi por historia en el "Hallel" y "Ve lo perjaba", en el "Trabajenora" que él. después fue comprado, ¿no? "Hallel" por hora que. si que sea de mi, mi bugagro, no sé si bueno, tipo pisa firme, pero ahora que he perdido de todo, después digo, en "Marcabalíude" se trabaja con un montón de tecnologías y como dije, che, entre como un comodity, a "Marcabalíude", che. eso es un nivel de perjaba, aprendimos de una cosa, digo, desde Python, Go, JavaScript. bueno, no, ya iré, si querés, como parte del stack, un poquito de todo. Si no estuviese trabajando en un noit y que estarías haciendo. Bueno, soy medio enfermo de fútbol, así que. me hubiera gustado ser jugado de fútbol, y este fútbol, y este frustrado, como gran parte de la Argentina, pero. Ah, imposible. Un emoji que perrepercente o que más suces, me uso mucho el que se golpea la cabeza así. Ah, muy bien. Está bueno. Videojuebo favorito, no sé si te gustan, jane, al jugar, pero. hace rato que no juego de chico, juego a FIFA, contra Strake, ese tipo de cosas con los diversos, ¿no? Claro, pero ahora se hace bastante que no juego. Bueno, eso. Y. última pregunta y para de para cerrar un poco tanto vista. Algo de para ir, no todo el mundo sabe, y que te gustaría compartir. (Risas) Si ve. Bueno, no me gusta el chocolate, así que. o sea, eso me hace bastante distinto del resto de la población. La verdad es que sí. Creo que esa es la primera persona que. que conozco que no. que no le gusta el chocolate y no por una cuestión de que le haga mal. Otro día es de buen de distancia, porque. (Risas) Está buenísimo. Bueno, partid, muchas gracias por su muerte y estuvo buenísimo a todos los ganos contaste. No, gracias, fue muy buena próxima. Bueno, gracias a todos por escucharnos, pueden encontrar el resto de los episodios en mercadoelibre.com, barra, postcas y esperamos encontrarlas para la próxima. disima del próximo episodio que hagamos. Gracias. (Música)

Podcast Summary

Key Points:

  1. Martín Cirussi es líder de los proyectos Melidata (big data) y PIMES (estimación de peso y medida de productos) en Mercado Libre.
  2. Melidata recolecta y procesa 1200 millones de eventos diarios para mejorar la experiencia del usuario mediante productos como A/B testing.
  3. PIMES busca estimar el peso y tamaño de los ítems de forma justa para los vendedores, usando datos históricos y técnicas de machine learning.
  4. El equipo de PIMES creció de 3 a 10 personas, con miembros en Buenos Aires y Córdoba.
  5. Entre los desafíos futuros están estimar ítems sin historial, manejar datos erróneos y coordinar con el equipo de Binpack para optimizar envíos combinados.

Summary:

En este episodio de Kibina Puyidas, Juan Rossi entrevista a Martín Cirussi, ingeniero y líder de los proyectos Melidata y PIMES en Mercado Libre. Martín explica que Melidata es un sistema de big data que recolecta, procesa y pone a disposición datos de usuarios para crear mejores productos, como pruebas A/B, manejando 1200 millones de eventos diarios. Por otro lado, PIMES (Pesos y Medidas) se enfoca en estimar de forma precisa el peso y tamaño de los productos para cobrar tarifas de envío justas, evitando soluciones simples como usar solo categorías.

El equipo comenzó con tres personas y hoy cuenta con diez, distribuidas entre Buenos Aires y Córdoba. Martín destaca que el principal desafío es predecir ítems sin historial, usando machine learning y datos de centros de distribución, mientras se filtran errores humanos. También menciona la colaboración con el equipo de Binpack para optimizar envíos de múltiples productos en una misma caja.

Finalmente, en un ping-pong de preguntas, Martín revela su lenguaje favorito (Java), su pasión frustrada por el fútbol, su emoji preferido (el que golpea la cabeza) y que no le gusta el chocolate.

FAQs

Melidata es el proyecto de big data de Mercado Libre que recolecta, procesa y dispone datos de los usuarios para mejorar su experiencia. Su objetivo es crear mejores productos a partir de esa información.

Melidata recolecta alrededor de 1200 millones de eventos diarios, lo que equivale a aproximadamente un terabyte de datos comprimido por día.

PIMES (Pesos y Medidas) estima el peso y tamaño de los ítems en Mercado Libre para cobrar envíos de forma justa. Busca ser preciso con millones de productos, desde tenis hasta pianos.

PIMES usa datos históricos y modelos de Machine Learning para encontrar correlaciones y estimar ítems nuevos. También considera información de centros de distribución y operadores.

Los vendedores pueden ingresar datos incorrectos o fraudulentos sobre peso y tamaño. PIMES debe establecer una capa de confianza para filtrar errores y anomalías.

PIMES proporciona datos de peso y volumen a Binpack, que decide si varios productos pueden enviarse juntos en una misma caja. Esto añade complejidad por restricciones como evitar mezclar alimentos con otros artículos.

Chat with AI

Loading...

Pro features

Go deeper with this episode

Unlock creator-grade tools that turn any transcript into show notes and subtitle files.