Nota · 2 min de lectura

Aprender un precio y explicar un precio

En Invisor he probado CatBoost y Gemini para valorar inmuebles. La comparación me lleva a separar la extracción de datos, la predicción numérica y la explicación.

Qué le pido a cada modelo

Un anuncio mezcla datos, fotografías y frases comerciales. Un LLM puede ayudar a convertir ese material en campos utilizables: superficie, estado, planta, ascensor o restricciones. Cuando le pido una estimación, también puede construir una explicación convincente. Pero esa explicación no mide el error del precio que propone.

Usé Jev para etiquetar 50.000 inmuebles que tenía en la base de datos. Ese dataset permite comparar inmuebles por sus características y entrenar CatBoost para aprender cómo se relacionan con el precio. También he comparado predicciones de CatBoost y Gemini. Una de las líneas de ML parte del precio por m² de la zona y entrena una corrección según las características del inmueble. Así puedo comparar lo aprendido con una base sencilla y comprobar qué añade el modelo.

La elección depende de la prueba

Los experimentos no dieron un ganador universal. Gemini mostró buenos resultados en muestras pequeñas que no se mantuvieron al ampliar mercados. Añadir atributos a CatBoost tampoco mejoró siempre los errores grandes. Algunas medianas sencillas funcionaban mejor.

Por eso separo tres trabajos: extraer hechos, calcular y explicar. La generación ayuda a interpretar información desordenada; una predicción numérica tiene que evaluarse contra datos reservados. Su explicación se escribe después del cálculo.

Entrenar un modelo obliga a concretar qué quiero predecir, qué datos tengo y cómo mediré el error. El objetivo de la predicción es el precio anunciado. Una buena prueba sobre esos precios no demuestra que el modelo conozca los precios de cierre ni cuánto aporta una reforma.

← Volver a Notas