}

Idealista18: Un conjunto de datos abierto

En este artículo anunciamos la liberación de un conjunto de datos que incluye información detallada de más de 180000 viviendas en las tres principales ciudades españolas: Madrid, Barcelona y Valencia. Este conjunto de datos está disponible como un paquete en R y accesible a través de un repositorio público en GitHub.

El proceso de obtención del dato y la descripción del conjunto ha sido publicado en el artículo A geo-referenced micro-data set of real estate listings for Spain’s three largest cities. El conjunto de datos idealista18 incluye las coordenadas geográficas y precios de oferta de cada propiedad, así como características internas e información oficial del catastro español. Los datos están estructurados en diez objetos, que incluyen listados de viviendas con sus coordenadas geográficas y precios de oferta de cada inmuebles, polígonos de barrios en los que se localizan y puntos de interés para Madrid, Barcelona y Valencia. Adicionalmente, este conjunto de datos se ha enriquecido con atributos adicionales del catastro español y se han implementado métodos para asegurar la privacidad de los datos.

Los productos de datos abiertos representan un avance significativo en la investigación y análisis de datos, proporcionando conjuntos de datos estructurados, accesibles y listos para su uso. Los productos de datos abiertos (Open Data Products) facilitan la reproducibilidad y transparencia en la investigación, permitiendo a los investigadores y analistas de datos acceder a información valiosa sin necesidad de realizar procesos complicados de obtención y limpieza de datos. Esto es crucial en un mundo donde la transparencia y la accesibilidad a los datos son cada vez más importantes.

En este sentido, creemos que este conjunto de datos es potencialmente muy valioso para:
Análisis del Mercado Inmobiliario: Permite estudios detallados sobre precios de viviendas y segmentación del mercado.
Modelos de Valoración Automática: Ideal para probar y comparar distintas especificaciones de modelos hedónicos y de comparables.
Pruebas de Modelos de Aprendizaje Automático: Útil para desarrollar y evaluar modelos de Machine Learning aplicados al sector inmobiliario.
Análisis de Submercados: Facilita la identificación de submercados de vivienda.

Uno de los primeros estudios en utilizar este conjunto de datos para la investigación reproducible es el artículo Using machine learning to identify spatial market segments. A reproducible study of major Spanish markets. Este artículo presenta un método automático de identificación de submercados de la vivienda para su utilización en modelos de valoración automática (AVM, por sus siglas en inglés).

Mapas de Barcelona y Madrid mostrando segmentaciones de mercado de la vivienda
Mapas de Barcelona (izquierda) y Madrid mostrando segmentos de mercado del artículo anteriormente citado

Los modelos de valoración automática son herramientas fundamentales en el mercado inmobiliario, ofreciendo valoraciones rápidas y precisas de propiedades. Estos modelos son esenciales para inversores, entidades financieras, propietarios y compradores, ya que facilitan decisiones informadas y transacciones más equitativas. En Idealista, llevamos años trabajando para ofrecer las valoraciones automatizadas más avanzadas en España, Italia y Portugal, utilizando métodos como el análisis hedónico y por comparables para proporcionar valoraciones basadas en datos actuales e históricos. Estos sistemas de valoración automática son componentes fundamentales de servicios como los proporcionados por idealista/data e idealista/maps.

El conjunto de datos idealista18 no solo puede aportar al movimiento por la reproducibilidad del conocimiento científico, sino que también ofrece una oportunidad para que estudiantes y aspirantes a analistas de datos amplíen su experiencia con datos reales y complejos. En este sentido, idealista18 ya ha sido utilizado en distintas ediciones de programas de formación, siendo útil para proyectos de fin de máster y grado así para científicos de datos principiantes que dan sus primeros pasos en la realización de análisis detallados y el entrenamiento modelos de Machine Learning.

En Idealista, estamos comprometidos con la transparencia y la accesibilidad de los datos, como demuestran los Indices de Precios que llevamos publicando desde hace años y ahora este conjunto de datos que esperemos que sea de utilidad tanto para investigadores como educadores de Econometría, Análisis y Ciencia de Datos.

Deja una respuesta