Trabajar con datos públicos de la Administración española puede parecer sencillo hasta que una API devuelve una respuesta inesperada, un CSV usa otra codificación o un municipio necesita un identificador interno que no aparece en la documentación. Un nuevo proyecto abierto en GitHub intenta reunir esas peculiaridades en un único catálogo pensado tanto para desarrolladores como para agentes de inteligencia artificial, con más de 100 fuentes documentadas, verificaciones periódicas y código listo para reutilizar. Repositorio Administración fuentes públicas

Las claves de los datos públicos españoles para devs y agentes en 30 segundos

  • El catálogo ya reúne 102 fuentes de datos y documentación sobre cómo acceder a ellas y qué errores aparecen en la práctica.
  • Cubre legislación, Hacienda, contratación, subvenciones, estadística, energía, transporte, sanidad, medio ambiente y otros sectores.
  • Las fichas incluyen las trampas que no suelen aparecer en la documentación oficial, desde cabeceras obligatorias hasta límites silenciosos.
  • Para agentes ofrece llms-min.txt, llms.txt, un catálogo completo y un servidor MCP que carga solo la información necesaria.
  • El proyecto usa CC0 y comprueba semanalmente las fuentes mediante GitHub Actions, mientras cualquier desarrollador puede aportar nuevos casos.

La idea parte de un problema muy concreto: que un dato sea público no significa que acceder a él sea sencillo. La documentación puede explicar qué contiene una fuente sin contar los detalles que determinan si una llamada funciona, si devuelve todos los registros o si el resultado es realmente el esperado.

El proyecto Administración fuentes públicas, desarrollado por BquantFinance, intenta cubrir precisamente ese hueco. Su planteamiento consiste en crear una ficha estructurada para cada fuente, con su ubicación, forma de acceso, formatos, ejemplos, identificadores y, sobre todo, los problemas que aparecen al consumirla en condiciones reales.

El repositorio asegura que las fichas se comprueban mediante llamadas reales y que cada fuente incorpora una fecha de verificación. El catálogo generado supera actualmente las 100 fuentes y el alcance ya incluye la Administración General del Estado, además de Madrid, Cataluña, Andalucía y Comunitat Valenciana y los ayuntamientos de Madrid y Barcelona.

Más de 100 fuentes organizadas por sectores

El proyecto no se limita a crear un listado de enlaces. La información se organiza por sectores y se convierte después en distintos formatos para que puedan utilizarla personas, programas y agentes de IA.

La distribución actual del catálogo es esta:

SectorFuentes
Gobierno abierto, transparencia y organización administrativa12
Ciencia e investigación7
Estadística oficial7
Transporte y movilidad7
Legislación y boletines oficiales6
Hacienda, tributos y presupuestos6
Sanidad y medicamentos6
Economía, finanzas y mercados5
Territorio, catastro y cartografía5
Medio ambiente, agua y biodiversidad5
Energía5
Agricultura, pesca y alimentación4
Comercio exterior, industria y propiedad industrial4
Demografía, migraciones y sociedad4
Contratación pública y subvenciones3
Empleo y Seguridad Social3
Educación y universidades3
Vivienda y urbanismo3
Meteorología y clima2
Cultura y patrimonio2
Justicia, interior y seguridad1
Telecomunicaciones y sociedad digital1
Consumo y seguridad alimentaria1
Exterior y cooperación0
Defensa0

La fotografía muestra además dónde está ahora mismo el esfuerzo. El catálogo concentra varias de sus fuentes en áreas como administración, estadística, transporte, legislación, Hacienda y sanidad, mientras que otros sectores todavía están pendientes de completar.

Entre las fuentes ya recogidas aparecen el Boletín Oficial del Estado (BOE), el Instituto Nacional de Estadística (INE), la Agencia Estatal de Meteorología (AEMET), la Plataforma de Contratación del Sector Público, la Base de Datos Nacional de Subvenciones, Catastro, SIGPAC, la Agencia Española de Medicamentos y Productos Sanitarios o los datos del Banco de España.

El repositorio también incorpora herramientas para combinar fuentes. Hay ejemplos para localizar subvenciones, seguir adjudicaciones, consultar información sobre empresas a partir de un NIF, elaborar perfiles municipales o consultar precios de carburantes y electricidad.

Las trampas que una documentación oficial puede no contar

La parte más interesante del proyecto está en los llamados gotchas y alerts, donde se registran comportamientos que pueden alterar una consulta sin que el programador reciba un error claro.

Uno de los ejemplos aparece en la Base de Datos Nacional de Subvenciones. La exportación puede devolver solo 50 filas aunque existan miles si no se envía pageSize. El problema no es que la API falle: devuelve una respuesta aparentemente válida que puede hacer pensar que no hay más datos.

El catálogo también documenta un problema de sincronización temporal. Para las concesiones de subvenciones, la fecha de concesión no serviría por sí sola para localizar correctamente las nuevas altas. El proyecto identifica fechaRegInicio como el filtro que permite seguir esas incorporaciones, aunque no esté documentado de forma evidente.

El INE presenta otro caso diferente. Para filtrar determinados datos municipales no basta con utilizar el código habitual del municipio. Algunas consultas necesitan un identificador interno de INE Tempus. Así, un código como 02001 puede tener que convertirse en otro valor, como 6124, para que la consulta funcione.

También hay diferencias entre organismos en los identificadores territoriales. El proyecto mantiene una tabla de equivalencias para los 8.132 municipios y relaciona códigos del INE con identificadores utilizados por SIGPAC, Catastro y otros servicios.

La capa técnica tampoco se libra de sorpresas. El catálogo documenta servidores .gob.es que proporcionan certificados FNMT sin la intermedia, lo que puede hacer que el navegador funcione mientras curl o requests rechazan la conexión. Para resolverlo, el proyecto incluye herramientas y una guía específica para clientes HTTP.

Las codificaciones ofrecen más ejemplos. Según las comprobaciones recogidas en el repositorio, algunos CSV de portales PC-Axis llegan realmente en UTF-8 aunque la cabecera indique ISO-8859-15, mientras que el CSV del SEPE puede utilizar Windows-1252 aunque anuncie UTF-8.

AEMET añade otro tipo de dificultad: determinadas consultas requieren dos pasos, los ficheros pueden utilizar ISO-8859-15 y algunos errores aparecen dentro de respuestas con código HTTP 200. Para un navegador, esto puede pasar inadvertido. Para un script, puede significar procesar como correcto un resultado que en realidad contiene un fallo.

El catálogo incluso recoge problemas semánticos. En el caso de GBIF, una consulta taxonómica puede devolver una cantidad de registros muy distinta dependiendo de la especie que se busque, sin advertir al usuario de que el nombre elegido no representa exactamente el conjunto esperado.

Del llms.txt al servidor MCP

El proyecto está diseñado desde el principio para que un agente de IA pueda utilizar la misma información sin cargar todo el repositorio en cada consulta.

Para eso ofrece varias capas. llms-min.txt proporciona una versión reducida de poco más de 8 KB para obtener orientación rápida. llms.txt amplía la información y llms-full.txt reúne el catálogo completo.

También existe un servidor MCP, siglas de Model Context Protocol, que permite que un agente consulte primero qué fuente necesita y cargue después únicamente su ficha. La instalación puede hacerse con uvx, evitando que el desarrollador tenga que construir toda la integración desde cero.

El repositorio explica además que hay cargadores en Python para CKAN, Socrata, PC-Axis, ArcGIS y OGC, junto con clientes específicos para BOE, BORME, BDNS, AEMET, INE, contratación pública y otros servicios.

La utilidad de esta capa no está solo en ahorrar código. El proyecto ha incorporado evaluaciones para medir si el catálogo reduce los pasos necesarios de un agente. Según sus propias pruebas, en tareas difíciles las llamadas HTTP y los pasos del agente se reducen aproximadamente a la mitad y las llamadas fallidas caen casi a cero. En las tareas con trampas silenciosas, el repositorio afirma que el rendimiento mejora de forma notable al introducir el servidor MCP y las alertas.

Son resultados internos del propio proyecto y no una evaluación independiente, pero apuntan a una idea sencilla: para trabajar con datos públicos, conocer de antemano las excepciones puede ser casi tan importante como conocer el endpoint.

Un catálogo que pretende crecer con la comunidad

El proyecto utiliza los archivos YAML de sources/ como fuente única de verdad. A partir de ellos genera índices, catalog.json y los diferentes documentos dirigidos a agentes. Esa separación facilita actualizar una fuente sin tener que mantener manualmente todas las representaciones.

Además, cada ficha incluye una fecha de última verificación y un proceso semanal mediante GitHub Actions para comprobar que las URLs continúan respondiendo.

La licencia del catálogo y su documentación es CC0 1.0, mientras que las fuentes de datos enlazadas mantienen sus propias licencias. Esa distinción permite reutilizar el trabajo del catálogo sin asumir que todos los datos públicos tienen automáticamente las mismas condiciones de reutilización.

El siguiente objetivo es ampliar la cobertura al resto de comunidades autónomas y entidades locales, además de las Cortes, el Poder Judicial y las fuentes de la Unión Europea. El proyecto también plantea mantener actualizadas las rutas y detectar documentación antigua que ya no conduce al servicio correcto.

La propuesta tiene un enfoque poco habitual para un directorio de datos públicos: no pretende limitarse a decir dónde está la información, sino registrar qué ocurre cuando alguien intenta usarla de verdad.

Para un desarrollador que trabaja con la Administración, conocer que una API existe es solo el comienzo. Saber qué cabecera exige, qué identificador espera, qué codificación utiliza o cuándo puede devolver una respuesta incompleta puede ahorrar horas de depuración. Y para un agente de IA, esa diferencia puede traducirse directamente en menos llamadas, menos errores y respuestas más fiables.

Preguntas frecuentes

¿Qué es Administración fuentes públicas?

Es un proyecto abierto que cataloga fuentes de datos públicos de España y documenta cómo acceder a ellas, qué formatos utilizan y qué problemas pueden aparecer al consumirlas.

¿Cuántas fuentes incluye actualmente?

El repositorio indica que ya hay 102 fuentes catalogadas, con cobertura de la Administración General del Estado y una primera ampliación a comunidades autónomas y ayuntamientos.

¿Cómo pueden usarlo los agentes de IA?

El proyecto ofrece llms-min.txt, llms.txt, llms-full.txt y un servidor MCP que permite buscar una fuente y cargar solo la ficha necesaria para resolver una tarea.

¿Se puede colaborar con el proyecto?

Sí. El repositorio invita a abrir incidencias cuando se detecta una nueva trampa o un cambio en una fuente pública. La documentación y el catálogo se distribuyen bajo CC0 1.0.

Fuentes:

Lo último

×