Repositorios de entidades personalizados en el Gráfico de Conocimiento de Google
Origen del gráfico de conocimiento y sus evoluciones
En 2006, Google patentó un sistema precursor del actual **Gráfico de Conocimiento**, un repositorio de datos navegables que asociaba números de identificación a entidades. Este proyecto, liderado por Andrew Hogue y gestionado tras la adquisición de **MetaWeb** y **Freebase** en 2010, sentó las bases para la evolución actual. La reciente patente de Google, presentada en julio de 2020, describe un “Repositorio de entidades personalizado”, con un nivel de detalle superior al de su predecesor, reflejando el avance en la forma en que Google maneja la información y los hechos.
Extracción de entidades y la estructura sujeto-verbo-objeto
Google ha refinado sus métodos para extraer información de entidades de páginas web. Utiliza el formato **Sujeto-Verbo-Objeto** para representar estas relaciones, como “Bryce Harper juega béisbol para los Filis de Filadelfia”. Esto permite identificar atributos (fecha de nacimiento de Bryce Harper) y clasificaciones (Bryce Harper es un jugador de béisbol profesional). Inicialmente, Google se basaba en bases de conocimiento como **Freebase** y **Wikipedia**, pero ahora explora fuentes más amplias en la web para escalar su recopilación de datos.
Minigráficos de conocimiento y la personalización
Google ha introducido la idea de **minigráficos de conocimiento**, creados para responder a consultas específicas, e incluso ha explorado la creación de **gráficos de conocimiento específicos del usuario**. Esta última patente, publicada a finales de 2019, permitía agrupar estos gráficos personalizados (sin información identificable) en un gráfico universal. El desarrollo de gráficos de conocimiento personalizados es un área clave de investigación para Google, con el objetivo de mejorar la relevancia y precisión de las respuestas.
El propósito del repositorio de entidades personalizado
La patente describe un sistema que, al comprender el contenido que consume un usuario y sus acciones, puede ofrecer una experiencia más personalizada. Esto implica identificar y clasificar las entidades presentes en el contenido de la pantalla, almacenándolas en un **repositorio de entidades**. Estos repositorios pueden contener millones de entidades, y suelen ser accesibles a través de una conexión a un servidor, especialmente en dispositivos móviles con almacenamiento limitado.
Ventajas de un repositorio de entidades personalizado
La creación de conjuntos fijos de entidades permite ofrecer repositorios personalizados de forma escalable. Esto facilita el análisis de texto e imágenes en el dispositivo, incluso sin conexión a la red. El sistema puede gestionar los recursos asignados al repositorio, predecir qué conjuntos son más relevantes (basándose en la ubicación, hora, actividad reciente, etc.) y controlar las versiones de los paquetes de datos para evitar interrupciones en las aplicaciones.
Estructura y funcionamiento del repositorio personalizado
El repositorio se organiza en conjuntos fijos: **basados en la ubicación**, **temáticos**, **basados en la acción** y **funcionales**. Google puede determinar estos conjuntos en un servidor y enviarlos solo a los dispositivos relevantes. El dispositivo incluye un motor de identificación de conjuntos, que utiliza un modelo de predicción para determinar los conjuntos más beneficiosos, considerando factores como la ubicación y el historial del usuario. Estos conjuntos pueden clasificarse y actualizarse dinámicamente para optimizar la experiencia del usuario.
Ejemplos de uso y aplicaciones prácticas
Un ejemplo es la búsqueda de un viaje a Hawái, donde el sistema determinaría la relevancia de un conjunto de entidades relacionadas con Hawái. Otro ejemplo es la identificación de ubicaciones relevantes al volar de Nueva York a Los Ángeles. El sistema puede utilizar las clasificaciones para determinar qué conjuntos recuperar y cuáles eliminar de la memoria, optimizando el uso del almacenamiento del dispositivo. El sistema también puede predecir acciones, temas o frases que puedan ser de interés para el usuario.
Conclusiones y futuro del desarrollo
Este repositorio de entidades personalizado representa un avance significativo en la capacidad de Google para ofrecer resultados de búsqueda y asistencia más relevantes y personalizados. La combinación de bases de conocimiento, información de imágenes y aprendizaje automático federado, podría permitir a los dispositivos Android ofrecer una experiencia más inteligente y adaptada a las necesidades individuales. La futura integración con el aprendizaje automático federado promete mejoras en la actualización y personalización continua del repositorio.
