service-extraction — la canalización de ingesta del DataGraph
service-extraction vigila un directorio en busca de cargas útiles JSON entrantes y convierte cada una en un registro duradero de libro mayor. A diferencia de un componente del Anillo 2 que clasifica los datos por sí mismo, consume entidades que ya han sido clasificadas — su carga útil de entrada lleva un campo edge_entities, poblado por inferencia de IA local basada en WASM antes de que la carga útil llegue siquiera a este servicio.
El ciclo de vigilancia y escritura
Ejecutándose como un vigilante del sistema de archivos, el servicio recoge cada archivo JSON nuevo depositado en su directorio de vigilancia, identificado por un worm_id derivado del nombre de archivo. Para cada carga útil:
- Lee las
edge_entitiesya clasificadas y construye un conjunto de entidades listas para el grafo a partir de ellas. - Escribe esas entidades en un registro de libro mayor
CRM_<worm_id>.json, archivado bajo el servicio objetivo nombrado en la propia carga útil — el objetivo no está fijo a un solo servicio posterior, es lo que la carga útil especifique. - Si hay configurada una ruta de emisión de corpus, también escribe un segundo archivo separado,
CORPUS_<worm_id>.json, con el texto en bruto de la carga útil — un archivo puente que service-content — extracción de entidades y alojamiento del grafo de conocimiento vigila de forma independiente, alimentando ese texto a su propia canalización escalonada de extracción de entidades para el grafo de conocimiento.
Las dos salidas cumplen propósitos distintos: el libro mayor CRM es el registro de entidades estructuradas para el servicio objetivo propio de la carga útil, y el puente CORPUS es lo que permite que el mismo texto también alimente el grafo de conocimiento general de la plataforma, sin que este servicio necesite saber nada sobre cómo ocurre esa extracción más adelante.
Lo que no hace
Este servicio no ejecuta su propia clasificación de IA — las edge_entities que consume llegan ya etiquetadas. No analiza formatos de documentos binarios (PDF, DOCX, XLSX) — eso es una canalización separada y dedicada. Y no mantiene una matriz de enrutamiento de propósito general por tipo de contenido; cada carga útil simplemente nombra su propio servicio objetivo.
Véase también
- service-content — extracción de entidades y alojamiento del grafo de conocimiento — vigila los archivos puente CORPUS que emite este servicio y ejecuta su propia extracción escalonada sobre el texto
- service-people — el servicio de libro de identidades — un servicio objetivo común para los registros de libro mayor CRM que escribe este servicio
- Ingesta de correo — una fuente ascendente típica de las cargas útiles JSON que este servicio vigila
Cite this record: /wiki/service-extraction — revision f173f6b4, last updated 24 August 2026.