No. 12 · Technical

El stack de tecnología agéntica

Las plataformas en la nube, los modelos, las pasarelas y los controles que sustentan las cargas de trabajo agénticas de Alberta, así como los principios para seleccionarlos.

Abstract. Alberta ha evaluado una amplia gama de herramientas de codificación agéntica y plataformas de IA generativa. Es importante seleccionar el modelo adecuado, en el entorno adecuado, para el caso de uso adecuado, con una cadena de suministro deliberadamente diversificada para evitar la dependencia de un único proveedor. Las soluciones de IA de Alberta funcionan en un entorno híbrido que abarca Google Enterprise Agent Platform, Azure AI Foundry y AWS Bedrock, con un clúster de cómputo local para las cargas de trabajo sensibles. El uso de la IA se rige por la política de uso de IA de Alberta, el marco de gobernanza de IA y la Ley de Protección de la Privacidad. Estas tecnologías son dinámicas y evolucionarán al ritmo de las nuevas innovaciones impulsadas por la IA.
Para seleccionar las mejores herramientas con criterio, hemos evaluado una amplia gama de herramientas de codificación agéntica y plataformas de IA generativa. Lo que sigue es nuestro stack actual. Esperamos que cambie a medida que surjan nuevas herramientas, y nuestras decisiones se guían por un objetivo sencillo: el modelo adecuado, en el entorno adecuado, para el caso de uso adecuado. Hemos diversificado deliberadamente nuestra cadena de suministro de IA, tanto para contar con la capacidad como con la variedad necesarias para cubrir un amplio abanico de trabajos, y evitamos concentrar todas las cargas de trabajo en un único proveedor.


## §01 Cómo elegir las herramientas adecuadas

El sector avanza rápidamente y el liderazgo cambia cada pocos meses. Google lanza un modelo de imagen como Nano Banana 2 que resulta asombroso, y unos meses después OpenAI publica GPT Image 2, que vuelve a suponer un salto cualitativo. Mantenemos flexibilidad y usamos cada plataforma donde mejor encaja. Durante los últimos dieciocho meses hemos probado una variedad de modelos, alternando entre Gemini, OpenAI y Anthropic para la mayoría de los casos de uso. En este momento, la mayor parte del personal considera que los modelos Claude de Anthropic superan a la mayoría de los demás. Esperamos que eso cambie, y el stack está diseñado para adaptarse. Para el trabajo recogido en estos libros blancos, hemos dependido principalmente de Claude, los modelos Opus y Sonnet, pasando de la versión 3.5 de hace un año al Opus 4.8 actual. Los modelos evolucionan con rapidez, al igual que las herramientas e interfaces que usamos para acceder a ellos, con incorporaciones a Claude Code y otras aplicaciones de codificación que se renuevan prácticamente a diario.

Una capa de abstracción, como la pasarela Bifrost, nos permite trasladar una carga de trabajo de un proveedor a otro, o de la nube a nuestro propio cómputo, según cambien las necesidades y los precios. También mantiene el gasto bajo control, con presupuestos por carga de trabajo para que el consumo de tokens no se desborde. No recomendaríamos a ningún gobierno poner todos los huevos en la misma cesta; el sector avanza demasiado rápido para eso.


## §02 El stack

Alberta opera un entorno híbrido. Usamos las principales nubes de los grandes proveedores —Google, Azure y AWS—, junto con otras plataformas más pequeñas, y seguimos gestionando tres grandes centros de datos con sistemas heredados que alojan código, sistemas e infraestructura más antiguos. Ejecutamos modelos de código abierto en nuestro propio clúster de GPU y accedemos a modelos alojados a través de AWS Bedrock, Google Enterprise Agent Platform y Azure AI Foundry. Evaluamos de forma proactiva prácticamente cada modelo que aparece en el mercado: modelos de código abierto en nuestro propio hardware para cargas de trabajo sin conexión clasificadas como Protegido C, y una variedad de modelos abiertos que se ejecutan localmente en dispositivos Mac M5 de alto rendimiento. Nuestras cargas de trabajo principales se canalizan a través de AWS Bedrock y Google Enterprise Agent Platform.

La mayoría de nuestras cargas de trabajo agénticas basadas en la nube se despliegan actualmente en Google Cloud, mientras que nuestras aplicaciones tradicionales siguen funcionando en Azure y AWS. La contenedorización que hay detrás de esto se describe en el documento Nexus. También estamos evaluando Red Hat OpenShift para alojar más cargas de trabajo en nuestro propio hardware y aprovechar en mayor medida la capacidad de los centros de datos que ya poseemos.


## §03 Clasificación y residencia de los datos

El Gobierno de Alberta clasifica la información como no clasificada, Protegido A, Protegido B y Protegido C. Solo unos pocos sistemas contienen información Protegido C; la gran mayoría —noventa y nueve por ciento o más— contiene datos Protegido B como máximo. Gran parte del trabajo desarrollado con IA en estos documentos utiliza código heredado de propiedad gubernamental y arquitectura no clasificada, sin ningún dato personal en los sistemas de producción. Esto nos permite reimaginar cómo funciona el gobierno, con la IA como constructora de los sistemas del futuro, sin que la IA acceda ni observe datos de la ciudadanía a menos que sea genuinamente necesario.

Todos los datos vinculados a estas cargas de trabajo se gestionan en Canadá mediante nuestros acuerdos empresariales y las salvaguardas de las plataformas. Según la carga de trabajo, utilizamos cómputo doméstico o inferencia desde Estados Unidos, que es lo que los proveedores de nube ofrecen principalmente hoy en día. Estamos trabajando con todos los proveedores de nube para incorporar más hardware en Canadá y trasladar cada vez más cargas de trabajo a un entorno soberano, y seguimos de cerca la evolución de varios consorcios de cómputo soberano canadienses. Hemos publicado una solicitud de precalificación de Cómputo Soberano que invita a empresas íntegramente canadienses a colaborar en nuestro trabajo más sensible, y apoyamos el objetivo del Gobierno de Canadá de desarrollar el espacio de cómputo soberano. Para las cargas de trabajo de salud y seguridad, el control exclusivo de los datos por parte del Gobierno de Alberta es una posición innegociable.


## §04 Gobernanza y privacidad

Nuestras decisiones se guían por la política de uso de IA de Alberta y nuestro marco de gobernanza de IA, que establecen los criterios que debe considerar la función pública al adoptar la IA. La privacidad se rige por la Ley de Protección de la Privacidad de Alberta, que define dónde puede utilizarse la IA y cuándo el gobierno debe completar una evaluación de impacto en la privacidad y registrarla ante la Oficina del Comisionado de Información y Privacidad antes de proceder.

Resistencia a la inyección de instrucciones 95-98 %. Incluso los mejores modelos resisten los intentos de manipulación solo entre el 95 y el 98 % de las veces. Ningún modelo actual es inmune, por lo que se evita la IA de cara al público o se diseña de forma selectiva cuando se trata de información personal.

Somos deliberadamente cautelosos al introducir cargas de trabajo de IA orientadas al público. Ningún modelo resiste completamente hoy la inyección de instrucciones, y hasta los mejores solo evitan su manipulación entre el noventa y cinco y el noventa y ocho por ciento de los casos. Existen casos bien documentados de plataformas que han sido vulneradas y agentes que han sido engañados para realizar acciones perjudiciales en nombre de quien envió la instrucción. En la actualidad, los chatbots y asistentes de IA de cara al público, así como cualquier sistema que gestione información personal, se evitan o se diseñan y evalúan de forma selectiva antes de su implementación. Para apoyar la exploración y la generación de ideas, hemos utilizado datos no clasificados y sintéticos para validar las capacidades de estos sistemas y ofrecer a los ministerios asociados un conjunto claro de consideraciones que valorar en sus casos de uso.


## §05 Seguridad y cadena de suministro

Hemos sido prudentes con los componentes de agentes de código abierto, por práctica más que por política. Un arnés, aunque solo sea un conjunto de archivos de habilidades, es software y debe auditarse antes de su uso. Su procedencia es importante. Una habilidad de agente puede contener una inyección de instrucciones, o una cadena de suministro comprometida puede hacer que un agente se comporte de forma errática; en el peor de los casos, el propio agente se convierte en el elemento de riesgo. Por eso somos selectivos con lo que incorporamos y lo evaluamos primero en nuestros entornos de prueba antes de abrirlo a un uso más amplio.

En torno a los modelos, utilizamos pasarelas como Bifrost para la abstracción de proveedores, la contención de costes y los controles de detección de información personal; asimismo, empleamos Microsoft Defender y Purview, o equivalentes, como controles de prevención de pérdida de datos, junto con las herramientas integradas de GitHub. Queda trabajo por hacer. Estamos dialogando con la industria sobre el aparato de seguridad en torno a los agentes, la gestión de identidad agéntica y el seguimiento y la observación de la actividad de los agentes en la red; además, invitaremos a empresas sólidas a probar herramientas frente a cargas de trabajo gubernamentales a través del proceso de Cómputo Soberano y las próximas solicitudes de propuestas. También buscamos alianzas con homólogos federales, provinciales, territoriales y municipales para mantener una comunidad de práctica activa y aprender de cómo otros gobiernos resuelven los mismos problemas.


## §06 Costes y escala

Consumimos ya miles de millones de tokens de cómputo al mes, y prevemos que el coste del consumo alcance cientos de miles de dólares al mes a medida que se implementen los cuatro enfoques y un agente de IA dé soporte a cada aplicación para supervisión, remediación de ciberseguridad y desarrollo. Los costes relativos siguen siendo bajos, y aun con estos nuevos gastos, el ahorro derivado de una sola aplicación entre cientos puede superar con frecuencia el coste total del cómputo de IA para todo el año.

La capacidad se está convirtiendo en una limitación: la escasez de infraestructura y memoria restringe el cómputo, y es probable que incluso nuestros acuerdos empresariales —con un límite de entre veinticinco y cincuenta millones de tokens por minuto— se superen pronto, por lo que estamos adoptando un enfoque diversificado y con balanceo de carga para gestionar el rendimiento.

Planificación de una tarea de larga duración 250 agentes · 50 días. El procesamiento de aproximadamente 14 millones de imágenes y registros históricos requerirá 250 agentes simultáneos en funcionamiento durante hasta 50 días. Sin embargo, a un costo de varios cientos de miles de dólares, esto equivale a aproximadamente el uno por ciento del costo de realizar el mismo trabajo de forma manual.

Estas cifras de costos son interesantes. Si bien los agentes de IA son muy rentables cuando se utilizan bien, también abren la puerta a trabajos que simplemente no habríamos emprendido de otro modo, en lugar de reducir estrictamente el costo de los trabajos que ya realizamos. A medida que las herramientas se hacen disponibles, crece al mismo tiempo tanto el interés por crear nuevos servicios de valor como la necesidad de remediar la deuda técnica. Nuestro objetivo es modernizar con rapidez y prestar servicios mejorados, con cientos de millones de dólares anuales en ahorro de costos y una plantilla estable, y avanzar desde tecnologías que nos atan a un proveedor hacia plataformas que nos den flexibilidad a medida que escalamos. Exploramos la IA por las razones expuestas en El imperativo de la ciberseguridad y el Barco de Teseo de dos mil millones de dólares, y procuramos no resolver un problema creando otro.

Para asegurarnos de obtener la mejor inversión global, capacitamos a nuestro personal para planificar e implementar con eficacia cargas de trabajo asistidas por la IA en el gobierno —tema de nuestro próximo documento sobre la Academia de IA de Alberta.

Tags: tech-stack, cloud, models, sovereign-compute, bifrost, security, governance, open-source

Open the interactive version