Volver a la edición
watch16 min

Semantic Blindness: 500,000 Sensors Confused an LLM - Raahul Singh & Vanč Levstik, Phaidra

Título original: Semantic Blindness: 500,000 Sensors Confused an LLM - Raahul Singh & Vanč Levstik, Phaidra

Raahul Singh & Vanč Levstik (Phaidra) · AI Engineer

Los ingenieros de Phaidra tuvieron que hacer que un LLM razonara sobre 500,000+ nombres de sensores en centros de datos a escala de gigavatio, y cada enfoque ingenuo — vector RAG, LLM puro, sharding paralelo — falló en recuperación o alucinó equipos fantasma. Su solución es un patrón arquitectónico limpio: el LLM planifica y juzga, el código determinista realiza la búsqueda y operaciones de conjunto, y el costo escala con la profundidad de la jerarquía en lugar del número de instancias. Los números de producción son el mejor argumento: de 116M tokens y 30% de precisión a 390K tokens y 100% de precisión en 66 casos reales.

  • Diseña el sistema para escalar con la profundidad de la jerarquía (centro de datos → pasillo → rack → GPU), no con el número de instancias — su linearizador de rutas produce el mismo resumen de tamaño para 64 GPUs o 460,000.
  • El LLM produce planes estructurados (qué recopilar, alcance, filtros) en lugar de procesar nombres crudos, manteniendo el costo constante en ~9,000 tokens por consulta independientemente del tamaño del sistema.
  • Su enfoque antiguo se degradó de 80% de precisión en 64 GPUs a 30% en 460,000; el enfoque híbrido alcanzó 100% con 300x menos tokens.
  • Una inversión útil del marco de Karpathy: los sistemas nativos de IA deberían comenzar en Software 3.0 para demostraciones rápidas, luego madurar hacia 1.0 determinismo para producción.
Ver en YouTube

Parte de Edición Nº 001: LLMs para el juicio, código para contar: escalando a 500K sensores con 300x menos tokens