← Inicio

Corpus de Confiabilidad

Lo que aviación, nuclear, Toyota y SRE aprendieron sobre no caerse — ordenado por nivel VSM, porque cada técnica vive en un nivel y aplicarla en otro es por qué fracasan.

Por qué importa el nivel Las técnicas de confiabilidad no son intercambiables: cada una vive en un nivel específico. Aplicarla en el equivocado es la razón más común de que un programa de confiabilidad fracase.

El ejemplo típico: meter más mantenimiento preventivo (técnica de S1) para arreglar lo que en realidad es una dependencia compartida (S2) o una erosión de estándares (S5). No arreglas una falla de política con un calendario.
La distinción que ordena todo Puertas de dos sentidos: reversibles. La velocidad gana; el análisis de más es el error caro.
Puertas de un solo sentido: ruina, reputación, legal, estructural. La arquitectura gana; la velocidad es el error caro.

El primer trabajo siempre es clasificar la puerta.

S1 · Operaciones

Confiabilidad aquí = Que la unidad que hace, siga haciendo.
Patología característicaLa unidad se detiene. Fallas independientes, cada una con su causa.
Los seis patrones de falla — Nowlan & Heap, United Airlines, 1978
Solo ~11% de los componentes muestran desgaste por edad. El resto tiene tasa de riesgo constante o mortalidad infantil. La curva de bañera es la excepción.Rotar proveedores o sistemas "por antigüedad" destruye confiabilidad. Lo nuevo falla más que lo que lleva rato aguantando.
La intervención reintroduce riesgo — RCM
Cada preventivo mete de vuelta mortalidad infantil: error de instalación, parte equivocada, ensamble mal hecho. Tocar lo que funciona tiene costo esperado positivo de falla.Si no hay modo de falla identificado, no toques. Aplica a procesos igual que a máquinas.
Intervalo P-F — RCM
La ventana entre que una falla se vuelve detectable y se vuelve funcional. Regla: inspecciona a la mitad, para tener dos oportunidades de agarrarla.Es la base de tus seams. El intervalo —no la costumbre— fija la frecuencia de revisión.
Correr a falla, decidido — Nowlan & Heap
Si no existe tarea preventiva que técnicamente valga la pena, dejarlo correr hasta que falle es la respuesta correcta — y se documenta.Decidido y escrito no es negligencia. Libera presupuesto de rigor para donde sí importa.
Jidoka y andon — Toyota
Cualquiera puede detener la línea. La calidad se construye en el proceso, no se inspecciona al final.Tu operador o tu nodo puede parar un embarque sin pedir permiso. Si parar cuesta socialmente, nadie para.
Poka-yoke — Toyota
Diseña para que el error sea imposible, no para detectarlo después. El conector que solo entra de una forma.Gates que se ven apagados hasta que cierra el anterior. Formularios que no avanzan sin la clasificación.
MEL — equipo mínimo — Aviación
Un avión despacha con cosas descompuestas, pero está escrito cuáles y por cuánto. Lista aprobada, no improvisación.Escribe con qué puedes operar roto. Sin esa lista, cada falla se decide con las ganas del día.

S2 · Coordinación

Confiabilidad aquí = Que las unidades no se estorben ni fallen juntas.
Patología característicaOscilación y colapso correlacionado. Todo cae a la vez porque compartía algo.
Falla de modo común — Ingeniería de sistemas
La redundancia no sirve si las copias comparten causa. Dos motores del mismo lote con el mismo defecto no son redundancia.
Esto es una patología de S2, no de S1 — nace de la coordinación, no de la unidad.Dos proveedores del mismo país, con la misma naviera y el mismo agente aduanal, son un proveedor con tres facturas.
Disimilaridad — Aviación
Sistemas críticos usan implementaciones distintas del mismo requisito, no copias. Las copias comparten el defecto de diseño.Tu segundo cliente debe ser de otro canal; tu segundo corredor, de otro país. Si no, es duplicación disfrazada.
Bulkheads — Nygard, Release It!
Compartimenta, para que la falla de una parte no inunde el resto. El casco del barco.Un corredor no puede consumir el capital de otro. Compartimenta el capital antes de abrir el segundo.
Acoplamiento estrecho — Perrow, 1984
Complejidad interactiva + acoplamiento estrecho = accidentes estructurales, no mala suerte. La holgura se mete a propósito o no existe.Proveedor → naviera → aduana → bodega → cliente está acoplado. Sin días de holgura deliberados, cada retraso se propaga entero.
Estandarizar para poder comparar — Práctica
Método común entre unidades no es burocracia: es lo que permite comparar y sustituir. Sin él cada unidad es un caso único.Mismo landed cost, mismos gates, mismo expediente en todos los corredores. Si no, no puedes saber cuál sirve.

S3 · Control

Confiabilidad aquí = Que el recurso alcance, aquí y ahora.
Patología característicaLa optimización se come la holgura. Eficiencia matando resiliencia.
MTBF, MTTR y disponibilidad — Clásico
Disponibilidad = MTBF / (MTBF + MTTR). Se sube fallando menos o recuperándose más rápido. El segundo suele ser mucho más barato.No persigas cero incidencias. Persigue que ninguna te detenga más de X horas.
Error budget — Google SRE
Si tu objetivo es 99%, tienes 1% de presupuesto de falla, y se gasta a propósito tomando riesgo. Cero fallas significa que estás siendo demasiado conservador.Si llevas cero embarques problemáticos, no estás explorando corredores nuevos.
Margen de seguridad — Graham · ingeniería estructural
Diseña para más de lo que esperas. El margen no es desperdicio: es lo que evita que tu error de estimación se vuelva falla.Si el landed cost deja 20% de margen, no tienes negocio — tienes tu error de estimación.
Circuit breaker — Nygard
Corta automáticamente cuando algo empieza a fallar, en vez de reintentar hasta morir.Define de antemano el umbral que apaga un corredor solo, sin que tengas que decidirlo en caliente.
Barbell y tamaño de apuesta — Taleb · Kelly
Muy conservador en la mayoría, agresivo en una fracción chica y acotada. El medio acumula riesgo sin acumular opcionalidad.80% en el corredor probado, 20% en apuestas nuevas con pérdida máxima conocida de antemano.

S3* · Auditoría

Confiabilidad aquí = Enterarte de lo que de verdad pasa, saltándote el reporte.
Patología característicaEl canal se calla. Todo se ve bien hasta el día que no.
Fallas ocultas — RCM
No se manifiestan solas: solo aparecen cuando las necesitas. S3* existe precisamente para encontrarlas. Un respaldo que nunca se probó es una falla oculta con disfraz.Tu segundo proveedor, tu línea de crédito, tu cliente alterno. Si nunca los usaste, no sabes si existen. Pruébalos en frío.
Preocupación por la falla — Weick & Sutcliffe, HRO
Las organizaciones de alta confiabilidad tratan el casi-accidente como su insumo más valioso: se reporta, se estudia, no se castiga.El casi-accidente es lo primero que desaparece si reportarlo cuesta. Y es tu única señal barata.
Cultura justa — Reason · aviación
Se separa error honesto de negligencia. Si reportar tu propio error te cuesta el puesto, la información se extingue y solo te enteras del accidente completo.Escríbelo antes del primer error de un nodo: quien reporta primero, gana.
Gemba — Toyota
Ve al lugar donde ocurre el trabajo. El reporte es S3; caminar el turno es S3*.Camina el mercado. Acompaña un turno. Un nodo audita el corredor de otro — nunca el propio.
Señal algedónica — Beer, VSM
Canal de dolor que salta la jerarquía y llega directo, sin pasar por reportes ni juntas.Un número que te llega al teléfono cuando un embarque se pasa de días, sin filtros ni intermediarios.

S4 · Inteligencia

Confiabilidad aquí = Ver el entorno y el después, no solo el adentro y el ahora.
Patología característicaBloqueo de modelo. Sigues planeando para el mundo que ya conoces.
Ergodicidad — Peters
El promedio del conjunto no es el de tu trayectoria. Una apuesta con valor esperado positivo puede arruinar con certeza a quien la repite si un mal resultado lo saca del juego.La pregunta nunca es "¿en promedio conviene?" sino "¿puedo repetir esto cien veces sin desaparecer?".
Clase de referencia — Kahneman · Flyvbjerg
No pronostiques desde adentro del proyecto. Pregunta cómo le fue a proyectos parecidos. La vista interna es sistemáticamente optimista.No preguntes cuánto tarda tu primer embarque. Pregunta cuánto tarda el primer embarque de un importador primerizo.
Pre-mortem — Klein
"Estamos a un año, esto fracasó rotundamente. Escribe por qué." Da permiso social para nombrar lo que nadie dice en una junta de aprobación.Antes del primer embarque, escribe las cinco formas en que salió mal. Casi siempre una de esas cinco es la que pasa.
Efecto Lindy — Taleb
Para lo no perecedero, la vida esperada futura es proporcional a la edad actual. Lo que lleva veinte años funcionando probablemente dure otros veinte.Prefiere proveedores viejos, rutas viejas y métodos viejos. Lo nuevo no ha tenido tiempo de demostrar que no se rompe.
Safety-II — Hollnagel
La seguridad clásica estudia lo que sale mal. Safety-II estudia por qué casi siempre sale bien: la gente adapta. Si optimizas quitando errores, matas la adaptación que te sostenía.Antes de estandarizar algo que funciona, entiende por qué funciona — suele ser una adaptación humana que tu proceso nuevo prohibiría.

S5 · Identidad y política

Confiabilidad aquí = Qué no se viola nunca, sin importar el negocio que esté en juego.
Patología característicaDeriva. El estándar se erosiona de a poco hasta que el invariante ya no existe y nadie lo notó.
Normalización de la desviación — Vaughan, Challenger
La patología de S5. Una desviación chica se acepta "esta vez", luego se vuelve costumbre, luego estándar. Nadie decidió bajar la barra — se movió sola. Challenger no fue un error: fue años de aceptar erosión de sellos porque las veces anteriores no había pasado nada.Cada vez que te saltes un gate "porque este caso es distinto", anótalo. Tres excepciones anotadas significa que el gate ya no existe.
Clasificación por consecuencia — ARP4761 · certificación civil
Aviación no trata todas las fallas igual: catastrófica, peligrosa, mayor, menor — y cada clase tiene probabilidad máxima exigida. Lo catastrófico se diseña a 10⁻⁹ por hora de vuelo.Separa recuperable de irrecuperable antes de gastar en mitigación. La segunda lista debe ser corta, y ahí va todo tu rigor.
Nunca arriesgues la ruina — Taleb
La supervivencia es precondición de todo lo demás. Ningún retorno justifica probabilidad no trivial de quedar fuera.Ningún embarque puede costar más de lo que aguantas perder entero. Ese es el techo de tu primera compra, sin importar el margen.
Vía negativa — Taleb
Quitar fragilidad rinde más que agregar sofisticación, y es más robusto porque no depende de que tu modelo sea correcto.Eliminar un modo de ruina vale más que optimizar el margen tres puntos — y sigue valiendo aunque te hayas equivocado en todo lo demás.
Deferencia a la experiencia — Weick & Sutcliffe, HRO
En crisis, la autoridad migra a quien sabe, no a quien manda. Es política, no cortesía: se decide antes de la crisis.Escribe quién manda cuando algo se rompe en un corredor. Si se decide en el momento, se decide por jerarquía y suele ser el peor criterio.
La crítica al RPN — Práctica moderna de FMEA
Severidad × ocurrencia × detección es popular y matemáticamente frágil: ordinales que no se deben multiplicar, y RPNs iguales que esconden riesgos opuestos. Un 10×1×10 no es un 5×4×5.Usa el RPN para ordenar conversación, nunca para decidir. Lo que decide es la consecuencia — empezando por si es recuperable.

Diagnóstico — qué nivel te está fallando

La forma de tus fallas dice dónde está el problema. Empieza por aquí antes de elegir técnica.

Si tus fallas se ven así…El problema está en…
Fallas independientes, cada una con causa distintaS1 — La unidad. Revisa P-F, tareas y si algunas deberían correr a falla.
Todo cae junto o se propaga en cadenaS2 — Coordinación. Busca la dependencia compartida y mete holgura.
Siempre andas corto de recurso o apagando fuegosS3 — Control. La optimización se comió la holgura.
Te sorprendes. Te enteras tarde y por el clienteS3* — Auditoría. El canal se calló o nunca existió.
El entorno cambió y seguiste con el plan viejoS4 — Inteligencia. Modelo bloqueado.
Rompes tus propias reglas y ya no te llama la atenciónS5 — Deriva. Normalización de la desviación.

La recursión

Cada S1 es un sistema viable completo Tu unidad es S1 de la flota — y adentro tiene su propio S1 a S5. El motor es su S1; el aceite y la temperatura son su S3; el arranque en frío grabado es su S3*.

Por eso el corpus es fractal: los mismos seis niveles, la misma pregunta de confiabilidad, a cualquier escala. Y por eso la regla se sostiene: un nivel tiene que poder fallar sin matar al de arriba. Si no puede, no son dos holones — es uno mal dibujado.

La herramienta

👣 El Walk Pre-mortem · gemba · seam · intervalo P-F · baby step. Una sola pasada, para puertas de un solo sentido. Se corre, no se lee.

El procedimiento

Cinco pasos, en orden 1. Clasifica la puerta. Reversible o no.
2. Diagnostica el nivel con la tabla de arriba. La forma de la falla te lo dice.
3. Aplica la técnica de ese nivel. No importes técnicas de otro.
4. Para lo irrecuperable, encuentra el seam y mide su intervalo P-F. Inspecciona a la mitad.
5. Pre-mortem antes de arrancar. Cinco formas de fracasar, escritas.
El recordatorio incómodo Esta arquitectura no sustituye correr el sistema. Aviación llegó aquí con décadas de accidentes reales y una base de datos que ningún libro le dio. Reduce la probabilidad de lo catastrófico — no reemplaza el vuelo de prueba.

El equilibrio: arquitectura completa en los modos irrecuperables, aprendizaje rápido en todo lo demás.