Sistemas DistribuídosVisão geral
Tolerância a Falhas
Um modelo de falha é o contrato da interface: o que um processo defeituoso ainda pode fazer, e o que os outros observam — mensagem, resposta ou silêncio.
Classificação e mascaramento deste tópico — e transparência de falha, consistência sob partição e o sistema de arquivos distribuído nos tópicos seguintes — partem desse contrato.
As páginas se agrupam em dois blocos. O primeiro classifica o que o servidor defeituoso ainda apresenta e o que isso implica para consenso: indistinguibilidade entre queda e atraso sem teto, e a cota quando o adversário mente.
O segundo mantém pelo menos uma cópia correta independente da que falhou, ou gasta tempo repetindo a mesma operação no mesmo componente.
Classificar o que o silêncio ou a mensagem inconsistente ainda permite ao processo defeituoso está em Modelos de Falha. Duplicar o recurso e promover o reserva quando o primário cala está em Redundância.
FLP — consenso determinístico impossível em sistema assíncrono com uma queda — está em Modelos de Falha. A cota n ≥ 3f+1 para até f mentirosos está em Modelos de Falha.
Espelho RAID 1, réplica síncrona versus assíncrona e failover ativo-passivo estão em Redundância. RAID 0 perde o volume com um disco a menos.
Repetir a operação no mesmo servidor mascara falha transiente. Queda permanente pede a cópia extra, em Redundância.
Páginas deste tópico
Modelos de Falha
ProMédia incidência no POSCOMP15 min de leitura · 12ª mais cobrada em Sistemas Distribuídos
Queda, omissão, transição de estado e arbitrária; FLP = assíncrono + 1 crash.
Redundância
ProMédia incidência no POSCOMP12 min de leitura · 14ª mais cobrada em Sistemas Distribuídos
Redundância de hardware, dados e processo; mascarar falha; failover.