Performability issues of fault tolerance solutions for message-passing systems: the case of RADIC

Silva Dos Santos, G. K. Alexander · TDX (Tesis Doctorals en Xarxa) · 2009

?Es adecuado un sistema rapido pero poco robusto??Es adecuado un sistema disponible pero lento? Estas dos cuestiones representan la importancia de prestaciones y disponibilidad en clusters de computadores. Esta tesis se enmarca en el estudio de la relacion entre prestaciones y disponibilidad cuando un cluster de computadores basado en el modelo de paso de mensajes, usa un protocolo de tolerancia a fallos basado en rollback-recovery con log de mensajes pesimista. Esta relacion tambien es conocida como performability. Los principales factores que influyen en la performability cuando se usa la arquitectura de tolerancia a fallos RADIC son identificados y estudiados. Los factores fundamentales son la latencia de envio de mensajes que se incrementa cuando se usa el log pesimista, que implica una perdida de prestaciones, como tambien la replicacion de los datos redundantes (checkpoint y log) necesaria para el incremento de la disponibilidad en RADIC y el cambio de la distribucion de procesos por nodo causada por los fallos, que pueden causar degradacion de las prestaciones asi como las paradas por mantenimiento preventivo. Para tratar estos problemas se proponen alternativas de diseno basadas en analisis de la performability. La perdida de prestaciones causada por el log y la replicacion ha sido mitigada usando la tecnica de pipeline. El cambio en la distribucion de procesos por nodo puede ser evitado o restaurada usando un mecanismo flexible y transparente de redundancia dinamica que ha sido propuesto, que permite insercion dinamica de nodos spare o de repuesto. Los resultados obtenidos demuestran que las contribuciones presentadas son capaces de mejorar la performability de un cluster de computadores cuando se usa una solucion de tolerancia a fallos como RADIC.

Read the paper · More papers on PaperTik