Fault Tolerance Configuration for Uncoordinated Checkpoints

Leonardo Fialho de Queiroz · TDX (Tesis Doctorals en Xarxa) · 2011

La tendencia general de los computadores paralelos es crecer en complejidad y en numero de componentes. La miniaturizacion y la concentracion de dichos elementos es la principal causa de la aparicion y aumento de los fallos en estos computadores. Asimismo, para permitir la ejecucion correcta de las aplicaciones paralelas, existe la necesidad de proveer soporte y de tolerar fallos en estos entornos. Una estrategia amplamente utilizada es el rollback-recovery, que consiste en guardar periodicamente el estado de la aplicacion y, en caso de fallos, reanudar la aplicacion desde el ultimo estado guardado. El uso de estos protocolos anade una sobrecarga al tiempo de ejecucion de la aplicacion. Con el uso de protocolos de checkpoints no coordinados, es facil estimar el tiempo total de ejecucion de una aplicacion, asi como tambien la frecuencia en la cual estos checkpoints deben ser guardados. Actualmente, existen modelos precisos para estimar estos tiempos. Sin embargo, el uso de protocolos de checkpoints coordinados, puede no ser la mejor solucion para proveer tolerancia a fallos en los computadores paralelos de proxima generacion. En otras palabras, el actual paradigma de tolerancia a fallos para computadores paralelos, no es adecuado para los futuros sistemas. Los protocolos de tolerancia a fallos no coordinados permiten que, cada proceso de la aplicacion paralela guarde su estado independientemente de los demas procesos; la combinacion de estos protocolos con tecnicas de log de eventos eliminan los inconvenientes de los protocolos no coordinados, como el efecto domino y la aparicion de mensajes huerfanos. Esta combinacion representa el paradigma emergente de tolerancia a fallos para aplicaciones paralelas escalables. Actualmente, no hay modelos adecuados para estimar el tiempo de ejecucion de aplicaciones paralelas que estan siendo protegidas por checkpoints no coordinados. Asi como tampoco existen modelos para calcular la frecuencia en que dichos checkpoints deben ser creados. El objetivo de esta tesis es, definir los modelos especificos para cada uno de los paradigmas: el coordinado y el no coordinado. Los modelos proveen una estimacion del tiempo total de ejecucion de las aplicaciones cuando estan protegidas por cualquiera de los dos paradigmas. Ademas, se propone una metodologia para definir el valor de las variables necesarias para calcular el intervalo de checkpoints. La principal motivacion de este trabajo es proveer el conocimiento necesario para enfrentar el paradigma emergente de tolerancia a fallos y hacerlo asequible para los usuarios de las aplicaciones paralelas.

Read the paper · More papers on PaperTik