SEDAR: Detectando y recuperando fallos transitorios en aplicaciones de HPC
- Autores
- Montezanti, Diego Miguel; Rucci, Enzo; Rexachs del Rosario, Dolores; Luque Fadón, Emilio; Naiouf, Marcelo; De Giusti, Armando Eduardo
- Año de publicación
- 2019
- Idioma
- español castellano
- Tipo de recurso
- documento de conferencia
- Estado
- versión publicada
- Descripción
- El manejo de fallos es una preocupación creciente en HPC; en el futuro, se esperan mayores variedades y tasas de errores, intervalos de detección más largos y fallos silenciosos. Se proyecta que, en sistemas de exa-escala, los errores ocurran varias veces al día y se propaguen para generar desde caídas de procesos hasta corrupciones de resultados debidas a fallos no detectados. En este trabajo se describe la utilización de SEDAR, una herramienta que permite detectar fallos transitorios en aplicaciones MPI, y recuperar automáticamente las ejecuciones, posibilitando su finalización con resultados fiables. La detección se basa en replicación de procesamiento y monitorización del envío de mensajes y del cómputo local, mientras que la recuperación se logra utilizando múltiples checkpoints de capa de sistema. El estudio del comportamiento de SEDAR en presencia de fallos, inyectados en distintos momentos durante la ejecución, permite evaluar su desempeño y caracterizar el overhead asociado a su utilización. Las posibilidades de configurar el modo de uso, adaptándolo a los requerimientos de cobertura y máximo overhead permitido de un sistema particular, hacen de SEDAR una metodología factible y viable para la tolerancia a fallos transitorios en sistemas de HPC.
Red de Universidades con Carreras en Informática - Materia
-
Ciencias Informáticas
Detección de fallos transitorios
Recuperación automática
Corrupción silenciosa de datos
Aplicaciones de HPC
Inyección de fallos - Nivel de accesibilidad
- acceso abierto
- Condiciones de uso
- http://creativecommons.org/licenses/by-nc-sa/4.0/
- Repositorio
- Institución
- Universidad Nacional de La Plata
- OAI Identificador
- oai:sedici.unlp.edu.ar:10915/90527
Ver los metadatos del registro completo
id |
SEDICI_abf9ffc9c8eaeedd214e6e4ef3f58cff |
---|---|
oai_identifier_str |
oai:sedici.unlp.edu.ar:10915/90527 |
network_acronym_str |
SEDICI |
repository_id_str |
1329 |
network_name_str |
SEDICI (UNLP) |
spelling |
SEDAR: Detectando y recuperando fallos transitorios en aplicaciones de HPCMontezanti, Diego MiguelRucci, EnzoRexachs del Rosario, DoloresLuque Fadón, EmilioNaiouf, MarceloDe Giusti, Armando EduardoCiencias InformáticasDetección de fallos transitoriosRecuperación automáticaCorrupción silenciosa de datosAplicaciones de HPCInyección de fallosEl manejo de fallos es una preocupación creciente en HPC; en el futuro, se esperan mayores variedades y tasas de errores, intervalos de detección más largos y fallos silenciosos. Se proyecta que, en sistemas de exa-escala, los errores ocurran varias veces al día y se propaguen para generar desde caídas de procesos hasta corrupciones de resultados debidas a fallos no detectados. En este trabajo se describe la utilización de SEDAR, una herramienta que permite detectar fallos transitorios en aplicaciones MPI, y recuperar automáticamente las ejecuciones, posibilitando su finalización con resultados fiables. La detección se basa en replicación de procesamiento y monitorización del envío de mensajes y del cómputo local, mientras que la recuperación se logra utilizando múltiples checkpoints de capa de sistema. El estudio del comportamiento de SEDAR en presencia de fallos, inyectados en distintos momentos durante la ejecución, permite evaluar su desempeño y caracterizar el overhead asociado a su utilización. Las posibilidades de configurar el modo de uso, adaptándolo a los requerimientos de cobertura y máximo overhead permitido de un sistema particular, hacen de SEDAR una metodología factible y viable para la tolerancia a fallos transitorios en sistemas de HPC.Red de Universidades con Carreras en Informática2019-10info:eu-repo/semantics/conferenceObjectinfo:eu-repo/semantics/publishedVersionObjeto de conferenciahttp://purl.org/coar/resource_type/c_5794info:ar-repo/semantics/documentoDeConferenciaapplication/pdf170-182http://sedici.unlp.edu.ar/handle/10915/90527spainfo:eu-repo/semantics/altIdentifier/isbn/978-987-688-377-1info:eu-repo/semantics/reference/hdl/10915/90359info:eu-repo/semantics/openAccesshttp://creativecommons.org/licenses/by-nc-sa/4.0/Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International (CC BY-NC-SA 4.0)reponame:SEDICI (UNLP)instname:Universidad Nacional de La Platainstacron:UNLP2025-09-29T11:17:38Zoai:sedici.unlp.edu.ar:10915/90527Institucionalhttp://sedici.unlp.edu.ar/Universidad públicaNo correspondehttp://sedici.unlp.edu.ar/oai/snrdalira@sedici.unlp.edu.arArgentinaNo correspondeNo correspondeNo correspondeopendoar:13292025-09-29 11:17:38.874SEDICI (UNLP) - Universidad Nacional de La Platafalse |
dc.title.none.fl_str_mv |
SEDAR: Detectando y recuperando fallos transitorios en aplicaciones de HPC |
title |
SEDAR: Detectando y recuperando fallos transitorios en aplicaciones de HPC |
spellingShingle |
SEDAR: Detectando y recuperando fallos transitorios en aplicaciones de HPC Montezanti, Diego Miguel Ciencias Informáticas Detección de fallos transitorios Recuperación automática Corrupción silenciosa de datos Aplicaciones de HPC Inyección de fallos |
title_short |
SEDAR: Detectando y recuperando fallos transitorios en aplicaciones de HPC |
title_full |
SEDAR: Detectando y recuperando fallos transitorios en aplicaciones de HPC |
title_fullStr |
SEDAR: Detectando y recuperando fallos transitorios en aplicaciones de HPC |
title_full_unstemmed |
SEDAR: Detectando y recuperando fallos transitorios en aplicaciones de HPC |
title_sort |
SEDAR: Detectando y recuperando fallos transitorios en aplicaciones de HPC |
dc.creator.none.fl_str_mv |
Montezanti, Diego Miguel Rucci, Enzo Rexachs del Rosario, Dolores Luque Fadón, Emilio Naiouf, Marcelo De Giusti, Armando Eduardo |
author |
Montezanti, Diego Miguel |
author_facet |
Montezanti, Diego Miguel Rucci, Enzo Rexachs del Rosario, Dolores Luque Fadón, Emilio Naiouf, Marcelo De Giusti, Armando Eduardo |
author_role |
author |
author2 |
Rucci, Enzo Rexachs del Rosario, Dolores Luque Fadón, Emilio Naiouf, Marcelo De Giusti, Armando Eduardo |
author2_role |
author author author author author |
dc.subject.none.fl_str_mv |
Ciencias Informáticas Detección de fallos transitorios Recuperación automática Corrupción silenciosa de datos Aplicaciones de HPC Inyección de fallos |
topic |
Ciencias Informáticas Detección de fallos transitorios Recuperación automática Corrupción silenciosa de datos Aplicaciones de HPC Inyección de fallos |
dc.description.none.fl_txt_mv |
El manejo de fallos es una preocupación creciente en HPC; en el futuro, se esperan mayores variedades y tasas de errores, intervalos de detección más largos y fallos silenciosos. Se proyecta que, en sistemas de exa-escala, los errores ocurran varias veces al día y se propaguen para generar desde caídas de procesos hasta corrupciones de resultados debidas a fallos no detectados. En este trabajo se describe la utilización de SEDAR, una herramienta que permite detectar fallos transitorios en aplicaciones MPI, y recuperar automáticamente las ejecuciones, posibilitando su finalización con resultados fiables. La detección se basa en replicación de procesamiento y monitorización del envío de mensajes y del cómputo local, mientras que la recuperación se logra utilizando múltiples checkpoints de capa de sistema. El estudio del comportamiento de SEDAR en presencia de fallos, inyectados en distintos momentos durante la ejecución, permite evaluar su desempeño y caracterizar el overhead asociado a su utilización. Las posibilidades de configurar el modo de uso, adaptándolo a los requerimientos de cobertura y máximo overhead permitido de un sistema particular, hacen de SEDAR una metodología factible y viable para la tolerancia a fallos transitorios en sistemas de HPC. Red de Universidades con Carreras en Informática |
description |
El manejo de fallos es una preocupación creciente en HPC; en el futuro, se esperan mayores variedades y tasas de errores, intervalos de detección más largos y fallos silenciosos. Se proyecta que, en sistemas de exa-escala, los errores ocurran varias veces al día y se propaguen para generar desde caídas de procesos hasta corrupciones de resultados debidas a fallos no detectados. En este trabajo se describe la utilización de SEDAR, una herramienta que permite detectar fallos transitorios en aplicaciones MPI, y recuperar automáticamente las ejecuciones, posibilitando su finalización con resultados fiables. La detección se basa en replicación de procesamiento y monitorización del envío de mensajes y del cómputo local, mientras que la recuperación se logra utilizando múltiples checkpoints de capa de sistema. El estudio del comportamiento de SEDAR en presencia de fallos, inyectados en distintos momentos durante la ejecución, permite evaluar su desempeño y caracterizar el overhead asociado a su utilización. Las posibilidades de configurar el modo de uso, adaptándolo a los requerimientos de cobertura y máximo overhead permitido de un sistema particular, hacen de SEDAR una metodología factible y viable para la tolerancia a fallos transitorios en sistemas de HPC. |
publishDate |
2019 |
dc.date.none.fl_str_mv |
2019-10 |
dc.type.none.fl_str_mv |
info:eu-repo/semantics/conferenceObject info:eu-repo/semantics/publishedVersion Objeto de conferencia http://purl.org/coar/resource_type/c_5794 info:ar-repo/semantics/documentoDeConferencia |
format |
conferenceObject |
status_str |
publishedVersion |
dc.identifier.none.fl_str_mv |
http://sedici.unlp.edu.ar/handle/10915/90527 |
url |
http://sedici.unlp.edu.ar/handle/10915/90527 |
dc.language.none.fl_str_mv |
spa |
language |
spa |
dc.relation.none.fl_str_mv |
info:eu-repo/semantics/altIdentifier/isbn/978-987-688-377-1 info:eu-repo/semantics/reference/hdl/10915/90359 |
dc.rights.none.fl_str_mv |
info:eu-repo/semantics/openAccess http://creativecommons.org/licenses/by-nc-sa/4.0/ Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International (CC BY-NC-SA 4.0) |
eu_rights_str_mv |
openAccess |
rights_invalid_str_mv |
http://creativecommons.org/licenses/by-nc-sa/4.0/ Creative Commons Attribution-NonCommercial-ShareAlike 4.0 International (CC BY-NC-SA 4.0) |
dc.format.none.fl_str_mv |
application/pdf 170-182 |
dc.source.none.fl_str_mv |
reponame:SEDICI (UNLP) instname:Universidad Nacional de La Plata instacron:UNLP |
reponame_str |
SEDICI (UNLP) |
collection |
SEDICI (UNLP) |
instname_str |
Universidad Nacional de La Plata |
instacron_str |
UNLP |
institution |
UNLP |
repository.name.fl_str_mv |
SEDICI (UNLP) - Universidad Nacional de La Plata |
repository.mail.fl_str_mv |
alira@sedici.unlp.edu.ar |
_version_ |
1844616049464442880 |
score |
13.070432 |