{"id":"https://openalex.org/W3198669718","doi":"https://doi.org/10.1109/ipdps.2006.1639333","title":"Algorithm-based checkpoint-free fault tolerance for parallel matrix computations on volatile resources","display_name":"Algorithm-based checkpoint-free fault tolerance for parallel matrix computations on volatile resources","publication_year":2006,"publication_date":"2006-01-01","ids":{"openalex":"https://openalex.org/W3198669718","doi":"https://doi.org/10.1109/ipdps.2006.1639333","mag":"3198669718"},"language":"en","primary_location":{"id":"doi:10.1109/ipdps.2006.1639333","is_oa":false,"landing_page_url":"https://doi.org/10.1109/ipdps.2006.1639333","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings 20th IEEE International Parallel &amp; Distributed Processing Symposium","raw_type":"proceedings-article"},"type":"conference-paper","indexed_in":["crossref"],"open_access":{"is_oa":false,"oa_status":"closed","oa_url":null,"any_repository_has_fulltext":false},"authorships":[{"author_position":"first","author":{"id":"https://openalex.org/A5061737717","display_name":"Zizhong Chen","orcid":"https://orcid.org/0000-0003-2578-4940"},"institutions":[{"id":"https://openalex.org/I75027704","display_name":"University of Tennessee at Knoxville","ror":"https://ror.org/020f3ap87","country_code":"US","type":"education","lineage":["https://openalex.org/I75027704"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"Zizhong Chen","raw_affiliation_strings":["Department of Computer Science, University of Tennessee, Knoxville, TN, USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Department of Computer Science, University of Tennessee, Knoxville, TN, USA","institution_ids":["https://openalex.org/I75027704"]}]},{"author_position":"last","author":{"id":"https://openalex.org/A5075517045","display_name":"Jack Dongarra","orcid":"https://orcid.org/0000-0003-3247-1782"},"institutions":[{"id":"https://openalex.org/I1289243028","display_name":"Oak Ridge National Laboratory","ror":"https://ror.org/01qz5mb56","country_code":"US","type":"facility","lineage":["https://openalex.org/I1289243028","https://openalex.org/I1330989302","https://openalex.org/I39565521","https://openalex.org/I4210159294"]},{"id":"https://openalex.org/I75027704","display_name":"University of Tennessee at Knoxville","ror":"https://ror.org/020f3ap87","country_code":"US","type":"education","lineage":["https://openalex.org/I75027704"]}],"countries":["US"],"is_corresponding":false,"raw_author_name":"J. Dongarra","raw_affiliation_strings":["Computer Science and Mathematics Division, Oak Ridge National Laboratory, Oak Ridge, TN, USA","Department of Computer Science, University of Tennessee, Knoxville, TN, USA"],"raw_orcid":null,"affiliations":[{"raw_affiliation_string":"Computer Science and Mathematics Division, Oak Ridge National Laboratory, Oak Ridge, TN, USA","institution_ids":["https://openalex.org/I1289243028"]},{"raw_affiliation_string":"Department of Computer Science, University of Tennessee, Knoxville, TN, USA","institution_ids":["https://openalex.org/I75027704"]}]}],"institutions":[],"countries_distinct_count":1,"institutions_distinct_count":2,"corresponding_author_ids":[],"corresponding_institution_ids":[],"apc_list":null,"apc_paid":null,"fwci":null,"has_fulltext":false,"cited_by_count":23,"citation_normalized_percentile":null,"cited_by_percentile_year":null,"biblio":{"volume":null,"issue":null,"first_page":"10 pp.","last_page":"10 pp."},"is_retracted":false,"is_paratext":false,"is_xpac":false,"primary_topic":{"id":"https://openalex.org/T10054","display_name":"Parallel Computing and Optimization Techniques","score":0.9997000098228455,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},"topics":[{"id":"https://openalex.org/T10054","display_name":"Parallel Computing and Optimization Techniques","score":0.9997000098228455,"subfield":{"id":"https://openalex.org/subfields/1708","display_name":"Hardware and Architecture"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10772","display_name":"Distributed systems and fault tolerance","score":0.9995999932289124,"subfield":{"id":"https://openalex.org/subfields/1705","display_name":"Computer Networks and Communications"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}},{"id":"https://openalex.org/T10829","display_name":"Interconnection Networks and Systems","score":0.9991000294685364,"subfield":{"id":"https://openalex.org/subfields/1705","display_name":"Computer Networks and Communications"},"field":{"id":"https://openalex.org/fields/17","display_name":"Computer Science"},"domain":{"id":"https://openalex.org/domains/3","display_name":"Physical Sciences"}}],"keywords":[{"id":"https://openalex.org/keywords/computer-science","display_name":"Computer science","score":0.8364220261573792},{"id":"https://openalex.org/keywords/parallel-computing","display_name":"Parallel computing","score":0.7264357805252075},{"id":"https://openalex.org/keywords/fault-tolerance","display_name":"Fault tolerance","score":0.7197365760803223},{"id":"https://openalex.org/keywords/overhead","display_name":"Overhead (engineering)","score":0.6755208969116211},{"id":"https://openalex.org/keywords/computation","display_name":"Computation","score":0.6469724178314209},{"id":"https://openalex.org/keywords/scalability","display_name":"Scalability","score":0.6359290480613708},{"id":"https://openalex.org/keywords/matrix-multiplication","display_name":"Matrix multiplication","score":0.610270619392395},{"id":"https://openalex.org/keywords/rollback","display_name":"Rollback","score":0.5322209596633911},{"id":"https://openalex.org/keywords/matrix","display_name":"Matrix (chemical analysis)","score":0.48460444808006287},{"id":"https://openalex.org/keywords/distributed-computing","display_name":"Distributed computing","score":0.4477875828742981},{"id":"https://openalex.org/keywords/kernel","display_name":"Kernel (algebra)","score":0.4448122978210449},{"id":"https://openalex.org/keywords/supercomputer","display_name":"Supercomputer","score":0.43486884236335754},{"id":"https://openalex.org/keywords/block","display_name":"Block (permutation group theory)","score":0.43297770619392395},{"id":"https://openalex.org/keywords/algorithm","display_name":"Algorithm","score":0.3788917064666748},{"id":"https://openalex.org/keywords/operating-system","display_name":"Operating system","score":0.09037435054779053},{"id":"https://openalex.org/keywords/database-transaction","display_name":"Database transaction","score":0.071807861328125}],"concepts":[{"id":"https://openalex.org/C41008148","wikidata":"https://www.wikidata.org/wiki/Q21198","display_name":"Computer science","level":0,"score":0.8364220261573792},{"id":"https://openalex.org/C173608175","wikidata":"https://www.wikidata.org/wiki/Q232661","display_name":"Parallel computing","level":1,"score":0.7264357805252075},{"id":"https://openalex.org/C63540848","wikidata":"https://www.wikidata.org/wiki/Q3140932","display_name":"Fault tolerance","level":2,"score":0.7197365760803223},{"id":"https://openalex.org/C2779960059","wikidata":"https://www.wikidata.org/wiki/Q7113681","display_name":"Overhead (engineering)","level":2,"score":0.6755208969116211},{"id":"https://openalex.org/C45374587","wikidata":"https://www.wikidata.org/wiki/Q12525525","display_name":"Computation","level":2,"score":0.6469724178314209},{"id":"https://openalex.org/C48044578","wikidata":"https://www.wikidata.org/wiki/Q727490","display_name":"Scalability","level":2,"score":0.6359290480613708},{"id":"https://openalex.org/C17349429","wikidata":"https://www.wikidata.org/wiki/Q1049914","display_name":"Matrix multiplication","level":3,"score":0.610270619392395},{"id":"https://openalex.org/C174220543","wikidata":"https://www.wikidata.org/wiki/Q395307","display_name":"Rollback","level":3,"score":0.5322209596633911},{"id":"https://openalex.org/C106487976","wikidata":"https://www.wikidata.org/wiki/Q685816","display_name":"Matrix (chemical analysis)","level":2,"score":0.48460444808006287},{"id":"https://openalex.org/C120314980","wikidata":"https://www.wikidata.org/wiki/Q180634","display_name":"Distributed computing","level":1,"score":0.4477875828742981},{"id":"https://openalex.org/C74193536","wikidata":"https://www.wikidata.org/wiki/Q574844","display_name":"Kernel (algebra)","level":2,"score":0.4448122978210449},{"id":"https://openalex.org/C83283714","wikidata":"https://www.wikidata.org/wiki/Q121117","display_name":"Supercomputer","level":2,"score":0.43486884236335754},{"id":"https://openalex.org/C2777210771","wikidata":"https://www.wikidata.org/wiki/Q4927124","display_name":"Block (permutation group theory)","level":2,"score":0.43297770619392395},{"id":"https://openalex.org/C11413529","wikidata":"https://www.wikidata.org/wiki/Q8366","display_name":"Algorithm","level":1,"score":0.3788917064666748},{"id":"https://openalex.org/C111919701","wikidata":"https://www.wikidata.org/wiki/Q9135","display_name":"Operating system","level":1,"score":0.09037435054779053},{"id":"https://openalex.org/C75949130","wikidata":"https://www.wikidata.org/wiki/Q848010","display_name":"Database transaction","level":2,"score":0.071807861328125},{"id":"https://openalex.org/C62520636","wikidata":"https://www.wikidata.org/wiki/Q944","display_name":"Quantum mechanics","level":1,"score":0.0},{"id":"https://openalex.org/C33923547","wikidata":"https://www.wikidata.org/wiki/Q395","display_name":"Mathematics","level":0,"score":0.0},{"id":"https://openalex.org/C2524010","wikidata":"https://www.wikidata.org/wiki/Q8087","display_name":"Geometry","level":1,"score":0.0},{"id":"https://openalex.org/C84114770","wikidata":"https://www.wikidata.org/wiki/Q46344","display_name":"Quantum","level":2,"score":0.0},{"id":"https://openalex.org/C121332964","wikidata":"https://www.wikidata.org/wiki/Q413","display_name":"Physics","level":0,"score":0.0},{"id":"https://openalex.org/C159985019","wikidata":"https://www.wikidata.org/wiki/Q181790","display_name":"Composite material","level":1,"score":0.0},{"id":"https://openalex.org/C114614502","wikidata":"https://www.wikidata.org/wiki/Q76592","display_name":"Combinatorics","level":1,"score":0.0},{"id":"https://openalex.org/C192562407","wikidata":"https://www.wikidata.org/wiki/Q228736","display_name":"Materials science","level":0,"score":0.0},{"id":"https://openalex.org/C199360897","wikidata":"https://www.wikidata.org/wiki/Q9143","display_name":"Programming language","level":1,"score":0.0}],"mesh":[],"locations_count":3,"locations":[{"id":"doi:10.1109/ipdps.2006.1639333","is_oa":false,"landing_page_url":"https://doi.org/10.1109/ipdps.2006.1639333","pdf_url":null,"source":null,"license":null,"license_id":null,"version":"publishedVersion","is_accepted":true,"is_published":true,"raw_source_name":"Proceedings 20th IEEE International Parallel &amp; Distributed Processing Symposium","raw_type":"proceedings-article"},{"id":"pmh:oai:pure.atira.dk:openaire_cris_publications/20e18292-a417-49b1-8f5b-2412e2363964","is_oa":false,"landing_page_url":"https://research.manchester.ac.uk/en/publications/20e18292-a417-49b1-8f5b-2412e2363964","pdf_url":null,"source":{"id":"https://openalex.org/S4306400662","display_name":"Research Explorer (The University of Manchester)","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I28407311","host_organization_name":"University of Manchester","host_organization_lineage":["https://openalex.org/I28407311"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":"Chen, Z & Dongarra, J 2006, Algorithm-based checkpoint-free fault tolerance for parallel matrix computations on volatile resources. in 20th International Parallel and Distributed Processing Symposium, IPDPS 2006|20th Int. Parallel Distrib. Process. Symp. IPDPS 2006. vol. 2006, IEEE, 20th International Parallel and Distributed Processing Symposium (IPDPS 2006), Proceedings, 25-29 April 2006, Rhodes Island, Greece, 1/01/24. https://doi.org/10.1109/IPDPS.2006.1639333","raw_type":"info:eu-repo/semantics/conferenceObject"},{"id":"pmh:oai:pure.atira.dk:publications/20e18292-a417-49b1-8f5b-2412e2363964","is_oa":false,"landing_page_url":"http://dblp.uni-trier.de/db/conf/ipps/ipdps2006.html#ChenD06","pdf_url":null,"source":{"id":"https://openalex.org/S4306400662","display_name":"Research Explorer (The University of Manchester)","issn_l":null,"issn":null,"is_oa":false,"is_in_doaj":false,"is_core":false,"host_organization":"https://openalex.org/I28407311","host_organization_name":"University of Manchester","host_organization_lineage":["https://openalex.org/I28407311"],"host_organization_lineage_names":[],"type":"repository"},"license":null,"license_id":null,"version":"submittedVersion","is_accepted":false,"is_published":false,"raw_source_name":"Chen, Z & Dongarra, J 2006, Algorithm-based checkpoint-free fault tolerance for parallel matrix computations on volatile resources. in 20th International Parallel and Distributed Processing Symposium, IPDPS 2006|20th Int. Parallel Distrib. Process. Symp. IPDPS 2006. vol. 2006, IEEE, 20th International Parallel and Distributed Processing Symposium (IPDPS 2006), Proceedings, 25-29 April 2006, Rhodes Island, Greece, 1/01/24. https://doi.org/10.1109/IPDPS.2006.1639333","raw_type":"info:eu-repo/semantics/conferenceObject"}],"best_oa_location":null,"sustainable_development_goals":[],"awards":[],"funders":[],"has_content":{"pdf":false,"grobid_xml":false},"content_urls":null,"referenced_works_count":17,"referenced_works":["https://openalex.org/W81486879","https://openalex.org/W1607166357","https://openalex.org/W1825216778","https://openalex.org/W1982169443","https://openalex.org/W2025496830","https://openalex.org/W2083613288","https://openalex.org/W2108167744","https://openalex.org/W2117293168","https://openalex.org/W2128564847","https://openalex.org/W2128854702","https://openalex.org/W2165863720","https://openalex.org/W2296772319","https://openalex.org/W4254859371","https://openalex.org/W6603333300","https://openalex.org/W6606178532","https://openalex.org/W6638601623","https://openalex.org/W6679232093"],"related_works":["https://openalex.org/W2075454349","https://openalex.org/W2145855242","https://openalex.org/W2010356481","https://openalex.org/W2016184125","https://openalex.org/W4236084769","https://openalex.org/W2103295733","https://openalex.org/W1862835629","https://openalex.org/W2136799148","https://openalex.org/W2897533804","https://openalex.org/W2890506991"],"abstract_inverted_index":{"As":[0],"the":[1,32,79,106,112,117,140,149,158],"size":[2],"of":[3,16,18,81,142],"today's":[4,82],"high":[5,83,127],"performance":[6,84,128,171],"computers":[7,24],"increases":[8],"from":[9],"hundreds,":[10],"to":[11,35,53,111,125,148,163],"thousands,":[12],"and":[13,87,122],"even":[14],"tens":[15],"thousands":[17],"processors,":[19],"node":[20],"failures":[21,166],"in":[22,78],"these":[23],"are":[25,69,75],"becoming":[26],"frequent":[27],"events.":[28],"Although":[29],"checkpoint/rollback-recovery":[30],"is":[31,48,161],"typical":[33],"technique":[34,144],"tolerate":[36],"such":[37],"failures,":[38],"it":[39,124,147],"often":[40,70],"introduces":[41],"a":[42,49,168],"considerable":[43],"overhead.":[44,172],"Algorithm-based":[45],"fault":[46,55,63,109],"tolerance":[47,56,64,110],"very":[50,169],"cost-effective":[51],"method":[52],"incorporate":[54],"into":[57],"matrix":[58,67,85,129],"computations.":[59],"However,":[60],"previous":[61],"algorithm-based":[62,108],"methods":[65],"for":[66],"computations":[68,86,130],"derived":[71],"using":[72],"algorithms":[73],"that":[74,157],"seldomly":[76],"used":[77],"practice":[80],"have":[88],"mostly":[89],"focused":[90],"on":[91],"platforms":[92],"where":[93,116],"failed":[94,118],"processors":[95],"produce":[96],"incorrect":[97],"calculations.":[98],"To":[99],"fill":[100],"this":[101,103,143],"gap,":[102],"paper":[104],"extends":[105],"existing":[107],"volatile":[113],"computing":[114],"platform":[115],"processor":[119],"stops":[120],"working":[121],"applies":[123],"scalable":[126],"with":[131,167],"two":[132],"dimensional":[133],"block":[134],"cyclic":[135],"data":[136],"distribution.":[137],"We":[138],"show":[139],"practicality":[141],"by":[145],"applying":[146],"ScaLAPACK/PBLAS":[150],"matrix-matrix":[151],"multiplication":[152],"kernel.":[153],"Experimental":[154],"results":[155],"demonstrate":[156],"proposed":[159],"approach":[160],"able":[162],"survive":[164],"process":[165],"low":[170]},"counts_by_year":[{"year":2024,"cited_by_count":1},{"year":2022,"cited_by_count":1},{"year":2020,"cited_by_count":1},{"year":2018,"cited_by_count":1},{"year":2016,"cited_by_count":2},{"year":2015,"cited_by_count":1},{"year":2014,"cited_by_count":4},{"year":2012,"cited_by_count":2}],"updated_date":"2026-07-14T23:27:15.235271","created_date":"2025-10-10T00:00:00"}
