Key points are not available for this paper at this time.
Cet article postule que les tendances technologiques posent de nouveaux défis pour la tolérance aux pannes dans les microprocesseurs. En particulier, une réduction sévère des tolérances de conception impliquées par des fréquences de fonctionnement en gigahertz peut entraîner des pannes transitoires fréquentes et arbitraires. Nous suggérons que les techniques de tolérance aux pannes existantes - approches au niveau système, au niveau des portes ou spécifiques aux composants - sont soit trop coûteuses pour l'informatique à usage général, soit trop intrusives pour la conception, soit insuffisantes pour couvrir les pannes logiques arbitraires. Une approche dans laquelle la microarchitecture elle-même fournit une tolérance aux pannes est nécessaire. Nous proposons une nouvelle approche de tolérance aux pannes par redondance temporelle dans laquelle un programme est dupliqué et les deux programmes redondants fonctionnent simultanément sur le processeur : La technique exploite plusieurs tendances microarchitecturales significatives pour fournir une couverture large des pannes transitoires et une couverture limitée des pannes permanentes. Ces tendances incluent le multithreading simultané, la prédiction de flux de contrôle et de flux de données, et les processeurs hiérarchiques - tous destinés à de meilleures performances, mais qui peuvent être facilement adaptés aux objectifs de tolérance aux pannes spécifiés. Le coût pour atteindre la tolérance aux pannes est faible, tant en termes de performance que de changements apportés à la microarchitecture existante. Des simulations détaillées de cinq des benchmarks SPEC95 montrent que l'exécution de deux programmes redondants sur la microarchitecture tolérante aux pannes prend seulement 10 % à 30 % de temps de plus que l'exécution d'une seule version du programme.
Eric Rotenberg (Mon,) a étudié cette question.