Os servidores avariam, as pessoas apagam dados por engano, as atualizações correm mal e as contas são comprometidas. Nada disto pode ser totalmente excluído. O que se pode controlar é quantos dados se perdem e quanto tempo o negócio fica parado.
Decida o que pode dar-se ao luxo de perder
Duas perguntas definem o plano. Quantos dados pode perder - a última hora, o último dia? E quanto tempo pode o sistema estar indisponível - minutos, horas, um dia? Uma loja que recebe encomendas a qualquer hora precisa de cópias frequentes e de recuperação rápida; um website institucional que muda uma vez por mês pode viver com cópias diárias.
Copie tudo o que importa
A base de dados é a parte óbvia, mas não a única. Ficheiros e imagens carregados, configuração, definições do ambiente, tarefas agendadas e a versão exata do código também são necessários para repor um sistema. Escreva a lista completa uma vez e mantenha-a atualizada à medida que o sistema cresce.
Guarde cópias em mais de um sítio
Uma cópia no mesmo servidor do sistema desaparece com ele. Guarde cópias num local separado - outro fornecedor ou outra região - e mantenha pelo menos uma cópia que não possa ser alterada nem apagada a partir do sistema principal. Isto protege tanto de avarias de hardware como de ataques que tentam encriptar ou apagar os dados.
Automatize e monitorize
As cópias manuais esquecem-se exatamente quando são precisas. Agende-as automaticamente, mantenha um histórico de várias versões e configure um alerta se uma cópia falhar ou ficar suspeitamente pequena.
Teste a reposição
Uma cópia que nunca foi reposta é uma esperança, não um plano. Reponha regularmente uma cópia num ambiente separado e verifique que o sistema funciona e os dados estão completos. Meça quanto tempo demora: esse é o seu tempo real de recuperação.
Escreva os passos de recuperação
Quando algo avaria, o stress é elevado e o tempo é curto. Um documento breve com a ordem das ações, a localização das cópias, os acessos necessários e as pessoas a contactar transforma a recuperação num procedimento de rotina.
Em resumo
Defina a perda de dados e o tempo de paragem aceitáveis, copie a base de dados, os ficheiros e a configuração, guarde as cópias em separado e proteja pelo menos uma contra eliminação, automatize e monitorize, teste regularmente as reposições e documente os passos. Assim, uma falha é um incidente e não um desastre.