Convertir webarchive en html

Convertir WEBARCHIVE en HTML

Extraire le contenu de Safari WEBARCHIVE sous forme de HTML modifiable et compatible avec les navigateurs.

Créer des fichiers HTML en ligne

Nous ne savons pas encore lire les fichiers WEBARCHIVE, cette conversion n’est donc pas proposée. Si vous pouvez exporter votre travail dans l’un de ces formats ou d’autres, nous en ferons un HTML :

Comment convertir webarchive en fichier html

  • Internet

Une archive Safari peut nécessiter une conversion lorsqu’un éditeur, un serveur web ou un navigateur autre qu’Apple requiert un fichier .html ordinaire. La conversion rend également le document plus facile à inspecter, modifier ou partager sans Safari.

Qu’est-ce que le format .webarchive ?

Un fichier .webarchive est généralement une archive binaire de liste de propriétés Apple créée par Safari ou une autre application basée sur WebKit. Il peut contenir le code HTML de la page, les images, les feuilles de style, les scripts, les polices et les métadonnées dans un seul fichier, ce qui permet de rouvrir une copie hors ligne avec une grande partie de son apparence d’origine.

Safari en crée une via File → Save As lorsque Web Archive est sélectionné comme format. WEBARCHIVE est un conteneur associé à Apple, et non un format standard pris en charge par tous les navigateurs ou serveurs web.

Qu’est-ce que le format .html ?

HTML est le langage de balisage standard utilisé pour les pages web. Un fichier .html peut être ouvert dans les navigateurs modernes, modifié dans un éditeur de code, publié sur un serveur web et traité par des outils d’indexation ou de documentation sans Safari.

HTML contient normalement des références vers des fichiers distincts d’images, de CSS, de JavaScript et de polices. Modifier l’extension ou extraire uniquement la ressource principale ne crée pas automatiquement une copie hors ligne complète.

Le convertir avec Safari sur macOS

  1. Ouvrez le fichier .webarchive dans Safari.
  2. Sélectionnez File → Save As.
  3. Dans le menu des formats, choisissez Page Source ou Page Source HTML, selon la version de Safari.
  4. Enregistrez le fichier avec une extension .html.

Il s’agit de la méthode de bureau la plus rapide, mais les versions de Safari diffèrent. Certaines installations n’affichent que Web Archive dans la boîte de dialogue d’enregistrement ; dans ce cas, utilisez la méthode d’extraction ci-dessous. Le code source exporté peut ne pas inclure chaque sous-ressource archivée dans un répertoire local distinct.

Extraire la ressource principale avec Python

La bibliothèque standard de Python peut lire la structure binaire de liste de propriétés sans installer de convertisseur. Enregistrez ceci sous le nom extract_webarchive.py :

import plistlib
import sys

source, destination = sys.argv[1], sys.argv[2]
with open(source, 'rb') as file:
    archive = plistlib.load(file)

main = archive['WebMainResource']
data = main['WebResourceData']
if not isinstance(data, bytes):
    raise TypeError('WebResourceData is not binary data')

with open(destination, 'wb') as file:
    file.write(data)

Exécutez-le depuis Terminal, Command Prompt ou PowerShell avec Python 3 :

python3 extract_webarchive.py "saved-page.webarchive" "saved-page.html"

La sortie correspond normalement à la ressource HTML principale de l’archive. Vérifiez le WebResourceMIMEType de l’archive si la sortie n’est pas du texte lisible ; la ressource principale peut être à la place un PDF, une image ou un autre type de fichier.

Conversion en ligne et alternatives de bureau

Safari convient à une conversion ponctuelle sur macOS, tandis que la méthode Python est reproductible et fonctionne sur d’autres systèmes équipés de Python 3. Pour un fichier non sensible, CloudConvert ou Zamzar peuvent être envisagés uniquement si la liste actuelle des formats du service propose explicitement .webarchive comme entrée et HTML comme sortie. Le téléversement d’une archive peut divulguer le contenu de sa page, des données intégrées, des URL ou des informations liées à l’authentification, et la prise en charge en ligne de ce format propre à Apple est irrégulière.

Limites de qualité et de compatibilité

  • Le code HTML extrait peut toujours référencer le site web d’origine ; les images et les styles peuvent donc disparaître hors ligne ou après une modification du site.
  • Le JavaScript qui dépend des API de Safari, des cookies, du stockage local, de l’authentification, des requêtes côté serveur ou de services externes peut ne plus fonctionner après l’extraction.
  • Une copie hors ligne complète nécessite d’extraire les sous-ressources répertoriées dans le tableau WebSubresources de l’archive, de les écrire dans un répertoire de ressources et de réécrire les références HTML. Le script simple extrait uniquement WebMainResource.
  • La ressource principale peut représenter le code source du document d’origine plutôt que le DOM final produit par JavaScript. Vérifiez le résultat dans un navigateur et inspectez ses liens vers les images, les feuilles de style et les scripts.
  • L’enregistrement au format HTML modifie le format du conteneur ; il ne conserve pas toutes les métadonnées de l’archive Safari et ne garantit pas un rendu identique au pixel près.

Comparaison du format WEBARCHIVE vs HTML

Comparaison entre les formats WEBARCHIVE et HTML sur les propriétés les plus importantes pour cette conversion.

Comparaison des formats de fichier WEBARCHIVE et HTML
Propriété .WEBARCHIVE Safari Web Archive .HTML HyperText Markup Language
S’ouvre dans un navigateur web Non Oui, nativement
Lisible en texte brut — Oui
Mise en forme du texte Basique Étendu
Images Oui Oui
Éléments interactifs Limité Oui
Modification ultérieure Limité Facile
Taille de fichier typique Grand Petit
Norme ouverte Non Oui
Date d’introduction 2003 1993
Développeur Apple Inc. W3C / WHATWG
Type MIME application/x-webarchive text/html

Autres conversions de fichiers .webarchive

Conversion vers .html
depuis d'autres formats

Partager sur les réseaux sociaux :