Konwertuj webarchive do html

Konwertuj WEBARCHIVE na HTML

Wyodrębnij zawartość Safari WEBARCHIVE jako edytowalny kod HTML zgodny z przeglądarkami.

Twórz pliki HTML online

Nie potrafimy jeszcze odczytać plików WEBARCHIVE, więc tej konwersji nie oferujemy. Jeśli możesz wyeksportować swoją pracę do jednego z tych lub innych formatów, zrobimy z niego HTML:

Jak konwertować webarchive do html

Archiwum Safari może wymagać konwersji, gdy edytor, serwer WWW lub przeglądarka inna niż Apple wymaga zwykłego pliku .html. Konwersja ułatwia również przeglądanie, edytowanie i udostępnianie dokumentu bez Safari.

Czym jest format .webarchive

Plik .webarchive jest zwykle binarnym archiwum Apple w formacie property-list, utworzonym przez Safari lub inną aplikację opartą na WebKit. Może zawierać kod HTML strony, obrazy, arkusze stylów, skrypty, fonty i metadane w jednym pliku, dzięki czemu kopię offline można ponownie otworzyć z zachowaniem dużej części oryginalnego wyglądu.

Safari tworzy taki plik za pomocą File → Save As, gdy jako format wybrano Web Archive. WEBARCHIVE to kontener powiązany z Apple, a nie standardowy format obsługiwany przez wszystkie przeglądarki lub serwery WWW.

Czym jest format .html

HTML to standardowy język znaczników używany do tworzenia stron WWW. Plik .html można otworzyć w nowoczesnych przeglądarkach, edytować w edytorze kodu, opublikować na serwerze WWW oraz przetwarzać za pomocą narzędzi do indeksowania lub obsługi dokumentów bez Safari.

HTML zwykle zawiera odwołania do oddzielnych plików obrazów, CSS, JavaScript i fontów. Zmiana rozszerzenia lub wyodrębnienie tylko głównego zasobu nie tworzy automatycznie kompletnej kopii offline.

Konwersja za pomocą Safari w macOS

  1. Otwórz plik .webarchive w Safari.
  2. Wybierz File → Save As.
  3. W menu formatu wybierz Page Source lub Page Source HTML, zależnie od wersji Safari.
  4. Zapisz plik z rozszerzeniem .html.

To najszybsza metoda na komputerze, ale poszczególne wersje Safari różnią się od siebie. Niektóre instalacje udostępniają w oknie zapisywania wyłącznie opcję Web Archive; w takim przypadku użyj opisanej niżej metody wyodrębniania. Wyeksportowany kod źródłowy może nie zawierać każdego zarchiwizowanego zasobu podrzędnego w oddzielnym katalogu lokalnym.

Wyodrębnianie głównego zasobu za pomocą Python

Biblioteka standardowa Python może odczytać binarną strukturę property-list bez instalowania konwertera. Zapisz poniższy kod jako extract_webarchive.py:

import plistlib
import sys

source, destination = sys.argv[1], sys.argv[2]
with open(source, 'rb') as file:
    archive = plistlib.load(file)

main = archive['WebMainResource']
data = main['WebResourceData']
if not isinstance(data, bytes):
    raise TypeError('WebResourceData is not binary data')

with open(destination, 'wb') as file:
    file.write(data)

Uruchom go w Terminalu, Command Prompt lub PowerShell za pomocą Python 3:

python3 extract_webarchive.py "saved-page.webarchive" "saved-page.html"

Dane wyjściowe to zazwyczaj główny zasób HTML archiwum. Sprawdź WebResourceMIMEType archiwum, jeśli wynik nie jest czytelnym tekstem; głównym zasobem może być zamiast tego plik PDF, obraz lub plik innego typu.

Konwersja online i alternatywy na komputer

Safari nadaje się do jednorazowej konwersji w macOS, natomiast metoda z użyciem Python jest powtarzalna i działa w innych systemach z Python 3. W przypadku pliku niezawierającego danych wrażliwych można rozważyć CloudConvert lub Zamzar, ale tylko wtedy, gdy aktualna lista formatów usługi wyraźnie oferuje .webarchive jako format wejściowy, a HTML jako wyjściowy. Przesłanie archiwum może ujawnić zawartość strony, osadzone dane, adresy URL lub informacje związane z uwierzytelnianiem, a obsługa tego specyficznego dla Apple formatu online jest niespójna.

Ograniczenia jakości i zgodności

  • Wyodrębniony HTML może nadal odwoływać się do oryginalnej witryny, dlatego obrazy i style mogą zniknąć offline lub po zmianie witryny.
  • JavaScript zależny od API Safari, plików cookie, pamięci lokalnej, uwierzytelniania, żądań po stronie serwera lub usług zewnętrznych może nie działać po wyodrębnieniu.
  • Kompletna kopia offline wymaga wyodrębnienia zasobów podrzędnych wymienionych w tablicy WebSubresources archiwum, zapisania ich w katalogu zasobów oraz przepisania odwołań w kodzie HTML. Prosty skrypt wyodrębnia tylko WebMainResource.
  • Główny zasób może przedstawiać źródło oryginalnego dokumentu, a nie końcowy DOM utworzony przez JavaScript. Sprawdź wynik w przeglądarce i skontroluj odwołania do obrazów, arkuszy stylów i skryptów.
  • Żądanie zapisania HTML zmienia format kontenera; nie zachowuje wszystkich metadanych archiwum Safari ani nie gwarantuje identycznego renderowania co do piksela.

Porównanie formatu WEBARCHIVE z HTML

Jak formaty WEBARCHIVE i HTML wypadają w porównaniu pod względem najważniejszych cech dla tej konwersji.

Porównanie formatów plików WEBARCHIVE i HTML
Cecha .WEBARCHIVE Safari Web Archive .HTML HyperText Markup Language
Otwiera się w przeglądarce internetowej Nie Tak, natywnie
Czytelny tekstowo — Tak
Formatowanie tekstu Podstawowy Rozbudowany
Obrazy Tak Tak
Elementy interaktywne Ograniczone Tak
Dalsza edycja Ograniczone Łatwy
Typowy rozmiar pliku Duży Mały
Otwarty standard Nie Tak
Wprowadzono 2003 1993
Twórca Apple Inc. W3C / WHATWG
Typ MIME application/x-webarchive text/html

Dodatkowe formaty dla konwersji pliku
webarchive

Konwersja do .html
z innych formatów

Udostępnij w mediach społecznościowych: