Konwertuj txt do dic

Konwertuj TXT na DIC

Formatuj listę słów TXT dla słowników plain-list, Hunspell lub specyficznych dla aplikacji DIC.

Konwertuj pliki TXT online

Nie mamy jeszcze dedykowanego konwertera online dla TXT na DIC, ale pliki TXT możesz przekonwertować online na te i inne formaty:

Jak konwertować txt do dic

Niestandardowe moduły sprawdzania pisowni, narzędzia terminologiczne i silniki słownikowe często akceptują słownictwo wyłącznie w określonym układzie .dic. Lista słów przechowywana w pliku .txt musi więc zostać oczyszczona i sformatowana tak, aby pasowała do programu docelowego, a nie tylko przemianowana.

Pliki TXT i ich zastosowanie

Plik .txt to zwykły tekst bez wymaganej struktury pól. Edytory tekstu, takie jak Notepad, TextEdit, Notepad++ i VS Code, tworzą pliki TXT; arkusze kalkulacyjne, bazy danych, systemy terminologiczne i skrypty często eksportują do nich listy słów.

Plik źródłowy może zawierać jedno słowo w wierszu, terminy rozdzielone przecinkami, nagłówki, definicje, duplikaty lub zwykły tekst. W pliku słownika powinny znaleźć się wyłącznie wyodrębnione i zweryfikowane terminy.

Pliki DIC i ich warianty

Rozszerzenie .dic nie oznacza jednego uniwersalnego formatu słownika. Niektóre aplikacje używają listy słów UTF-8 z jednym wpisem w wierszu, podczas gdy inne korzystają ze słowników zgodnych z Hunspell, zastrzeżonych układów tekstowych lub plików binarnych.

Plik .dic Hunspell zwykle zawiera w pierwszym wierszu liczbę słów, a następnie wpisy, takie jak colour/AB. Opcjonalne flagi są definiowane przez pasujący plik .aff, który określa kodowanie, reguły afiksów, reguły tworzenia wyrazów złożonych i znaczenie flag. Plik DIC bez właściwego pliku AFF nie może samodzielnie dodawać poprawnych reguł odmiany.

Poprawnie sformatowany plik DIC pozwala oprogramowaniu docelowemu rozpoznawać zatwierdzone nazwy, terminy techniczne, skróty i warianty pisowni. Słowniki w formie zwykłych list są kompaktowe i łatwe do edycji, ale rozpoznają wyłącznie dosłowne wpisy, chyba że aplikacja obsługuje własne reguły morfologiczne.

Przygotowanie listy źródłowej

  1. Sprawdź dokumentację programu docelowego i przeanalizuj znany działający plik słownika w VS Code lub Notepad++. Zapisz jego nazwę, kodowanie, pierwsze wiersze, wymagane pliki pomocnicze i składnię wpisów.
  2. Otwórz źródło TXT i usuń nagłówki, definicje, puste wiersze, wpisy zawierające wyłącznie znaki interpunkcyjne oraz terminy, które nie powinny być akceptowane przez moduł sprawdzania pisowni.
  3. Umieść jeden zaakceptowany wpis w każdym wierszu. Zachowaj wyrażenia tylko wtedy, gdy format słownika aplikacji docelowej obsługuje wpisy wielowyrazowe.
  4. Przed usunięciem duplikatów wybierz zasady dotyczące wielkości liter. Nazwy produktów i skróty mogą wymagać osobnych wpisów dla Acme, ACME i acme.
  5. Zapisz oczyszczone źródło jako UTF-8, chyba że słownik docelowy wyraźnie wymaga innego kodowania.

Tworzenie wymaganego formatu DIC

W przypadku aplikacji, która opisuje format DIC w postaci zwykłej listy słów, zapisz oczyszczoną listę pod wymaganą nazwą pliku .dic za pomocą polecenia File → Save As. Zmiana rozszerzenia jest poprawna tylko wtedy, gdy aplikacja wyraźnie traktuje plik DIC jako listę zwykłego tekstu.

W przypadku środowiska docelowego Hunspell skopiuj składnię z istniejącego słownika i użyj odpowiadającego mu pliku .aff. Umieść wymaganą liczbę wpisów w pierwszym wierszu, jeśli przykładowy słownik środowiska docelowego tak robi; liczba ta nie obejmuje wiersza z liczbą. Dodawaj flagi tylko wtedy, gdy są zdefiniowane w tym pliku AFF. Dowolne flagi nie tworzą liczby mnogiej, form czasownikowych ani wyrazów złożonych.

W PowerShell 7 to polecenie przycina źródło UTF-8 z jednym terminem w wierszu, usuwa dokładne zduplikowane wiersze, dodaje liczbę w stylu Hunspell i zapisuje plik UTF-8 bez znacznika kolejności bajtów:

$w = Get-Content words.txt | ForEach-Object { $_.Trim() } | Where-Object { $_ } | Sort-Object -CaseSensitive -Unique; @($w.Count) + $w | Set-Content -Encoding utf8NoBOM custom.dic

Używaj tego polecenia dopiero po potwierdzeniu, że środowisko docelowe akceptuje nieotagowaną listę Hunspell oraz że plik custom.dic jest zainstalowany lub zarejestrowany wraz z odpowiednim plikiem .aff. W przypadku eksportów z arkuszy kalkulacyjnych lub powtarzalnych importów skrypt PowerShell lub Python jest bezpieczniejszy niż ręczna edycja, ponieważ filtrowanie, obsługa duplikatów i liczba wpisów pozostają powtarzalne.

Narzędzia i kontrole zgodności

VS Code i Notepad++ nadają się do sprawdzania kodowania, końców wierszy i składni przykładowego słownika. PyGlossary może konwertować obsługiwane formaty słowników, ale nie jest uniwersalnym rozwiązaniem dla dowolnych plików TXT ani zastrzeżonych wariantów DIC; sprawdź, czy wybrane przez niego wtyczki wejściowe i wyjściowe odpowiadają dokładnie formatowi docelowemu.

Żaden ogólny konwerter online nie potrafi niezawodnie rozpoznać dialektu DIC. Unikaj usług obiecujących uniwersalną konwersję TXT do DIC, zwłaszcza w przypadku nazw klientów, wewnętrznej terminologii lub innego poufnego słownictwa. Korzystaj z internetowej usługi przetwarzania tekstu tylko wtedy, gdy jej składnię wyjściową i kodowanie można zweryfikować na podstawie dokumentacji aplikacji docelowej.

Dokładnie dopasuj kodowanie do środowiska docelowego. Pliki AFF Hunspell często zawierają SET UTF-8; UTF-16, Windows-1252 lub nieobsługiwany znacznik kolejności bajtów mogą uszkodzić znaki diakrytyczne albo spowodować niepowodzenie pierwszego wpisu.

Przetestuj zainstalowany słownik za pomocą zwykłego słowa, słowa ze znakami diakrytycznymi, terminu pisanego wielkimi literami i niestandardowego wpisu. Jeśli ładowanie się nie powiedzie, porównaj nazwę pliku, pierwszy wiersz, kodowanie, końce wierszy, lokalizację instalacji i wymagane pliki pomocnicze ze znanym działającym słownikiem.