Konwertuj pdf do bibtex

Konwertuj PDF na BIBTEX

Wyodrębniaj zweryfikowane cytowania BibTeX z naukowych plików PDF za pomocą Zotero, metadanych DOI, OCR i narzędzi wsadowych.

Konwertuj pliki PDF online

Nie mamy jeszcze dedykowanego konwertera online dla PDF na BIBTEX, ale pliki PDF możesz przekonwertować online na te i inne formaty:

Jak konwertować pdf do bibtex

Naukowcy otrzymują artykuły w formacie PDF, ale potrzebują rekordów .bib, aby cytować je w LaTeX, Overleaf lub współdzielonej bazie bibliograficznej. Przydatnym rezultatem są metadane bibliograficzne — autorzy, tytuł, dane publikacji i DOI — a nie konwersja układu stron PDF.

Pliki PDF i BibTeX

PDF (Portable Document Format) to format dokumentów o stałym układzie, utworzony przez Adobe i ustandaryzowany jako ISO 32000. Wydawcy, uniwersytety, firmy, skanery, aplikacje biurowe i przeglądarki internetowe korzystają z PDF, ponieważ zachowuje on wygląd dokumentu, czcionki, obrazy i numerację stron w różnych systemach.

Naukowy plik PDF może zawierać metadane dostarczone przez wydawcę, zaznaczalny tekst, DOI i osadzone informacje bibliograficzne. Skanowany plik PDF może zawierać wyłącznie obrazy stron, dlatego oprogramowanie musi najpierw zastosować OCR, a następnie wywnioskować metadane z rozpoznanego tekstu.

BibTeX to format bibliograficznej bazy danych w postaci zwykłego tekstu, używany w procesach pracy BibTeX i BibLaTeX w LaTeX. Przechowuje wpisy takie jak @article, @book i @inproceedings, wraz z polami obejmującymi author, title, journal, year, volume, pages, doi i url.

Konwencjonalnym rozszerzeniem jest .bib; chociaż niektóre programy akceptują .bibtex, używaj .bib, aby zapewnić najszerszą kompatybilność. Pliki BibTeX można edytować w edytorze tekstu, śledzić w Git, scalać z innymi bibliotekami i cytować za pomocą stabilnych kluczy, takich jak smith2024.

Wyodrębnianie rekordu za pomocą Zotero

Zotero to najbardziej praktyczna opcja desktopowa dla pojedynczych plików PDF z publikacjami naukowymi. Rozpoznaje artykuły na podstawie DOI, osadzonych metadanych, danych wydawcy lub dopasowania tytułu, a następnie eksportuje wynikowy rekord biblioteki jako BibTeX.

  1. Przeciągnij plik paper.pdf do biblioteki Zotero.
  2. Kliknij plik PDF prawym przyciskiem myszy i wybierz Retrieve Metadata for PDF. Zotero utworzy nadrzędny element bibliograficzny, jeśli rozpozna dopasowanie.
  3. Porównaj utworzony element z pierwszą stroną pliku PDF oraz stroną docelową wydawcy lub DOI.
  4. Kliknij nadrzędny element prawym przyciskiem myszy i wybierz Export Item…, następnie wybierz BibTeX i zapisz wynik na przykład jako references.bib. Aby wyeksportować wiele rekordów, umieść je w kolekcji i użyj opcji File → Export Library… lub wyeksportuj kolekcję.

Aby uzyskać automatyczne klucze cytowań oraz bardziej konfigurowalne dane wyjściowe BibTeX lub BibLaTeX, zainstaluj rozszerzenie Better BibTeX dla Zotero. Sprawdź wygenerowany klucz przed użyciem go w manuskrypcie, zwłaszcza gdy nazwiska autorów lub lata publikacji są niepełne.

cb2Bib to przydatna desktopowa alternatywa do wyodrębniania szczegółów cytowania z tekstu PDF lub skopiowanego tekstu. Jest najbardziej skuteczny, gdy plik PDF zawiera zaznaczalny tekst oraz wyraźny tytuł, wiersz autorów, DOI lub odwołanie do czasopisma; przejrzyj proponowany wpis przed zapisaniem go w bazie danych .bib.

JabRef może wyszukiwać metadane na podstawie DOI, ISBN, tytułu lub zaimportowanego pliku PDF, a następnie zapisać bibliotekę bezpośrednio jako bazę danych BibTeX. Wyszukiwanie metadanych jest lepsze niż ręczne przepisywanie cytowania, ale wynikowy wpis nadal wymaga weryfikacji.

Korzystanie z DOI i internetowych usług metadanych

Jeśli plik PDF zawiera DOI, użyj tego DOI zamiast przesyłać dokument do nieznanego konwertera. Wyszukaj DOI lub dokładny tytuł na stronie search.crossref.org, zweryfikuj autorów, publikację i rok, a następnie skopiuj lub pobierz cytowanie BibTeX. Metadane Crossref są dostarczane przez wydawców i agencje rejestracyjne, ale rekordy nadal mogą być niekompletne lub korygowane po publikacji.

Wiele rejestrów DOI obsługuje negocjację treści BibTeX. To polecenie bezpośrednio żąda rekordu BibTeX z resolvera DOI:

curl -L -H "Accept: application/x-bibtex" https://doi.org/10.1234/example > reference.bib

Zastąp przykładowy DOI DOI artykułu. Sprawdź wygenerowany plik, ponieważ klucz cytowania, wielkość liter w tytule, zakres stron i typ wpisu mogą wymagać dostosowania.

Google Scholar może dostarczyć zapasowy rekord: znajdź dokładny artykuł, wybierz element Cite oznaczony cudzysłowem, a następnie wybierz BibTeX. Scholar jest przydatny w przypadku artykułów bez DOI, ale jego metadane są agregowane z wielu źródeł i nie należy traktować ich jako autorytatywnych. Nie przesyłaj nieopublikowanych, poufnych ani chronionych prawem autorskim plików PDF do konwertera internetowego, chyba że jego zasady prywatności zezwalają na takie użycie.

Przetwarzanie skanów i partii plików

Przed zaimportowaniem skanu zawierającego wyłącznie obrazy uruchom OCR. Adobe Acrobat udostępnia opcję All tools → Scan & OCR → Recognize text; lokalną opcją open source jest:

ocrmypdf scan.pdf searchable.pdf

Po wykonaniu OCR zaimportuj plik searchable.pdf do Zotero, cb2Bib lub JabRef. OCR może błędnie odczytać inicjały, łączniki, nazwiska z znakami diakrytycznymi i DOI, dlatego wyszukaj odzyskany DOI lub tytuł w metadanych wydawcy, zamiast ufać wyłącznie tekstowi OCR.

W przypadku dużych partii naukowych plików PDF GROBID wyodrębnia uporządkowane metadane nagłówków i bibliografii do TEI XML. Po uruchomieniu jego usługi lokalnej przetwórz plik za pomocą:

curl -F input=@paper.pdf http://localhost:8070/api/processHeaderDocument > paper.tei.xml

GROBID nie tworzy bezpośrednio gotowej bazy danych BibTeX z tego punktu końcowego; wymagany jest skrypt TEI-to-BibTeX lub potok metadanych. Używaj go, gdy ekstrakcja partii plików uzasadnia nakład pracy związany z konfiguracją i walidacją.

Weryfikacja wyeksportowanego wpisu

Plik PDF nie zawiera z natury wpisu BibTeX. Narzędzia identyfikacyjne łączą osadzone metadane, wyodrębniony tekst, wyszukiwanie DOI i dopasowywanie tytułu, dlatego pozornie wiarygodny rekord może opisywać niewłaściwą pracę lub zawierać nieprawidłowe pola.

Sprawdź typ wpisu; pisownię i kolejność autorów; tytuł; tytuł czasopisma, książki lub konferencji; rok; tom; numer; strony lub numer artykułu; DOI oraz URL. Jako podstawę weryfikacji wykorzystaj stronę docelową DOI lub stronę wydawcy. Chroń akronimy i wymaganą wielkość liter w polach tytułu BibTeX za pomocą nawiasów klamrowych, gdy wybrany styl bibliografii może zmienić je na małe litery, na przykład title = {Methods for {PDF} and {LaTeX} Archives}.

BibTeX przechowuje metadane cytowania, a nie sam plik PDF. Przechowuj plik PDF jako załącznik Zotero lub w folderze projektu, a w rekordzie .bib zachowaj DOI lub stabilny URL wydawcy.

Porównanie formatu PDF z BIBTEX

Jak formaty PDF i BIBTEX wypadają w porównaniu pod względem najważniejszych cech dla tej konwersji.

Porównanie formatów plików PDF i BIBTEX
Cecha .PDF Portable Document Format .BIBTEX BibTeX bibliography database
Edytowalny tekst Ograniczone Tak
Stały układ strony Tak Nie
Formatowanie tekstu Rozbudowany Podstawowy
Obrazy Tak Nie
Elementy interaktywne Ograniczone Nie
Ochrona hasłem Podstawowy Brak obsługi
Otwiera się w przeglądarce internetowej Tak, natywnie Nie
Typowy rozmiar pliku Średni Bardzo mały
Otwarty standard Tak Częściowo otwarty
Najlepszy do Publikacja Wymiana danych
Wprowadzono 1993 1985
Twórca Adobe Systems (now Adobe Inc.); standardized by ISO Oren Patashnik (original BibTeX system, Donald E. Knuth's TeX ecosystem)
Typ MIME application/pdf —