Największy polski słownik dostępny online
– To stuletnie już prawie dzieło notuje bardzo wiele form nie tylko z języka ogólnego, ale też gwarowych, zapożyczeń czy okazjonalizmów. Słownik zawiera liczne błędy i niekonsekwencje, ale dla leksykografów to nieocenione źródło wiedzy – wyjaśnił dr Mirosław Koziarski.
Słownik – opracowany przez zespół Jana Aleksandra Karłowicza, wybitnego etnologa i językoznawcy – opublikowano w latach 1900-1927 w ośmiu tomach. Oficjalnie zawierać miał on 280 tys. haseł (nowe wyliczenia pokazują jednak, iż haseł jest mniej – ok. 265 tysięcy) i do dziś jest największym objętościowo polskim słownikiem.
W ramach swojego doktoratu na Uniwersytecie im. Adama Mickiewicza w Poznaniu Mirosław Koziarski podjął się digitalizacji fragmentu słownika. Po doktoracie badania kontynuował hobbystycznie. We wrześniu 2026 r. podzielił się w internecie dotychczasowymi wynikami – na razie to jedna czwarta słownika – ok 86 tys. haseł.
– Udostępniona przeze mnie platforma pozwala na wygodne przeszukiwanie dotychczas opracowanych haseł, analizę statystyczną i porównywanie haseł ze współczesnymi słownikami. Planuję sukcesywnie opracowywać kolejne tomy i rozwijać to narzędzie z myślą o badaczach oraz wszystkich pasjonatach języka – powiedział dr Koziarski.
Dr Koziarski pracuje w prywatnej firmie, a digitalizację słownika kontynuuje po godzinach. – Zdecydowałem robić to na własny koszt, a nie zabiegać o granty naukowe i później je rozliczać – powiedział. Dodał, iż przed doktoratem brał udział w kilku projektach grantowych i biurokracja związana z tym systemem zniechęciła go do takiego modelu pracy. – Widzę, ile energii moi koledzy i koleżanki na uczelniach muszą poświęcać na sprawy organizacyjne i grantowe. Ja wolę przeznaczyć ten czas na rzeczy, które sam uważam za interesujące i warte zrobienia – dodał.
Pomogła sztuczna inteligencja
Największym wyzwaniem badawczym w digitalizacji była jakość dawnego OCR, czyli optycznego rozpoznawania znaków. – Kiedy zaczynałem pracę, przy tak specyficznym tekście pojawiało się od 100 do 150 błędów na skan jednej strony słownika. Technologie się jednak zmieniały i wykorzystanie nowoczesnych modeli AI pozwoliło zredukować tę liczbę do zaledwie kilku błędów na stronę – powiedział. O ile podczas doktoratu udało mu się scyfryzować ok. 80 stron słownika, o tyle teraz przez niecałe trzy miesiące opracował 2000 stron i całą platformę. W oryginalnym tekście jest mnóstwo wyrazów dawnych, a i sam nie jest wolny od błędów, sztucznej inteligencji – wskazał dr Koziarski - nie można do końca wierzyć, bo łatwo o pomyłki i halucynacje.
Dodał, iż jego cyfrowa wersja słownika również ma wiele niedociągnięć, dlatego do każdego hasła dołączone jest faksymile – można porównać cyfrową wersję ze skanem strony słownika i zgłaszać błędy.
Drugim wyzwaniem w cyfryzacji słownika była interpretacja struktury. Żeby przygotować cyfrową wersję słownika, nie wystarczyło zeskanować dzieła i wyciągnąć tekstu ze skanu, ale trzeba było rozbić artykuł hasłowy na elementy składowe tworzące różne elementy bazy danych – wskazać, która część hasła zawiera definicję, która – etymologię (pochodzenie słów), która – zawiera przykłady użycia, a która uwagi gramatyczne. – Autorzy nie zawsze stosowali idealnie spójną typografię, więc stworzyłem szeroki system reguł hierarchicznych, które pozwalają komputerowi "zrozumieć" intencje autorów – wyjaśnił dr Koziarski. Dzięki temu można teraz łatwo badać np. liczbę zapożyczeń z danego języka czy tworzyć bazy cytatów literackich.
Pytany, czy nie dziwi go język uwieczniony w "Słowniku Warszawskim", dr Koziarski odpowiedział, iż samo przeglądanie haseł po kolei nie daje pełnego obrazu codziennej polszczyzny.
– Okres międzywojenny to czas scalania ziem z trzech zaborów. Wiele słowników z tamtego okresu – zwłaszcza specjalistycznych - powstawało po to, by wypierać spolszczone wyrazy niemieckie, rosyjskie czy francuskie rodzimymi odpowiednikami. Bardzo dużo słownictwa wymyślano z miesiąca na miesiąc na potrzeby budowy państwowości – wyjaśnił. I dodał, iż "Słownik Warszawski" prezentuje język zamrożony w czasie, w momencie jego wydania.
Swoją drogą gwałtownie po jego wydaniu okazało się, iż w słowniku brakuje wielu słów, dlatego zaczął powstawać suplement słownika z kolejnymi 60 tys. haseł. Jedyna jego wersja zaginęła podczas drugiej wojny światowej.
"Słowniki są nietypowym gatunkiem literackim"
– Tradycyjne słowniki są nietypowym gatunkiem literackim – ich się nie czyta od deski do deski, one w sobie mają wbudowany system wyszukiwania informacji, czyli są takim bardzo starodawnym sposobem budowania bazy danych. Przez to jednak, iż ta baza danych jest w formie papierowej, to przeglądanie jej jest w pewien sposób narzucane. Dopiero oderwanie treści od papierowej formy (np. poprzez cyfryzację) pozwala na wydobycie ze słownika znacznie większej ilości informacji, które zwykle pozostawały niewidoczne – powiedział dr Koziarski. I tak np. na podstawie opracowanych haseł powstał korpus językowy – zbiór przykładów językowych użytych w słowniku.
– Język jest w głowach ludzi, ale nie ma całego języka w żadnej jednej głowie. Nikt nie zna całego języka, chyba iż byłby ostatnią osobą, która tym językiem mówi – podsumował badacz.






