GDELT (Global Database of Events, Language, and Tone) to otwarty projekt badawczy monitorujący światowe media drukowane, internetowe i nadawcze w ponad 100 językach. Jego celem nie jest stworzenie kolejnego archiwum artykułów, lecz automatyczne przekształcanie przekazu medialnego w dane nadające się do analizy ilościowej. GDELT identyfikuje m.in. wydarzenia, osoby, organizacje, miejsca, tematy, cytaty, obrazy i emocje występujące w wiadomościach.

Podstawowe zasoby obejmują GDELT Event Database, rejestrującą ponad 300 kategorii wydarzeń, oraz Global Knowledge Graph (GKG), który opisuje osoby, instytucje, miejsca, tematy i nastroje występujące w przekazie medialnym. Historyczny zasób Event Database sięga 1 stycznia 1979 roku, a GDELT 2.0 aktualizuje dane co 15 minut.

Najlepsze do:

  • analizowania, jak często dane wydarzenie, państwo, osoba lub organizacja pojawiają się w światowych mediach,
  • badania zmian zainteresowania medialnego w czasie,
  • tworzenia szeregów czasowych dotyczących wydarzeń politycznych, społecznych, gospodarczych i konfliktów,
  • identyfikowania protestów, konfliktów, negocjacji, spotkań dyplomatycznych i innych typów zdarzeń,
  • porównywania sposobu relacjonowania wydarzeń w różnych państwach i językach,
  • badania globalnego dyskursu medialnego na dużych zbiorach danych,
  • analizy osób, organizacji, miejsc i tematów współwystępujących w wiadomościach,
  • analizowania tonu i kategorii emocjonalnych przekazu; GDELT 2.0 wykorzystuje tysiące kategorii tematycznych i emocjonalnych,
  • wyszukiwania artykułów w wielu językach przy użyciu angielskich zapytań dzięki warstwie automatycznego tłumaczenia GDELT Translingual, obejmującej 65 języków,
  • mapowania miejsc wspominanych w mediach i badania geograficznego rozkładu przekazu,
  • analizowania powiązań między wydarzeniami a sposobem ich przedstawiania przez media,
  • badań ilościowych w medioznawstwie, politologii, socjologii, stosunkach międzynarodowych i digital humanities,
  • pracy z bardzo dużymi zbiorami danych przez Google BigQuery,
  • pobierania surowych danych GDELT jako plików CSV i dalszej analizy we własnym środowisku,
  • korzystania z API do budowania własnych wyszukiwarek, map i wizualizacji; DOC 2.0 API może zwracać m.in. listy artykułów i dane JSON,
  • znajdowania podobnych relacji medialnych w różnych językach za pomocą Global Similarity Graph,
  • prowadzenia szerszej kwerendy razem z Media Cloud, Factiva, Nexis Uni, Global Newsstream, NewsBank Access World News i Europresse. GDELT najlepiej sprawdza się przy analizie danych i trendów medialnych, natomiast klasyczne bazy prasowe są lepsze do czytania pełnych tekstów artykułów.

Na co uważać?

  • GDELT nie jest archiwum pełnych tekstów prasy. Udostępnia przede wszystkim dane wyprowadzone z artykułów oraz linki do materiałów źródłowych,
  • pełny tekst może być analizowany wewnętrznie przez system, ale nie jest przekazywany użytkownikowi jako część otwartego datasetu,
  • jeżeli artykuł zostanie usunięty ze strony wydawcy lub trafi za paywall, link zapisany przez GDELT może już nie prowadzić do dostępnego tekstu,
  • GDELT nie monitoruje całego internetu i nie gwarantuje kompletnego pokrycia wszystkich mediów,
  • intensywność monitorowania poszczególnych państw, języków i źródeł może być różna,
  • automatyczne rozpoznawanie wydarzeń, nazw, lokalizacji, tematów i emocji może generować błędy,
  • dane nie są kodowane ręcznie. Wynik klasyfikacji trzeba traktować jako rezultat automatycznej analizy tekstu, a nie zweryfikowaną interpretację wydarzenia,
  • rekord „wydarzenia” w Event Database oznacza wydarzenie opisane przez media, a nie niezależnie potwierdzony fakt,
  • jedno rzeczywiste wydarzenie może być opisane przez wiele artykułów i wygenerować wiele powiązanych rekordów lub mentions,
  • przy analizie ilościowej trzeba kontrolować zmiany w liczbie źródeł, językach i technologii przetwarzania w czasie,
  • automatyczne tłumaczenie pozwala porównywać wiele języków, ale może zmieniać znaczenie nazw, idiomów i kontekstu,
  • wskaźniki tonu i emocji nie powinny być interpretowane jako obiektywna miara nastrojów całych społeczeństw; opisują przede wszystkim język materiałów medialnych,
  • różne komponenty GDELT mają różny zakres chronologiczny. GDELT 2.0 działa od lutego 2015 roku, podczas gdy starsza Event Database umożliwia analizę od 1979 roku.
  • GDELT jest w 2026 roku w trakcie dużej przebudowy infrastruktury związanej z przygotowywanym GDELT 5 i migracją usług wyszukiwawczych do Google Spanner. Niektóre interfejsy i API mogą więc zmieniać sposób działania lub być przebudowywane.
  • przy bardzo dużych analizach korzystanie z BigQuery może generować koszty po stronie Google Cloud, mimo że same dane GDELT są otwarte.

Typ:

Globalna platforma otwartych danych i narzędzi do automatycznej analizy światowego przekazu medialnego oraz wydarzeń opisywanych przez media.

Dla kogo:

Medioznawcy, politolodzy, socjolodzy, ekonomiści, badacze stosunków międzynarodowych, specjaliści digital humanities i data science, dziennikarze danych oraz osoby analizujące globalne wydarzenia i dyskurs medialny na dużych zbiorach danych.

Zawartość:

Najważniejszym elementem jest GDELT Event Database, która koduje informacje o wydarzeniach występujących w światowych mediach według taksonomii CAMEO. Rejestrowane są m.in. uczestnicy wydarzenia, jego typ, lokalizacja, data, źródła medialne i inne cechy. System rozpoznaje ponad 300 kategorii działań, takich jak protesty, negocjacje, apele, konflikty czy działania dyplomatyczne. Global Knowledge Graph opisuje z kolei warstwę kontekstową wiadomości: osoby, organizacje, przedsiębiorstwa, miejsca, tematy, liczby i emocje występujące w materiałach. GDELT 2.0 przetwarza wiadomości co 15 minut i wykorzystuje automatyczne tłumaczenie 65 języków do wspólnej analizy. Do dyspozycji są również m.in. dane o wzmiankach o wydarzeniach, geografii, podobieństwie artykułów, obrazach oraz zmianach zachodzących w treści stron. Dane można analizować przez API, Google BigQuery albo pobierać w postaci surowych plików.

Pełny tekst:

Tylko metadane. GDELT analizuje pełną treść materiałów medialnych, ale jego otwarte datasety zawierają przede wszystkim wynik tej analizy: adres źródłowy, informacje o wydarzeniu, podmiotach, lokalizacjach, tematach, emocjach i innych cechach. Oryginalny artykuł trzeba otworzyć u wydawcy.

Dostęp:

Darmowy. Dane GDELT są otwarte i mogą być wykorzystywane bez opłat do celów akademickich, komercyjnych i administracyjnych. Surowe datasety można pobierać bezpośrednio, a część zasobów jest dostępna przez API oraz Google BigQuery.

Ostatnio sprawdzono: październik 2026

Twoje zapisane źródła

Ładowanie listy...