Perpleksja, nieokreśloność – miara niepewności wartości próbki z dyskretnego rozkładu prawdopodobieństwa. Im większa perpleksja, tym mniejsze prawdopodobieństwo, że obserwator odgadnie wartość, jaka zostanie wyciągnięta z rozkładu. Pojęcie perpleksji zostało pierwotnie wprowadzone w 1977 roku w teorii informacji w kontekście rozpoznawania mowy.
W przetwarzaniu języka naturalnego korpus to ustrukturyzowany zbiór tekstów lub dokumentów, a model języka to rozkład prawdopodobieństwa obejmujący całe teksty lub dokumenty. Dlatego w przetwarzaniu języka naturalnego powszechniej stosowaną miarą jest perpleksja PP na token (słowo lub podsłowo), definiowana jako średnia geometryczna odwrotności prawdopodobieństwa każdego tokena w testowym korpusie q: Gdzie są dokumentami w korpusie i jest liczbą tokenów w korpusie.
Nieformalnie, PP oznacza ilość możliwości szacowania następnego słowa w testowym korpusie.
Perpleksję zastosowano w celu porównania różnych modeli w tym samym zestawie danych i w celu optymalizacji hiperparametrów, chociaż stwierdzono, że jest ona wrażliwa na takie czynniki, jak cechy językowe i długość zdania.
Pomimo kluczowej roli, jaką odgrywa perpleksja w rozwoju modelu języka, wykazała ona swoje ograniczenia, zwłaszcza jako niewystarczający wyznacznik wydajności rozpoznawania mowy, nadmiernego dopasowania i uogólnienia.