Jak ručně ověřit původ textu: od stylometrie po podezřelé vzorce
Otázka, zda text napsal člověk, nebo stroj, se dnes netýká jen učitelů a editorů. S rozvojem velkých jazykových modelů se každý, kdo publikuje, učí rozpoznávat signály, které prozrazují umělý původ. Nejde přitom o jednoduchý test, ale o kombinaci několika přístupů, jež dohromady dávají rozumnou míru jistoty. Prvním krokem je pochopit, co vlastně hledáme – a k tomu se hodí mít po ruce přehled toho, jak poznat text od umělé inteligence, protože bez znalosti typických znaků se snadno spleteme.
Stylometrie nabízí nejsystematičtější cestu. Sleduje frekvenci slov, délku vět, poměr mezi slovy funkčními a plnovýznamovými, ale i to, jak často se v textu opakují stejné obraty. Umělé modely mají tendenci držet se průměru – vyhýbají se výrazným odchylkám, málo používají nespisovné tvary a málokdy si dovolí skutečně neobvyklý slovosled. Naproti tomu lidský autor kolísá: někde napíše krátkou úsečnou větu, jinde se rozjede do souvětí, které by editor možná zkrátil. Právě toto kolísání je jedním z nejsilnějších signálů.
Druhou rovinou jsou podezřelé vzorce, které se projeví až při pozornějším čtení. Patří sem nadužívání spojovacích výrazů typu „navíc“, „kromě toho“ nebo „v neposlední řadě“, které se objevují v každém odstavci, jako by šlo o šablonu. Dále si všímejte takzvaných halucinací: konkrétní jméno, datum nebo citace, které znějí věrohodně, ale po ověření neexistují. Pomůže i zpětný překlad do jiného jazyka a zase zpět – pokud se text vrátí v podobné, až podezřele hladké podobě, je to varovný signál. A v neposlední řadě zkuste text přečíst nahlas. Lidský projev má rytmus, dech a občasné zaváhání; strojový výstup bývá monotónní.
Ruční ověření nikdy nedá stoprocentní odpověď, ale dokáže odhalit dost na to, abychom s textem zacházeli obezřetně. Kombinujte stylometrická měření s kvalitativním čtením, hledejte konkrétní fakta a nebojte se požádat autora o kontext vzniku. Čím víc vrstev kontroly zapojíte, tím menší je riziko, že se necháte oklamat.