Automatyzacja nieprawdy

Automatyzacja nieprawdy

 Ile razy zdarzyło Wam się wpisać jakieś hasło w wyszukiwarkę i otrzymać na szukane zagadnienie ✨wygenerowaną odpowiedź✨, która nie miała żadnego sensu? Znajomi lekarze zawsze się śmieją, żeby nie googlować swoich objawów, bo zawsze dostanie się diagnozę nowotworu, nawet jeśli chodzi o zapalenie zatok. I o ile przyjmuje się odbierane treści z dozą krytyki pozwalającej zauważyć błędne myślenie sztucznej inteligencji, problem pojawia się, gdy bierzemy podaną informację za fakt i nie dociekamy. Nie wątpimy. Nie sprawdzamy.

Wiele razy słyszałem, że jeśli czegoś nie wiesz, to wymyślaj, bo może się wstrzelisz. W dużym przybliżeniu na podobnej zasadzie działa chat GPT, który wielokrotnie podaje swoim użytkownikom błędne odpowiedzi z pewnością siebie godną największego klasowego zawadiaki. Przykład? Zapytany o to, czy w czasie wyborów w razie pomyłki można prosić komisję o nową kartę do głosowania, powiedział, że tak, oczywiście, nie ma najmniejszego problemy. Ba! Powołał się nawet na nieistniejące przepisy, które taki proceder mają dopuszczać [1].

 

Daj, ać ja pokminię, a ty poczywaj

Regularnie w naszym zespole wyłapujemy maile pisane do nas właśnie przez LLMy. Coś co, ma ułatwić komunikację, wcale tego nie robi – gubi się natomiast ustalenia z poprzednich wiadomości i powstaje ogromny bałagan wygenerowany automatycznie przez jedną z osób w korespondencji, a to, co można byłoby wyjaśnić w kilku słowach staje się rozwleczoną ścianą tekstu zbudowaną z okrągłych i pustych zdań. Jedyne osiągnięcie? Rozwodnienie komunikacji i frustracja po naszej stronie, gdy wiemy, że nie rozmawiamy już z osobą, a z botem.

LLMy miały zrewolucjonizować i robią to, ale nie w najbardziej naiwnych zastosowaniach. Są szybkie, proste w podstawowym użyciu, sprawiają wrażenie mądrych i przede wszystkim: darmowe. Po co lekarz miałby płacić za dowolne narzędzie, skoro tuż pod nosem ma mechanizm, który płatności nie wymaga, a posiada pozornie całą wiedzę, jaką można znaleźć w internecie? Od tego jak skonstruować laser na działce za domem (według instrukcji znalezionej na stronie spryciarze.pl), po skomplikowane diagnozy na podstawie badania obrazowego.

Tylko, że to nie jest prawda. 

Problem z LLMami w medycynie jest taki, że są bardzo omylne. W większości przypadków omylność człowiekowi można z łatwością wybaczyć, w kontrze do czego stoją wysiłki Naczelnej Izby Lekarskiej dotyczące wprowadzenia systemu no fault, gdyż oczekiwaniem ogółu pacjentów jest kontakt z lekarzem jako autorytetem, który wysłuchuje, pochyla się nad zgłaszanym problemem ze zdrowiem i mówi, jaka jest prawdziwa ścieżka postępowania. Pomyłka wygenerowana przez LLMy jest już o wiele bardziej szkodliwa, bo jest objawem automatyzacji generowania nieprawdy. LLM na obrazie widzi rzeczy, których nie ma. Eksperymenty dowodzą, że opisy produkowane przez GPT na podstawie wgrywanych obrazów są pełne błędów i zawierają szereg niepoprawnych diagnoz [2]. Na to w @upmedic nie ma miejsca – diagnozę wystawia lekarz, a nasze oprogramowanie pomaga mu tylko stworzyć szybko i skutecznie  dokumentację medyczną.

 

Potęga czy gadżet?

LLMy to potężna technologia, ale w formie ogólnego chatu bliżej mu do gadżetu. Dodatku. Traktując je jako główne narzędzie pracy i komunikacji tracimy więcej czasu na weryfikację poprawności, niż gdybyśmy od zera napisali prosty i krótki komunikat. Osoby, którym wysyłamy generycznego maila napisanego przez AI, tracą zainteresowanie komunikacją. Analizując badanie obrazowe LLMem możemy stracić z oczu prawdziwy problem pacjenta lub zmarnować masę czasu na poprawianie zbyt szczegółowego i pełnego błędów opisu. 

Jaki z tego wniosek? Skupmy się na tym, gdzie pierwiastek ludzki jeszcze długo będzie przeganiał automaty. Mogą to być rzeczy niepisane – wynikają z interakcji, które nie zostały zamienione w dataset, więc AI nie ma przestrzeni, aby się na tym trenować  (jeszcze, ale czy w ogóle? Nad tym zagadnieniem trwają dyskusje). Może to niemodne obecnie myślenie, ale o tym, czemu tak jest, wyjaśnię już niedługo, pokazując przewrotnie na przykładzie prawdziwej skuteczności LLMów, jeśli inaczej zamodelujemy problem. 

[1] https://vm.tiktok.com/ZNdyuEc6E/

[2] https://www.auntminnie.com/imaging-informatics/artificial-intelligence/article/15704793/gpt4v-flops-on-rsna-case-of-the-day-questions