Nowe badanie Microsoft Research i Salesforce sprawdziło ponad 200 tysięcy rozmów z popularnymi modelami AI. Wniosek jest prosty: krótkie, jednorazowe pytania trafiają w punkt, a dłuższy dialog częściej prowadzi do błędów i halucynacji.
200 tysięcy rozmów z AI i jeden wniosek. Proste pytanie działa, a dłuższa rozmowa psuje wyniki
Autorzy analizy porównali zachowanie modeli GPT 4.1, Gemini 2.5 Pro, Claude 3.7 Sonnet, DeepSeek R1 i kilku otwartych LLM. Przy pojedynczym poleceniu skuteczność sięgała około 90 procent, a przy wieloetapowej rozmowie spadała do około 65 procent.
Co ważne, spadek jakości pojawiał się nawet przy dwóch wymianach, niezależnie od wielkości modelu. Zjawisko było widoczne zarówno w systemach zamkniętych, jak i w otwartych, na przykład w Llama 3.1 8B Instruct.
Badanie opisuje skłonność modeli do zgadywania odpowiedzi zanim dostaną pełne wytyczne, co często kończy się nietrafnym torem rozumowania. Potem działa efekt zakotwiczenia, czyli podążanie za pierwszą odpowiedzią nawet wtedy, gdy rozmowa skręca w inną stronę.
Wraz ze wzrostem złożoności dialogu rosła też niestabilność wyników. Naukowcy odnotowali, że niepewność odpowiedzi potrafiła wzrosnąć o około 112 procent, czyli ponad dwukrotnie względem prostych zapytań.
Dłuższy czat, dłuższe odpowiedzi. Ryzyko halucynacji rośnie
W miarę wydłużania rozmowy odpowiedzi stawały się od 20 do 300 procent dłuższe. Rozwlekłość szła w parze z większą liczbą błędów faktograficznych i wymyślonych treści.
Lepsze rezultaty dawały krótkie, samodzielne polecenia z pełnym kontekstem w jednym komunikacie. W praktyce pomaga też precyzyjne doprecyzowanie prośby i ponowne streszczenie celu zamiast kontynuowania niejasnego wątku.
AI wciąż w centrum uwagi branży. Badanie wskazuje, gdzie modele zawodzą
Mimo problemów z łańcuchami dostaw pamięci i głosów o potencjalnej bańce inwestycyjnej, sztuczna inteligencja pozostaje priorytetem największych firm. Ten raport przypomina, że inwestycje warto kierować w stronę wiarygodności odpowiedzi i odporności na błędy w długich dialogach.
Wnioski są zbieżne z codzienną obserwacją pracy chatbotów i mogą posłużyć jako punkt odniesienia dla twórców narzędzi oraz zespołów wdrażających AI w firmach. Na razie nie ma informacji o publicznej wersji testów dla użytkowników, to materiał badawczy i metodyczny.