Narzędzia AI

Pięć pytań, pięć linków, zero zaufania. Jak sprawdziliśmy źródła ChatGPT

Fizyczny łańcuch weryfikacji łączący twierdzenie ze sprawdzonym dokumentem źródłowym

ChatGPT potrafi dziś zrobić coś o co jeszcze niedawno nikt go nie prosił: podać link do źródła. Nie byle jaki działający, oficjalny, prowadzący prosto do dokumentacji producenta. Brzmi jak koniec halucynacji? Niekoniecznie. Link, który się otwiera, to jeszcze nie link, który cokolwiek dowodzi.

Postanowiliśmy to przetestować w najprostszy możliwy sposób. Zadaliśmy ChatGPT pięć konkretnych pytań o liczby i parametry z dokumentacji największych dostawców AI: OpenAI, Anthropic, Google i Mistral. Każde pytanie miało jedno poprawne źródło. Każda odpowiedź musiała je wskazać. A potem otworzyliśmy te strony i sprawdziliśmy je ręcznie, punkt po punkcie.

Wynik? Lepszy, niż się spodziewaliśmy, ale z jednym haczykiem, który mówi więcej niż same liczby.

Co i jak sprawdziliśmy

Zapisaliśmy pięć pytań dotyczących twardych danych: limitów plików, okien kontekstowych, identyfikatorów modeli i zasad retencji. Wybraliśmy je celowo to informacje, które albo są w dokumentacji producenta, albo ich tam nie ma. Żadnych interpretacji, żadnych halucynacji.

Każdy prompt zawierał trzy wymagania:

  • Korzystaj wyłącznie z oficjalnych źródeł.
  • Podaj bezpośredni link przy każdej liczbie.
  • Jeśli dokumentacja nie wystarcza, odpowiedz wprost.

Test przeprowadziliśmy 20 września 2026 roku, w jednej sesji webowej ChatGPT z widocznym wariantem GPT-5.6 Sol i poziomem rozumowania „Wysoki”. Zachowaliśmy dokładne prompty, pełne odpowiedzi i zrzuty ekranu otwartych stron źródłowych.

Oto dokładne prompty, które wysłaliśmy:

  1. „Jaki jest maksymalny rozmiar pliku, który mogę przesłać do ChatGPT? Podaj oficjalne limity z dokumentacji OpenAI, z bezpośrednim linkiem do źródła. Jeśli limit różni się w zależności od typu pliku, wymień osobno każdy z nich. Jeśli dokumentacja nie podaje limitu, napisz to wprost.”
  2. „Jakie jest aktualne okno kontekstowe dla każdego modelu Claude dostępnego przez API? Podaj dokładne liczby tokenów z oficjalnej dokumentacji Anthropic, z bezpośrednim linkiem do źródła. Jeśli dokumentacja nie potwierdza którejś wartości, zaznacz to.”
  3. „Ile tokenów wejściowych i wyjściowych obsługuje Gemini 2.5 Pro? Podaj dokładne liczby z oficjalnej dokumentacji Google, z bezpośrednim linkiem do karty modelu. Jeśli dokumentacja nie podaje którejś wartości, napisz to.”
  4. „Jaki jest aktualny wariant Mistral Large, jego identyfikator modelu i rozmiar okna kontekstowego? Podaj dane z oficjalnej dokumentacji Mistral, z bezpośrednim linkiem do źródła. Jeśli dokumentacja nie potwierdza którejś wartości, zaznacz to.”
  5. „Jak długo OpenAI przechowuje dane z Responses API i jak wyłączyć zapisywanie? Podaj dokładne informacje z oficjalnej dokumentacji OpenAI, z bezpośrednim linkiem. Rozróżnij retencję stanu rozmowy od logów bezpieczeństwa. Jeśli dokumentacja nie rozdziela tych kategorii, napisz to.”

Potem zaczęła się właściwa praca. Dla każdej odpowiedzi sprawdzaliśmy cztery rzeczy: czy link działa, czy prowadzi do źródła pierwotnego (nie do artykułu o dokumentacji), czy strona zawiera wskazaną wartość i czy odpowiedź nie gubi ważnego zastrzeżenia.

Metoda jest węższa niż wcześniejszy test AIoAI porównujący źródła w czterech narzędziach deep research. Tam sprawdzano szeroki research na jeden temat. Tutaj interesowała nas relacja jeden do jednego: konkretne twierdzenie i strona, która ma je potwierdzać. To także praktyczne uzupełnienie zasad opisanych w materiale o testowaniu systemów AI.

PytanieGłówne twierdzenieWynik kontroli
Limity plików ChatGPT512 MB na plik, 20 MB na obrazPotwierdzone w oficjalnym FAQ OpenAI
Okno Claude API1M dla Fable 5.1, Opus 5 i Sonnet 5; 200K dla Haiku 4.5Potwierdzone w tabeli modeli Anthropic
Gemini 2.5 Pro1 048 576 tokenów wejścia i 65 536 wyjściaPotwierdzone na karcie modelu Google
Mistral Largemistral-large-2512, kontekst 256kPotwierdzone na karcie Mistral; alias poboczny wymaga osobnej kontroli
Responses API30 dni i store: falsePotwierdzone w dokumentacji stanu rozmowy i przechowywania danych
Wynik pięciu własnych prób AIOAI.pl z 20 września 2026 roku. Ocenialiśmy główne źródło dla głównej tezy, nie kompletność każdej odpowiedzi.

Pięć pytań pod lupą

OpenAI: 512 MB nie znaczy 512 MB dla obrazu

Pierwsze pytanie mogło wydawać się banalne. ChatGPT prawidłowo rozdzielił dwa limity: 512 MB jako twardy sufit dla pojedynczego pliku i 20 MB dla obrazu. Dodał też limity 2 mln tokenów dla dokumentów tekstowych i około 50 MB dla arkuszy. Kluczowe było to, czego nie zrobił — nie uogólnił wartości 512 MB na każdy format. A to właśnie ten rodzaj uproszczenia, który w odpowiedziach AI spotykamy najczęściej.

Anthropic: pilnuj wariantu modelu

Odpowiedź o Claude podała konkretne nazwy i identyfikatory. Tabela modeli Anthropic potwierdziła okno 1M tokenów dla Fable 5.1, Opus 5 i Sonnet 5 oraz 200K dla Haiku 4.5. Co ważne, osobna strona o oknach kontekstowych nie dawała podstaw do twierdzenia, że jest już dostępna beta większa niż 1M — i ChatGPT tego nie dopisał. Dobrze zaznaczył granicę zamiast dopowiadać wyższą wartość.

Google: najprostszy przypadek w zestawie

Gemini 2.5 Pro: 1 048 576 tokenów wejściowych i 65 536 wyjściowych. Obie wartości — dokładnie te same — znajdowały się na oficjalnej karcie modelu. Jeden identyfikator, dwie liczby, jedno źródło. Czysto.

Mistral: poprawny rdzeń i jeden znak zapytania

Karta Mistral Large 3 potwierdziła wariant v25.12, identyfikator mistral-large-2512 i okno kontekstowe 256k. Wszystko się zgadzało. Ale odpowiedź podała też alias mistral-large-latest — i tego akurat na sprawdzonej karcie nie znaleźliśmy. To nasz jedyny niepotwierdzony szczegół w całym teście.

Dlaczego to istotne? Bo poprawne źródło dla głównej tezy nie daje automatycznie dowodu dla każdego dodatkowego zdania. Im więcej model dopowiada ponad zakres pytania, tym więcej elementów trzeba sprawdzić osobno.

OpenAI API: podobna liczba, dwa różne konteksty

Celowo najtrudniejsze pytanie. Dokumentacja Responses API mówi, że obiekty odpowiedzi są domyślnie zapisywane przez 30 dni i że można to wyłączyć parametrem store: false. Osobno jednak istnieją logi monitorowania nadużyć, przechowywane do 30 dni niezależnie od ustawień użytkownika. Dwie „trzydziestki” — ale każda oznacza co innego. ChatGPT nie pomylił tych kategorii i nie obiecał, że store: false usuwa logi bezpieczeństwa.

Zrzuty ekranu / demonstracja

Odpowiedź ChatGPT z limitami 512 MB dla pliku i 20 MB dla obrazu oraz linkami do dokumentacji OpenAI
Odpowiedź ChatGPT w pierwszej próbie: dwie wartości, krótkie wyjaśnienie i odnośniki do oficjalnej dokumentacji. Zrzut redakcyjny AIOAI.pl.
Oficjalne FAQ OpenAI z limitami 512 MB na plik i 20 MB na obraz
Ręczna kontrola źródła: oficjalne FAQ OpenAI pokazuje limit 512 MB na plik i 20 MB na obraz. Zrzut redakcyjny AIOAI.pl.

Ta para obrazów pokazuje pełny łańcuch weryfikacji: najpierw twierdzenie i link w odpowiedzi, później odpowiadający mu fragment strony producenta. W codziennej pracy warto powtórzyć dokładnie te dwa kroki — kliknięcie linku to dopiero początek. Trzeba jeszcze znaleźć liczbę, datę, wariant produktu i ewentualne wyjątki.

Jak samodzielnie sprawdzać cytowania AI

Jeśli korzystasz z ChatGPT (albo dowolnego innego modelu) do wyszukiwania faktów, oto pięć zasad, które wyciągamy z tego testu:

  1. Proś o źródło przy każdej liczbie. Jedna lista linków na końcu odpowiedzi utrudnia przypisanie dowodu do konkretnej tezy.
  2. Preferuj materiały pierwotne. Dla limitu API najlepsza jest dokumentacja API, nie artykuł omawiający dokumentację.
  3. Sprawdź dokładny wariant. Nazwa rodziny modelu może obejmować kilka generacji i różne okna kontekstowe.
  4. Szukaj wyjątków. Limity plików zależą od formatu. Retencja danych aplikacji to nie to samo co logi bezpieczeństwa.
  5. Zapisuj datę kontroli. Dokumentacja usług AI zmienia się często — prawidłowa dziś liczba może nie obowiązywać za miesiąc.

Wymóg „pokaż źródło albo zaznacz brak potwierdzenia” poprawia jakość odpowiedzi, ale nie zastępuje kontroli. Szerzej opisaliśmy tę zasadę w materiale „Pokaż źródła albo milcz”.

Podsumowanie wyników

  • 5 z 5 głównych linków otworzyło się poprawnie.
  • 5 z 5 głównych źródeł potwierdziło główne twierdzenie odpowiedzi.
  • 0 błędnych cytowań w ocenianych tezach głównych.
  • 1 szczegół poboczny bez potwierdzenia na sprawdzonej karcie modelu.

Ograniczenia testu

Bądźmy uczciwi: pięć pytań to za mało, żeby wyrokować o całym modelu. Nie sprawdzaliśmy powtarzalności, nie testowaliśmy innych modeli, planów konta ani odpowiedzi w innych językach. Każde pytanie zadano raz, w jednej sesji, w jednej konfiguracji.

Ocenialiśmy główne źródło dla głównej tezy — nie audytowaliśmy z taką samą wagą każdego zdania pobocznego, choć zapisaliśmy wyjątek z aliasem Mistral. Dwa zrzuty pokazują pierwszą próbę, natomiast dla pozostałych zachowaliśmy dokładne prompty, odpowiedzi i ręcznie otwarte strony źródłowe w artefaktach testu.

Taka metoda dobrze sprawdza się przy dokumentacji technicznej, cennikach, limitach, nazwach wersji i regulaminach — wszędzie tam, gdzie istnieje jedno aktualne źródło pierwotne. Gorzej sprawdzi się przy prognozach, sporach naukowych czy pytaniach wymagających syntezy wielu badań. Tam poprawność jednego linku nie wystarczy — trzeba oceniać jakość całego korpusu dowodów.

Wnioski

W tej małej próbie ChatGPT zrobił coś, czego można od niego wymagać, ale nie należy mu ufać na słowo: dobrał trafne źródła do konkretnych twierdzeń. Pięć na pięć głównych linków prowadziło do właściwych stron, a na każdej z nich znajdowała się szukana liczba.

Ale jeden niepotwierdzony alias w odpowiedzi o Mistral pokazuje, dlaczego automatyczne zaufanie to zły nawyk. Model potrafi trafić w sedno pytania — i jednocześnie dopisać szczegół, którego nie da się potwierdzić w podanym źródle.

Najlepszym nawykiem pozostaje krótka kontrola człowieka. Link jest użyteczny dopiero wtedy, gdy na otwartej stronie naprawdę znajduje się twierdzenie, które ma wspierać. Nie wcześniej.

Częste pytania

Jakie są limity plików, które mogę przesłać do ChatGPT?

Maksymalny rozmiar pliku, który można przesłać do ChatGPT, wynosi 512 MB, natomiast dla obrazów limit wynosi 20 MB. Dodatkowo, dla dokumentów tekstowych limit to 2 mln tokenów, a dla arkuszy około 50 MB.

Jakie jest aktualne okno kontekstowe dla modeli Claude?

Okno kontekstowe dla modeli Claude dostępnych przez API wynosi 1M tokenów dla Fable 5.1, Opus 5 i Sonnet 5, a 200K dla Haiku 4.5. Te wartości są potwierdzone w oficjalnej dokumentacji Anthropic.

Ile tokenów obsługuje model Gemini 2.5 Pro?

Model Gemini 2.5 Pro obsługuje 1 048 576 tokenów wejściowych oraz 65 536 tokenów wyjściowych. Te informacje można znaleźć na oficjalnej karcie modelu Google.

Jak długo OpenAI przechowuje dane z Responses API?

OpenAI przechowuje dane z Responses API przez 30 dni, z możliwością wyłączenia zapisywania za pomocą parametru store: false. Ważne jest, aby rozróżnić tę retencję od logów monitorowania nadużyć, które są przechowywane niezależnie.

Jakie są zasady dotyczące sprawdzania źródeł w odpowiedziach AI?

Podczas korzystania z AI do wyszukiwania faktów, ważne jest, aby prosić o źródło przy każdej liczbie oraz preferować materiały pierwotne. Należy również sprawdzić dokładny wariant modelu, szukać wyjątków oraz zapisywać datę kontroli.

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Wymagane pola są oznaczone *