Technologia

Co dzieje się w sekundę między pytaniem a odpowiedzią

Gdy pytasz „co przede mną?”, telefon w Twojej dłoni uruchamia całą maszynerię, od zdjęcia i pomiaru głębi, przez modele AI, po głos i wibrację. Przewiń, żeby zobaczyć każdy krok.

Krok pierwszy

Zdjęcie i głębia

Kamera rejestruje klatkę, a czujnik LiDAR mierzy odległość do wszystkiego w kadrze. Gdy telefon nie ma LiDAR-u, głębię szacuje model uczenia maszynowego.

  • LiDAR
  • Mapa głębi
  • Model ML (fallback)
Krok drugi

Analiza na urządzeniu

Zanim cokolwiek opuści telefon, dwa modele analizują tę samą klatkę: jeden rozpoznaje, czy jesteś na zewnątrz czy w budynku, drugi korzysta z technik analizy obrazu aby stwierdzić, czy cos zmieniło się od ostatniego kadru. Jeśli nie, nie ma po co wysyłać.

  • Modele ML
  • Feature points
  • Na urządzeniu
Krok trzeci

Bezpieczne wysłanie do AI

Klatka, mapa głębi i kontekst rozmowy trafiają do modelu OpenAI GPT Realtime w chmurze. App Attest potwierdza, że łączy się prawdziwa aplikacja, a całość jest szyfrowana. Ta praca jest mierzona w tokenach i to z niej wynika cena. Dane wysyłane są anonimowo, żaden człowiek nie ma dostępu do tego co kamera.

  • GPT Realtime
  • App Attest
  • Szyfrowanie
  • Tokeny
Krok czwarty

Głos i wibracja

Słupek, po prawej, bardzo blisko.

Odpowiedź wraca jako mowa: krótko i przewidywalnie, co i z której strony, jak daleko. Przy przeszkodzie telefon dodatkowo wibruje, a ta funkcja działa nawet bez internetu.

  • Synteza mowy
  • Haptyka
  • VoiceOver

Zobacz, jak to wygląda na ekranie

Cała ta maszyneria mieści się pod jednym ekranem z czterema przyciskami. Przewodnik pokazuje każdy z nich.