Собирает не модель
Веса лежат мёртвым грузом, пока к ним не пришёл запрос. Сбором занимается обёртка: сайт, приложение, встроенный SDK. Требовать совести от файла с числами бесполезно.
Три источника, откуда данные вообще берутся
Обучающий корпус: тексты и картинки, выкачанные краулерами из открытого интернета, лицензионные базы, иногда данные партнёров. Всё это случилось задолго до того, как вы установили приложение.
Ваши запросы: каждое слово, которое вы вбили в окно, ушло на сервер и осело в логах. Приложенный файл тоже. Картинка с паспортом, которую вы кинули «просто распознать текст», тоже.
Телеметрия: какая кнопка нажата, сколько секунд вы читали ответ, версия системы, айпи, идентификатор устройства, откуда пришли.
Где заканчивается закон и начинается невнимательность
Пункт про использование переписки для улучшения сервиса стоит в соглашении, которое вы пролистали за две секунды. У части крупных сервисов есть тумблер «не обучаться на моих данных», и лежит он глубоко в настройках приватности, а не на главном экране.
Что делать
Не кормить бота документами, чужими телефонами и рабочими договорами. Найти в настройках пункт про обучение и выключить. Чистить историю чатов, помня, что удаление из интерфейса и удаление с серверов не всегда одно и то же.
Про рекламу шин
Объяснение скучнее заговора: вы искали шины в браузере, трекеры это записали, а совпадение по времени с чатом вы дорисовали сами.
Лучший ответ
v4-pro
v4-pro
Как нейросеть собирает данные?
Вывод: сбор идёт в двух разных местах, на этапе обучения и на этапе вашей переписки, и путать их не стоит.
Почему так. Обучающий корпус собран заранее краулерами и закупками, вас там нет как пользователя, есть только ваши публичные тексты. Переписка уходит на сервер и хранится в логах вместе со временем, адресом и устройством. Сама модель между сессиями ничего не помнит, память реализует приложение отдельной базой. Важно: реклама, совпавшая с разговором в чате, почти всегда объясняется трекерами браузера.