← Главная

Пространство эмбеддингов

Смотрите, как текст превращается в векторы. Корпус текстов эмбеддится Google EmbeddingGemma, ложится в 3D-пространство, и его можно искать по смыслу.

Вопросы

Про эмбеддинги и RAG, простыми словами

  • Что такое эмбеддинг текста?

    Это список чисел, который стоит вместо смысла. Модель читает кусок текста и возвращает вектор фиксированной длины — здесь 768 чисел, от Google EmbeddingGemma на собственном сервере студии, — расположенный так, что тексты про похожее оказываются рядом, а не связанные между собой — далеко. В этом весь фокус поиска по смыслу: сравнение перестаёт быть языковой задачей и становится арифметикой.

  • Что такое RAG и что именно этот инструмент из него показывает?

    Retrieval-augmented generation: вместо надежды на то, что модель запомнила факт, вы этот факт находите и отдаёте модели вместе с вопросом. Инструмент показывает каждый этап поисковой половины — как текст режется на фрагменты, как фрагменты превращаются в векторы, как с ними сопоставляется запрос и как короткий список переупорядочивается перед тем, как что-то передать дальше. Именно на этих этапах RAG-системы и ломаются в проде, и в большинстве продуктов они полностью не видны.

  • Зачем совмещать векторный поиск с обычным поиском по словам?

    Потому что ломаются они по-разному. Векторный поиск понимает, что «машина» и «автомобиль» — одно и то же, но плывёт на точных строках: артикул, фамилия, код ошибки. Лексический BM25 берёт их уверенно и беспомощен с синонимами. Слияние двух ранжирований — здесь Reciprocal Rank Fusion — сохраняет сильную сторону каждого, поэтому серьёзные поисковые системы редко полагаются на что-то одно.

  • Что такое усечение «матрёшки» и чем за него платишь?

    EmbeddingGemma обучена так, что начало вектора несёт большую часть смысла. Поэтому 768 чисел можно урезать до 512, 256 или 128 и всё ещё искать осмысленно — вчетверо меньше хранилища и заметно более быстрые сравнения. Платите вы точностью, и кривую этой платы здесь можно увидеть, а не прочитать о ней: один и тот же поиск переигрывается на каждой ширине, так что видно, где качество реально начинает сыпаться на ваших данных, а не на чужом бенчмарке.