Как визуализировать многомерные внедрения предложений (BERT/mBART) в 2D или 3D с помощью Python?Python

Программы на Python
Anonymous
Как визуализировать многомерные внедрения предложений (BERT/mBART) в 2D или 3D с помощью Python?

Сообщение Anonymous »

Я работаю с встраиванием предложений, созданным на основе моделей преобразователей (например, BERT/mBART), и хочу визуализировать пространство встраивания, чтобы лучше понять семантическое сходство.
Например, у меня есть такой набор данных:

Код: Выделить всё

sentences = [
"I love machine learning",
"Deep learning is amazing",
"The cat is sleeping",
"Dogs are very loyal"
]
После кодирования я получаю многомерные векторы (например, 768 измерений).

Я хочу:
  • Уменьшить размерность (2D или 3D)
  • Построить вложения так, чтобы похожие предложения выглядели ближе друг к другу
  • При желании пометьте каждый пункт предложением
Что я пробовал
Я использовал PCA:

Код: Выделить всё

from sklearn.decomposition import PCA

pca = PCA(n_components=2)
reduced = pca.fit_transform(embeddings)
Но визуализация не разделяет четко семантические кластеры.
  • Какой лучший метод для визуализации встраивания предложений?
    • PCA, t-SNE и UMAP?
  • Как я могу лучше сохранять семантические связи при визуализации?
  • Существуют ли рекомендуемые библиотеки для интерактивной визуализации (например, масштабирование, метки при наведении)?
Ожидаемый результат
2D/3D-визуализация, где:
  • Похожие предложения сгруппированы вместе
  • Разнородные предложения расположены далеко друг от друга
  • Ярлыки читабельны

Вернуться в «Python»