Как разобрать нечеткие текстовые описания в структурированные данные временных рядов в Python?Python

Программы на Python
Anonymous
Как разобрать нечеткие текстовые описания в структурированные данные временных рядов в Python?

Сообщение Anonymous »

Я извлекаю данные о подписчиках потоковой передачи из текста с помощью LLM и получаю такие результаты:

Код: Выделить всё

{
"raw_extractions": [
{
"platform_mention": "Netflix",
"year_mention": "2012",
"subscriber_mention": "roughly 30 million subscribers worldwide"
},
{
"platform_mention": "Netflix",
"year_mention": "2020",
"subscriber_mention": "just under 200 million"
},
{
"platform_mention": "Netflix",
"year_mention": "2022",
"subscriber_mention": "hovered around 220 million subscribers"
}
]
}
Мне нужно преобразовать это в чистые данные временных рядов для анализа:

Код: Выделить всё

| year | platform | subscribers_min | subscribers_max | confidence |
|------|----------|----------------|-----------------|------------|
| 2012 | Netflix  | 30             | 30              | medium     |
| 2020 | Netflix  | 195            | 200             | medium     |
| 2022 | Netflix  | 220            | 220             | medium     |
Каков наилучший подход Python для анализа нечетких фраз, таких как «примерно 30 миллионов», «чуть менее 200 миллионов», в числовые диапазоны?

Вернуться в «Python»