T5.omnx — реализация ML.Net, пытающаяся приступить к суммированию текста...
Есть этот текстовый жгут — внутренности которые приведены ниже - жгуты - простое доказательство удобства использования компонента...
Я пробовал несколько моделей T5 - все заводят меня в один и тот же тупик, связанный с несоответствием типов выходов энкодера и входы декодера...
Я дважды и трижды проверил, что все массивы имеют и заполняются, как ожидалось...
Я использовал netron в текущей модели, о которой он сообщает:
Код: Выделить всё
INPUTS:
name: input_ids tensor: int64[1,128]
name: attention_mask tensor: float32[1,128]
OUTPUTS:
name: input.103 tensor: float32[1,128,512]
Код: Выделить всё
internal class CombinedInput
{
[ColumnName("input_ids")]
public long[] InputIds { get; set; }
[ColumnName("attention_mask")]
public float[] AttentionMask { get; set; }
}
internal class CombinedOutput
{
[ColumnName("input.103")] // Ensure this matches your model's output name
public VBuffer Output { get; set; } // This should match the expected shape
public CombinedOutput()
{
// Initialize the VBuffer with a default size (if you know the expected size)
// For example, if you expect 512 outputs:
Output = new VBuffer(128, new float[128]);
}
}
Вот мой код.... который печатает результаты, показанные ниже ...
Типы массивов соответствуют отчету о конфигурации netron.org, показанному выше...
Код: Выделить всё
Console.WriteLine("Experiment: Create and Exercise Combined T5 Model.");
var tokenizer = new GCSTokenizer(); // simple long assignment to each word
var inputIds = tokenizer.Tokenize(Assets.EAS_Message);
var inputData = new CombinedInput()
{
InputIds = inputIds,
AttentionMask = tokenizer.GetAttentionMask(inputIds)
};
// Logging for debugging
Console.WriteLine($"Input IDs: {string.Join(", ", inputData.InputIds)}");
Console.WriteLine(Environment.NewLine);
Console.WriteLine($"Attention Mask: {string.Join(", ", inputData.AttentionMask)}");
Console.WriteLine(Environment.NewLine);
var model = GetCombinedModel(); // built using new CombinedInput[] { }
var predictionEngine = Assets.mlContext.Model.CreatePredictionEngine(model);
try
{
var result = predictionEngine.Predict(inputData); //Out or range throws here ... .
}
catch (Exception ex)
{
Console.WriteLine($"Prediction failed: {ex.Message}");
}
Код: Выделить всё
************* run output *****************
Входные идентификаторы: 1, 2, 3, 4, 5, 6, 7, 8, 9, 10, 11, 4 , 12, 13, 7, 14, 15, 16, 17, 18, 19, 20, 21, 18, 22, 23, 24, 25, 26, 27, 28, 29, 30, 31, 23, 32, 33 , 34, 13, 35, 36, 37, 38, 13, 21, 39, 40, 41, 42, 43, 44, 45, 46, 46, 34, 47, 13, 48, 49, 9, 50, 51 , 52, 18, 53, 24, 54, 55, 56, 51, 34, 57, 13, 58, 59, 59, 55, 18, 60, 61, 62, 38, 63, 64, 33, 65, 66 , 67, 18, 68, 69, 70, 71, 23, 72, 73, 74, 75, 76, 77, 78, 79, 80, 81, 82, 83, 84, 85, 86, 87, 88, 89 , 90, 16, 91, 92, 29, 93, 94, 95, 96, 97, 98, 99, 23, 100, 101, 102
Маска внимания: 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1, 1
Прогноз не выполнен: индекс вышел за пределы допустимого диапазона. Должно быть неотрицательным и меньше размера коллекции. (Параметр «index»)
Нажмите любую клавишу!
PS: необработанный список tokenId имеет длину 488 элементов — с использованием набора управляющих данных — он усекается до 128 — но не ИДЕАЛЬНЫЙ – этот эксперимент предназначен для того, чтобы определить, можем ли мы использовать ML.net в нашем варианте использования... мы обработаем скользящие входные данные позже (если есть причина)
Так что любые указания на то, почему Я не могу предсказывать с помощью этих данных и этих моделей... Заранее спасибо...
Пожалуйста, обратитесь к приведенному выше коду и шагам, выполненным на данный момент.
Подробнее здесь: https://stackoverflow.com/questions/790 ... y-wits-end