Сравнение больших текстовых файлов. Сравнение хешей происходит быстрее, чем использование подмножеств файла?C#

Место общения программистов C#
Anonymous
Сравнение больших текстовых файлов. Сравнение хешей происходит быстрее, чем использование подмножеств файла?

Сообщение Anonymous »

Предположим, у меня есть два больших (текстовых) файла, которые предположительно идентичны, но я хочу убедиться. Возможно, вся серия Гарри Поттера, «взрослых» и «детских» изданий...

Если строковое представление полного текста слишком велико для храниться в памяти одновременно, будет ли быстрее:
  • a) Хешировать оба файла целиком, а затем проверить, чтобы увидеть если хэши идентичны
или
  • б) Считывайте каждый файл по частям и сравнивайте их, пока не достигнете EOF или не обнаружите несоответствие.
Другими словами, будет удобство сравнения двух небольших хэшей компенсируется временем, затраченным на создание этих хэшей?

Я ожидаю пару ответов «это зависит», так что, если вы хочу, чтобы некоторые предположения работали с:
  • Язык C# в .NET
  • Текстовые файлы имеют размер 3 ГБ каждая
  • Хеш-функция — MD5.
  • Максимальный объем «запасной» оперативной памяти — 1 ГБ.


Подробнее здесь: https://stackoverflow.com/questions/767 ... sets-of-th

Вернуться в «C#»