Живеем в епоха, в която изкуственият интелект все повече доминира в интернет, което затруднява разграничаването на истинското съдържание от фалшивите новини. Всяка снимка или видео, което виждате днес, може да е създадено от ИИ, а традиционните признаци, по които бихте могли да го разпознаете, бързо изчезват. Съществуват инструменти, които помагат да се установи дали нещо е създадено с изкуствен интелект, а Nvidia — вероятно основният бенефициент в надпреварата за изкуствен интелект — току-що пусна свой собствен инструмент, наречен Synthetic Video Detector (SVD).
SVD е Nvidia Inference Microservice (NIM), част от програмата на компанията AI for Media Private Access, така че не е публично достъпен за потребителите, но има демонстрационна версия. Във всеки случай задачата на SVD е проста: да установи дали дадено видео е истинско или е генерирано с помощта на ИИ. То може да анализира видеоклипове в голям мащаб, като ги разбива кадър по кадър, за да открие аномалии. То се основава на най-съвременни научни изследвания, спечелили награди на конференцията по компютърно зрение ICCV.

Вместо да разглежда видеофайла като цяло, SVD го разделя на изрязани кадри, всеки с резолюция 504x504. След това тези кадри се прекарват през два мощни Vision Transformers, създадени от Meta: DINOv2 и DINOv3. Задачата на Vision Transformer е да се научи да формира модели, без да се нуждае от данни, маркирани от хора. Те се използват често за класифициране на изображения, извличане на изображения, откриване на обекти и оценка на дълбочина.
По този начин, след като кадрите преминат през тези трансформатори, техните характерни пространствени характеристики се оценяват бързо и на всеки от тях се присвоява оценка между 0 и 1 — като 0 представлява напълно истинско изображение, а 1 — напълно фалшиво изображение. В края на процеса оценките се сумират, за да се изчисли средна стойност, която показва на потребителя дали видеото е истинско или не въз основа на процентна оценка от 100.
По този начин новинарските агенции, телевизионните оператори и медиите могат да удостоверяват автентичността на получените кадри много по-бързо и с по-голяма сигурност. SVD е проектиран дори да работи в условията на компресията в социалните медии, тъй като при видеоклиповете, качени онлайн, несъвършенствата им биват маскирани. Но алгоритмите все пак могат да откриват модели, които човешкото око не може да забележи, като поглеждат отвъд повърхностните аномалии и вместо това се фокусират върху вътрешните артефакти.

Некомпресираното видео все още дава най-добри резултати, като SVD показва невероятна точност от 92%. При 15% компресия точността на модела спада до 87%, докато при 50% компресия все още се постига много впечатляваща точност от 82% при откриването на съдържание, генерирано от ИИ. Тъй като това е микроуслуга, тя се отличава и с изключително ниска латентност, като обработва 1080p видео само за 22 ms на графични процесори Nvidia RTX и за 30 ms на моделите работни станции на Nvidia.
Въпреки това, SVD изисква енкодера NVENC, така че картите за центрове за данни като B100 не могат да го изпълняват директно. Nvidia съобщи, че вече работи с Wowza, за да внедри откриването на синтетично видео в реално време в работните процеси за пряко излъчване. Демо версия е достъпна за изпробване още сега на build.nvidia.com, но имайте предвид, че обработката отнема много време, тъй като се извършва в облака, максималният размер на файла е само 100 MB и често просто изтича времето за изчакване.
Снимка: Unsplash/Nvidia
Виж още: Еволюция на 252 млн. години: ето защо на плажа събираме миди, а не черупки на древни животни