Новый проект с открытым исходным кодом делает ставку на то, что самый быстрый способ найти воспоминание — это описать его, и что поиск никогда не должен покидать ваш ноутбук. SCM, сокращение от Screen Memories, — это бесплатное приложение для macOS, которое применяет локальные модели искусственного интеллекта к каждой фотографии и каждому кадру видео в папке, позволяя пользователям осуществлять поиск в своих библиотеках на простом языке. Проект появился на GitHub на этой неделе и быстро поднялся на первую страницу Hacker News, где за несколько часов набрал более 85 баллов.
На первый взгляд идея проста: укажите SCM на любую папку, и он создаст доступный для поиска индекс того, что на самом деле находится в ваших медиафайлах — не только имена файлов, но и визуальное содержимое каждого изображения и каждой сцены внутри каждого видео. Что отличает его от множества инструментов для обработки фотографий с использованием искусственного интеллекта, так это то, что все они работают на самом Mac. Здесь нет учетных записей, нет загрузок в облако и нет телеметрии. Как только модели загружают свои веса при первом запуске, приложение работает в автономном режиме. Подробнее об этой истории — в нашем больше статей об ИИ.
Пять способов поиска в СМИ на протяжении всей жизни
SCM организует поиск в пяти различных режимах, каждый из которых основан на отдельной модели, работающей локально.
Режим Файлы выполняет семантический поиск по всему файлу среди фотографий и видео, ранжируя результаты по значению с добавлением имен файлов и фраз. Сцены работают глубже: приложение сегментирует видео на отдельные сцены и встраивает каждую из них отдельно, поэтому запрос позволяет найти точный кадр с переходом прямо к его тайм-коду, а не к метке времени, скрытой в имени файла.
Два текстовых режима обрабатывают слова внутри носителя. Режим OCR, построенный на движке Tesseract, считывает текст, который явно присутствует в изображениях и видеокадрах, и буквально сопоставляет его с английским плюс 35 дополнительных языковых пакетов, которые можно включить. Режим Диалог запускает распознавание речи Whisper на видео и индексирует точные произносимые слова с многоуровневой точностью совпадения для поиска конкретной строки.
Наконец, дополнительный режим LLMs превращает извлеченный материал — расшифровки диалогов, текст OCR и имена файлов — в контекст локального чата. Пользователи могут задавать вопросы о своей библиотеке, а приложение возвращает ответы со ссылками на исходные файлы, созданные моделью, работающей на том же компьютере.
Как это работает под капотом
Технически SCM — это приложение Electron, написанное на JavaScript, использующее набор инструментов Bun в качестве менеджера пакетов и среды выполнения. Тяжелая работа выполняется моделями-трансформерами, выполняемыми непосредственно в приложении: модель зрения по умолчанию представляет собой вариант CLIP, вес которого составляет примерно 435 мегабайт, загружается один раз при первом использовании.
Индекс сохраняется. Просматриваемые папки автоматически импортируют новые медиафайлы по мере их поступления, хеширование контента дедуплицирует файлы, которые были просто переименованы или перемещены, а переключение на другую модель повторно встраивает библиотеку в фоновом режиме, не блокируя поиск. Разработчик отмечает, что функции строки меню и панели задач специфичны для macOS, где приложение упаковано для распространения.
Модель конфиденциальности является преимуществом. Документация проекта ясна: носитель никогда не покидает машину, вывод выполняется локально через среду выполнения преобразователя, а после начальной загрузки веса все работает в автономном режиме. Для пользователей с конфиденциальными архивами — медицинскими изображениями, судебными кадрами, личным видео — этот архитектурный выбор является особенностью.
Создано для личных архивов
Интерфейс отражает ту же философию настройки. Любой запрос можно сохранить в виде вкладки многократного использования, поэтому поиск, на формулировку которого ушло некоторое время, становится постоянным просмотром библиотеки. Приложение также поставляется с переключаемыми вкладками «Снимки экрана» и «Электронная почта», признавая, что современный Mac накапливает снимки экрана и вложения со скоростью, которая быстро перерастает собственный поиск операционной системы.
В основе лежит стандартный сейчас механизм семантического поиска: модель видения преобразует каждое изображение и видеосцену в числовое встраивание, а запросы встраиваются таким же образом, так что сопоставление происходит по смыслу, а не по перекрытию ключевых слов. Здесь примечательна не техника, а упаковка — тот же конвейер, который облачные фотосервисы запускают на серверных фермах, сжат в приложение Electron, которое не-разработчик может установить и запускать без присмотра в папках по своему выбору.
Часть более масштабного перехода к локальному искусственному интеллекту
SCM появляется, когда запуск эффективных моделей искусственного интеллекта на потребительском оборудовании превратился из новинки в ожидание. Apple постепенно внедрила семантический поиск в свое собственное приложение «Фото», в то время как модели речи, зрения и текста с открытым исходным кодом сократились до размеров, которые удобно работать на ноутбуках. Что остается дефицитным, так это не базовые модели, а уровень интеграции — программное обеспечение, которое объединяет их во что-то, что неинженер может фактически использовать в своих собственных файлах.
Именно эту нишу занимает SCM, и ее прием предполагает, что зуд реален. Репозиторий собрал 160 звезд и восемь форков примерно за день, при этом комментаторы Hacker News сосредоточили свои вопросы на размерах моделей, скорости индексации и доступности Windows — в настоящее время ответ на последний вопрос — нет, поскольку проект пока предназначен только для macOS.
Проект выпущен под лицензией MIT, которая разрешает коммерческое использование и модификацию. Для тех, у кого есть большой неорганизованный архив фотографий и записей с экрана и кто принципиально не любит загружать их куда-либо, это одна из наиболее убедительных демонстраций того, что полностью локальная поисковая система в СМИ больше не является исследовательской демонстрацией — это установка после обеда.
---
Будьте в курсе ИИПоследние новости, аналитика и прорывы в сфере ИИ — всё в одном месте.
Читать больше новостей об ИИ →