Nový open-source projekt sází na to, že nejrychlejší způsob, jak najít paměť, je popsat ji – a že hledání by nikdy nemělo opustit váš notebook. SCM, zkratka pro Screen Memories, je bezplatná aplikace pro macOS, která aplikuje místní modely umělé inteligence na každou fotografii a každý snímek videa ve složce a umožňuje uživatelům prohledávat jejich knihovny v jednoduchém jazyce. Projekt se tento týden objevil na GitHubu a rychle se vyšplhal na titulní stránku Hacker News, kde během několika hodin získal více než 85 bodů.

Rozteč je na povrchu jednoduchá: namiřte SCM na libovolnou složku a vytvoří prohledávatelný rejstřík toho, co je skutečně ve vašich médiích – nejen názvy souborů, ale i vizuální obsah každého obrázku a každé scény uvnitř každého videa. To, co jej odlišuje v přeplněném poli fotografických nástrojů AI, je to, že vše běží na samotném Macu. Neexistují žádné účty, žádné cloudové nahrávání a žádná telemetrie. Jakmile si modely při prvním spuštění stáhnou své váhy, aplikace funguje offline. For more context on this story, see our ongoing AI trends.

Pět způsobů, jak vyhledávat v médiích po celý život

SCM organizuje vyhledávání do pěti různých režimů, z nichž každý je poháněn jiným lokálně běžícím modelem.

Režim Soubory provádí sémantické prohledávání celého souboru ve fotografiích a videích a řadí výsledky podle významu s vylepšeními z názvů souborů a frází. Scény jde hlouběji: aplikace rozděluje videa do jednotlivých scén a vkládá každou zvlášť, takže dotaz vás přivede k přesnému záběru se skokem přímo k jeho časovému kódu, nikoli k časovému razítku pohřbenému v názvu souboru.

Dva režimy zaměřené na text zpracovávají slova uvnitř média. Režim OCR, postavený na enginu Tesseract, čte text, který je viditelně přítomen v obrázcích a videích, a doslova se s ním shoduje, s angličtinou a dalšími 35 jazykovými balíčky, které lze zapnout. Režim Dialog spouští rozpoznávání řeči Whisper přes videa a indexuje přesně mluvená slova s ​​odstupňovanými úrovněmi přesnosti shody pro vyhledání konkrétního řádku.

Nakonec volitelný režim LLMs přemění extrahovaný materiál – přepisy dialogů, text OCR a názvy souborů – do místního kontextu chatu. Uživatelé mohou klást otázky o své vlastní knihovně a aplikace vrací odpovědi s citacemi směřujícími zpět ke zdrojovým souborům, všechny vygenerované modelem běžícím na stejném počítači.

Jak to funguje pod pokličkou

Technicky je SCM aplikace Electron napsaná v JavaScriptu, která jako správce balíčků a runtime používá sadu nástrojů Bun. Těžké zvedání provádějí modely transformátorů provedené přímo v aplikaci – výchozí model vidění je varianta CLIP, jejíž hmotnosti, zhruba 435 megabajtů, se stahují jednou při prvním použití.

Index se udržuje sám. Sledované složky automaticky importují nová média, jakmile dorazí, hašování obsahu odstraní duplicitní soubory, které byly pouze přejmenovány nebo přesunuty, a přechod na jiný model znovu vloží knihovnu na pozadí bez blokování vyhledávání. Vývojář poznamenává, že funkce panelu nabídek a zásobníku jsou specifické pro macOS, kde je aplikace zabalena pro distribuci.

Model soukromí je prodejním argumentem. Dokumentace projektu je jednoznačná: média nikdy neopouštějí stroj, odvození probíhá lokálně prostřednictvím transformátoru runtime a po počátečním stažení váhy vše funguje offline. Pro uživatele s citlivými archivy – lékařské snímky, legální záběry, osobní video – je tato architektonická volba tou správnou funkcí.

Vytvořeno pro osobní archivy

Rozhraní odráží stejnou filozofii přizpůsobení. Jakýkoli dotaz lze uložit jako opakovaně použitelnou kartu, takže hledání, jehož frázování chvíli trvalo, se stane trvalým zobrazením knihovny. Aplikace se také dodává s přepínatelnými kartami Screenshots a Email, které uznávají, že moderní Mac shromažďuje snímky obrazovky a přílohy tempem, které rychle překonává vlastní vyhledávání operačního systému.

Základní technikou je dnes již standardní mašinérie sémantického vyhledávání: model vidění převádí každý obrázek a video scénu na numerické vložení a dotazy jsou vkládány stejným způsobem, takže ke shodě dochází spíše na základě významu než překrývání klíčových slov. Pozoruhodná zde není technika, ale balení – stejný kanál, jaký provozují cloudové fotografické služby na serverových farmách, je komprimován do aplikace Electron, kterou si může nainstalovat a spouštět bezobslužný uživatel nad složkami podle svého výběru.

Část většího posunu směrem k místní umělé inteligenci

SCM přichází, protože provozování schopných modelů umělé inteligence na spotřebitelském hardwaru přešlo od novinky k očekávání. Apple neustále prosazuje sémantické vyhledávání do své vlastní aplikace Fotky, zatímco modely řeči, vidění a textu s otevřeným zdrojovým kódem se zmenšily na velikosti, které lze pohodlně provozovat na noteboocích. To, co zůstává vzácné, nejsou základní modely, ale integrační vrstva – software, který je spojuje do něčeho, co neinženýr může skutečně použít na svých vlastních souborech.

To je výklenek, který SCM zabírá, a jeho příjem naznačuje, že svědění je skutečné. Úložiště shromáždilo 160 hvězdiček a osm forků zhruba za den, přičemž komentátoři Hacker News zaměřovali své otázky na velikosti modelů, rychlost indexování a dostupnost Windows – v současnosti je odpověď na poslední z nich ne, protože projekt je prozatím pouze pro macOS.

Projekt je uvolněn pod licencí MIT, která umožňuje komerční využití a úpravy. Pro každého, kdo má velký, neuspořádaný archiv fotografií a nahrávek obrazovky a zásadně je nerad kamkoli nahrávat, je to jedna z nejpůsobivějších demonstrací, že plně lokální vyhledávač médií již není ukázkou výzkumu – jde o odpolední instalaci.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →