Вышла DocuBrowse — программа, которая превращает кучу файлов в нормальную поисковую систему. Скармливаешь ей PDF, DOCX, EPUB, заметки, код — она строит умный индекс. Ищет не просто по словам, а по смыслу. Набрал «договор аренды» — найдёт, даже если этих слов в тексте нет. На каждый результат можно сразу запросить AI-синопсис, не открывая файл.
Внутри — гибридный поиск. 70% семантики (через Ollama с моделью nomic-embed-text) и 30% полнотекстового поиска (SQLite FTS5). Всё склеивается и сортируется. По умолчанию — именно такой режим. Можно переключиться только на ключевые слова или только на смысл. Ответ приходит быстрее 150 миллисекунд.
DocuBrowse работает полностью локально. Никакого интернета, никаких аккаунтов и API-ключей. Все модели Ollama стоят у вас на машине. Данные не уходят. За сканы и синопсисы отвечают две модели: dolphin3 для краткого содержания и nomic-embed-text для эмбеддингов.
Программа понимает кучу форматов: PDF (через pdfplumber с запасным pypdf), Word, Excel, PowerPoint, EPUB, MOBI, AZW3, HTML, Markdown. Сканированные PDF определяет и откладывает для OCR. DRM-защищённые AZW видны только по метаданным.
Установка — пакетами для Linux (RPM, DEB, tarball), Windows (zip) и macOS (dmg). На Linux ставится в /opt/docubrowser, создаёт виртуальное окружение и CLI-команду docubrowser. Windows — в %USERPROFILE%\DocuBrowse, даже без прав администратора. macOS — в ~/Applications.
Безопасность — серьёзная. Сервер висит только на localhost, все запросы к мутирующим API требуют CSRF-токен и проверку заголовка Host (защита от DNS-rebinding). Встроенный PII-сканер проверяет документы на SSN, номера кредиток, банковские счета. Находит — удаляет и навсегда заносит в чёрный список.
Есть фильтр по алфавиту, теги, тёмная тема, дубликаты (по SHA256 и косинусной близости). Команды CLI покрывают всё: сканирование, переиндексацию, удаление, поиск дублей.