Infino, основанная специалистами с опытом работы над OpenSearch, объявила о выходе из закрытого режима и представила платформу извлечения данных для ИИ-агентов. Основная идея заключается в том, чтобы предоставить агенту единый интерфейс для запросов к структурированным и неструктурированным данным вместо распределения задачи между хранилищем данных, поисковой системой и векторной базой данных с последующим поручением агенту объединять результаты за несколько итераций.
Компания утверждает, что агенты отличаются от традиционных пользователей и приложений способом чтения данных. Вместо отправки одного запроса и ожидания результата агент задаёт небольшие параллельные вопросы, чтобы сформировать более полный ответ, а каждый возвращаемый ему результат потребляет часть контекста модели и может увеличивать время и стоимость последующих вызовов.
Что предлагает Infino?
Infino встраивает функции извлечения данных непосредственно в SQL, благодаря чему в одном запросе можно объединить поиск по ключевым словам, семантический поиск, фильтры, подсчёт, соединения, агрегацию и сортировку. По словам генерального директора Ekechi Nwokah, идея заключается не в использовании самого SQL, а в объединении шаблонов запросов, для которых обычно требовались отдельные системы.
Компания утверждает, что разработчик может ввести вопрос на естественном языке и преобразовать его в единый запрос, выполняемый за доли секунды. Infino также добавила модели рассуждений, ориентированные на механизм извлечения данных, для выполнения повторяющихся задач внутри циклов поиска, таких как формулирование запроса, проверка качества результатов, проба альтернативного запроса и проверка ответа, вместо того чтобы постоянно поручать эти шаги более продвинутым и дорогим моделям.
Единая копия данных в формате Parquet
Архитектура предусматривает хранение данных в файлах Apache Parquet в объектном хранилище, а поисковые индексы размещаются рядом с нижним колонтитулом файла Parquet. Infino утверждает, что базовый механизм имеет открытый исходный код и распространяется по лицензии Apache-2.0 на GitHub, тогда как сервис Infino Cloud позволяет использовать уже существующие данные Parquet и сделать их доступными для поиска без самостоятельного создания инфраструктуры.
Данные остаются доступными для чтения через инструменты, поддерживающие Parquet, включая Iceberg, Hudi, Spark, DuckDB и другие хранилища данных. Согласно описанию компании, можно также загружать данные Parquet или JSON, а затем подключать агента к интерфейсу Infino без управления кластерами, узлами или распределёнными сегментами.
Почему это важно?
Если идея успешно покажет себя в производственных нагрузках, унифицированный уровень извлечения данных может сократить количество каналов загрузки, ETL-процессов, схем и клиентов, к которым агенту необходимо обращаться. Что ещё важнее с точки зрения безопасности, наличие единой копии данных может позволить централизованно применять политики доступа, включая определение строк и столбцов, видимых агенту, а также того, что регистрируется, вместо распределения разрешений между шлюзами MCP и коннекторами сервисов.
Платформа ориентирована на инженеров платформ и данных, команды безопасности, команды машинного обучения и специалистов по анализу данных, а также разработчиков, создающих агентов, работающих с кодом, журналами, результатами непрерывной интеграции и обращениями. Infino утверждает, что её архитектура рассчитана на стоимость примерно в десять раз ниже, чем у традиционных архитектур поиска и аналитики; при этом опубликованное компанией сравнение показывает стоимость примерно в 10,5 раза ниже, чем у Elasticsearch, и в 23 раза ниже, чем у OpenSearch, в протестированной рабочей нагрузке.
Ограничения и открытые вопросы
Эти показатели предоставлены компанией и связаны с конкретной тестовой нагрузкой, поэтому сами по себе они недостаточны для доказательства общего превосходства над всеми вариантами применения Elasticsearch или OpenSearch. Кроме того, сокращение количества систем не устраняет необходимость проверять качество извлечения данных, ограничения политик доступа и поведение индексов при изменении или увеличении объёма данных. Ценность подхода по-прежнему зависит от того, насколько Parquet и объектное хранилище соответствуют шаблонам данных и запросов каждой команды.