КАТАЛОГ НЕЙРОСЕТЕЙ
Inference.net: Schematron V2 Turbo
Schematron V2 Turbo — специализированная модель Inference.net для извлечения структурированных данных из HTML. Её можно рассмотреть для обработки карточек товаров и переноса информации со страниц в базу данных.
Модель в деталях
- Разработчик / семейство
- Inference.net
- Формат результата
- Текст
- Контекст
- 128 000 токенов
Контекст — объём данных, который модель может учитывать в одном запросе. Допустимая длина ответа и настройки зависят от конкретного подключения.
inference-net/schematron-v2-turboОбзор и сценарии использования
Возможности модели
По документации разработчика, модель получает HTML и описание полей в JSON Schema, а возвращает JSON. Turbo ориентирована на пропускную способность; вариант Small предлагается для более сложных схем. Заявленный контекст семейства — до 128 тысяч токенов.
Для каких задач рассмотреть Schematron V2 Turbo
Практический сценарий — подготовка товарного фида: из каждой страницы нужны название, артикул, цена и наличие. Другой пример — перенос сведений о событиях в таблицу с датой, местом и организатором. Перед выбором модели соберите небольшой набор реальных страниц: простые карточки, страницы с несколькими ценами и материалы с отсутствующими полями. Оценивайте долю корректно извлечённых значений, а не только наличие ответа.
Как подготовить HTML и JSON Schema
Разработчик указывает, что инструкции по извлечению передаются через схему, а не отдельный промпт. Сначала определите поля и типы данных. В описании цены уточните, нужно ли брать текущую цену или зачёркнутую; для даты задайте ожидаемый формат. Отдельно продумайте отсутствующие значения, валюту и единицы измерения. Это рекомендации по проектированию интеграции: конкретную поддержку параметров в Токенмосте нужно проверять при открытии API.
Что проверять после извлечения
Корректный JSON ещё не доказывает, что данные верны. Сопоставьте результат с исходной страницей: цена должна относиться к нужному товару, дата — к нужному событию. Добавьте проверки обязательных полей и допустимых значений. Страницы, которые не прошли проверку, отправляйте на повторный разбор или ручную проверку, а не записывайте автоматически в рабочую базу.
Ограничения и выбор между Turbo и Small
Большую страницу может потребоваться разбить на части. Если схема допускает несколько трактовок, уточните описания полей. Для сравнения Turbo и Small используйте одинаковый набор HTML и одну схему: измерьте точность, время обработки и итоговый расход. Не переносите заявленные результаты разработчика на свой поток без проверки.
Из чего складывается стоимость API
Входные токены расходуются на передаваемые данные, выходные — на результат. Для оценки бюджета возьмите средний объём страницы и ответа, затем умножьте на число страниц и учтите повторы. Актуальное состояние тарифа показано в блоке стоимости этой страницы. Доступ к реальным запросам через Токенмост пока готовится.
Вопросы и ответы
Schematron V2 Turbo сама открывает сайты?
Описанный разработчиком сценарий начинается с передачи HTML. Получение страницы, выполнение JavaScript и выбор нужного содержимого следует предусмотреть в своей системе сбора данных.
Это универсальный чат-бот?
Модель специализируется на извлечении данных из HTML в JSON. Для свободного диалога и написания текстов сравните универсальные текстовые модели в каталоге.
Можно ли уже вызвать её через Токенмост?
Пока нет: опубликована информационная карточка, подключение API готовится. Документация поможет ознакомиться с общими принципами интеграции.
Чем она отличается от XML Schematron?
Здесь описана нейросеть Inference.net. Одноимённый язык проверки XML — другой инструмент и не относится к этой карточке модели.
Сравните с другими моделями
Подключение API
- Изучите формат APIВ документации описаны запросы, ключи и обработка ошибок.
- Сравните моделиУчитывайте формат результата, размер контекста и стоимость входных и выходных данных.
- Сверьте параметры подключенияПроверьте адрес API, идентификатор модели и формат запроса.