Медиа

Нейросеть в чате: картинки, голосовые и PDF

Напишите «нарисуй кота в скафандре», и он нарисует. Переделает присланное фото, разберёт скриншот, расшифрует голосовое в текст, прочитает PDF и измерит темп трека. Отдельных команд для этого нет: просто напишите или пришлите файл.

Рисует по описанию

Команда не нужна, просто напишите словами. Формат говорится там же: «вертикально», «16:9», «квадратом». Бот его запомнит и для следующих картинок.

Напримернарисуй кота в скафандре, вертикально

Правит присланное фото

Отправьте просьбу ответом на фото, своё или чужое. Правки можно просить подряд: бот держит картинку в контексте и не начинает с нуля.

Напримердобавь ему шляпу

Читает картинки и скриншоты

Разберёт текст на картинке, объяснит схему, поймёт скриншот ошибки. Стикеры и GIF тоже читает, по кадрам.

Напримерчто тут написано?

Слушает голосовые

Голосовое, аудиофайл и кружок превращаются в текст. Ответ идёт по содержанию, а не «извините, я не умею слушать».

Напримерперескажи, что там

Читает PDF

Достаёт текст документа и рендерит страницы, чтобы разобрать таблицы и картинки внутри.

Напримеро чём этот договор?

Разбирает музыку

Темп и тональность бот измеряет сигнальной обработкой, а не спрашивает у модели. Жанр, настроение и сведение описывает уже поверх этих чисел.

Например99,4 BPM, ля минор

Картинки

Правки подряд, а не с нуля

Бот держит картинку в контексте, поэтому изменения можно просить одно за другим, не переписывая исходное описание. Количество, качество и формат он вытаскивает из самой просьбы.

  1. 1

    «нарисуй кота в скафандре, вертикально»

    Формат сохранится и для следующих картинок в этом чате.

  2. 2

    «добавь ему шлем с золотым забралом»

    Правка идёт от предыдущего результата, а не от нового описания.

  3. 3

    «а теперь то же самое, но четыре штуки»

    Количество (от одной до десяти) бот берёт из просьбы сам.

Разбор музыки

Числа измеряются, впечатление описывается

Темп и тональность считает сигнальная обработка, а не языковая модель. На контрольном фрагменте в 100 BPM измерение дало 99,4. Модели почти всегда отвечают «60 BPM», это у них подстановка по умолчанию. Жанр и настроение описывает уже модель, и измеренные числа кладутся ей в запрос, чтобы в одном ответе не оказалось двух разных темпов.

Темп

Считается по сигналу. Ошибка на контроле в доли удара в минуту.

99,4 BPM

Тональность

24 из 24 тональностей определены верно на контрольных профилях.

ля минор

Всё остальное

Жанр, настроение, инструменты и вокал. То, что спектром не измеришь.

пришлите трек
Вопросы

Про медиа

Как попросить картинку?

Обычными словами: «нарисуй кота в скафандре». Команда не нужна. Формат говорится там же, «вертикально», «16:9», «квадратом», и бот запомнит его для следующих картинок в этом чате.

Можно переделать уже присланное фото?

Да. Отправьте просьбу ответом на фото, своё или чужое. Правки можно просить подряд: сначала «добавь ему шляпу», потом «сделай ярче».

Бот правда слушает голосовые?

Да. Голосовые, аудиофайлы и кружки расшифровываются в текст, и ответ идёт по содержанию. Ограничение по размеру файла 25 МБ.

Насколько точно он определяет темп трека?

На контрольном фрагменте в 100 BPM измерение дало 99,4. Считает сигнальная обработка, а не языковая модель. Модели на такой вопрос почти всегда отвечают «60 BPM», это у них подстановка по умолчанию.

Пришлите ему что-нибудь

Пришлите фото, голосовое, PDF или трек. Или просто попросите что-нибудь нарисовать.