Индикатор загрузки
Загрузка...

Команда Qwen от Alibaba представила ИИ-модели для управления ПК и телефонами

Eye Icon

18 VIEWS

Обновлено: 05.02.2025

Опубликовано: 05.02.2025

На этой неделе внимание технологической индустрии в основном приковано к китайской лаборатории ИИ DeepSeek, но её главный местный конкурент, Alibaba, не остаётся в тени.

В понедельник команда Qwen от Alibaba представила новое семейство ИИ-моделей Qwen2.5-VL, которые могут выполнять различные задачи по анализу текста и изображений. Эти модели умеют обрабатывать файлы, анализировать видео, считать объекты на изображениях, а также управлять ПК — подобно модели, которая лежит в основе недавно выпущенной функции Operator от OpenAI.

По данным команды Qwen, лучшая модель Qwen2.5-VL обогнала GPT-4 от OpenAI, Claude 3.5 Sonnet от Anthropic и Gemini 2.0 Flash от Google по ряду тестов, включая анализ видео, математику, анализ документов и ответ на вопросы.

Модель Qwen2.5-VL, доступная для тестирования в приложении Qwen Chat от Alibaba и для скачивания на платформе для разработчиков AI Hugging Face, может анализировать графики и диаграммы, извлекать данные из сканов счетов и форм, а также «понимать» видео продолжительностью несколько часов, утверждает команда Qwen. Она также способна распознавать персонажей из фильмов и сериалов, а также широкий ассортимент товаров, что предполагает, что модели могли быть частично обучены на защищённых авторским правом материалах.

Однако, как и другие ИИ-системы, разработанные китайскими компаниями, Qwen2.5-VL имеет ограничения на темы, о которых она может говорить — по крайней мере, в Qwen Chat. Когда я попросил крупнейшую и наиболее мощную модель Qwen2.5-VL, Qwen2.5-VL-72B, поговорить о «ошибках Си Цзиньпина», приложение выдало ошибку.

Китайский интернет-регулятор проводит оценку многих местных моделей, чтобы убедиться, что их ответы соответствуют «основным социалистическим ценностям». Поэтому многие китайские ИИ-системы отказываются отвечать на темы, которые могут вызвать недовольство у регуляторов, например, на вопросы о независимости Тайваня.

Одной из более интересных функций Qwen2.5-VL является её способность взаимодействовать с программным обеспечением — как на ПК, так и на мобильных устройствах. В видео, размещенном на платформе X Филиппом Шмидом, техническим лидером Hugging Face, показано, как Qwen2.5-VL запускает приложение Booking.com для Android и бронирует билет на рейс из Чунцина в Пекин.

На видео ниже модель Qwen2.5-VL управляет приложениями на Linux-десктопе, но, похоже, не делает ничего существенного, кроме как переключает вкладки. Возможно, это объясняется тем, что, согласно результатам тестирования Qwen, модель Qwen2.5-VL плохо справляется с OSWorld — тестом, который пытается имитировать реальную компьютерную среду.

Два меньших и менее сложных модели в серии Qwen2.5-VL — Qwen2.5-VL-3B и Qwen2.5-VL-7B — доступны по свободной лицензии. Однако флагманская модель Qwen2.5-VL-72B использует собственную лицензию Alibaba, которая требует от компаний и разработчиков с более чем 100 миллионами активных пользователей в месяц получить разрешение от Qwen/Alibaba перед коммерческим использованием модели.

Интересуетесь нейросетями? Больше полезных материалов в нашем специальном разделе!

Арбитраж Инструменты TikTok Общие темы Профессии Новости База знаний Кейсы УБТ Facebook Google Ads Instagram Интервью Вконтакте Руководства Конференции YouTube Google Яндекс

Автор

TraffNews

0 Comments

Ваш адрес email не будет опубликован. Обязательные поля помечены *

Максимальный размер загружаемого файла: 20 МБ. Вы можете загрузить: изображение, видео. Ссылки на YouTube, Facebook, Twitter и другие сервисы, вставленные в текст комментария, будут автоматически встроены. Перетащите файл сюда

Похожие материалы:

Instagram будет показывать вашим друзьям, какие Reels вам понравились

Читать
интервью с создателем игры Idle Outpost

$3 000 000 на симуляторе постапокалипсиса: интервью с создателем игры Idle Outpost

Читать
интервью с создателем игры Obby Parkour

Из Яндекс игр к хиту на Google Play: интервью с создателем игры Obby Parkour с оценкой в $750k

Читать
Клеть: интервью с разработчиком игры

160 000 продаж копий игры БЕЗ рекламного бюджета: интервью с разработчиком

Читать
Миллионы на гонках: интервью с разработчиком игр

Как заработать миллионы на гонках: интервью с разработчиком игр

Читать
нутра в арбитраже: инсайты от экспертов

NUTRA COD RIP? Подкаст с соло-байером и тимлидом арбитражной команды

Читать
Как попасть в рекомендации ТикТок

Как попасть в рекомендации ТикТок в 2025 году: пошаговый гайд

Читать
как заработать на YouTube

Кейс: как одно видео на YouTube принесло $30 000

Читать