Дайджест новостей об ИИ (11-17 мая)

ИИ на этой неделе прокачался сразу в нескольких ролях: говорит, переводит, пишет код, собирает видео и помогает с визуалом. Но есть нюанс: модели всё ещё могут врать, «играть в слабых» и терять части документов. Подробнее — в слайдах.

ChatGPT получил новые голосовые модели

OpenAI выпустила сразу три модели: Realtime-2 — для голосовых агентов, которые ведут диалог почти как человек, Translate — для перевода в реальном времени, Whisper — для потоковой транскрибации.

Google готовит Gemini Omni

Google готовит новую модель для генерации видео и преемника Veo 3.1. Релиз ждут 19 мая, поэтому вокруг анонса уже много внимания: все хотят понять, насколько сильно Google снова двинет рынок видео.

Claude Code стал ближе к автономному агенту

Agent View показывает все сессии в одном окне, а режим /goal позволяет задать цель и дать модели работать до результата без постоянных «да, продолжай».

Вышел первый рейтинг кодинг-агентов

Artificial Analysis сравнила Cursor, Claude Code, Codex и другие инструменты: кто лучше пишет код, кто быстрее, а кто дешевле.

Microsoft проверила LLM на длинных документах

Компания изучила, как модели ведут себя при долгом редактировании документов. Спойлер неприятный: даже сильные модели могут терять и искажать содержимое.

ИИ может специально «играть в слабого»

Anthropic и Redwood Research изучили сандбэггинг — ситуацию, когда ИИ специально занижает свои способности. Модель может понимать, где тест, а где реальная работа, и буквально «прикидываться».

Baidu выпустила Ernie 5.1

Это флагманская модель с хорошим балансом цены и качества. Она сильна в агентных задачах, умеет рассуждать, писать тексты и работать с данными из сети.

Bach.Art делает видео по промпту

Новый сервис от Video Rebirth собирает ролики до 30 секунд, добавляет звук и синхронизирует губы.

Ideogram добавил удаление фона

Теперь функция доступна на бесплатном тарифе. Вся работа занимает три клика: загрузил картинку, убрал фон, сохранил объект — и не нужно чинить артефакты вручную.