Дайджест новостей об ИИ (11-17 мая)
ИИ на этой неделе прокачался сразу в нескольких ролях: говорит, переводит, пишет код, собирает видео и помогает с визуалом. Но есть нюанс: модели всё ещё могут врать, «играть в слабых» и терять части документов. Подробнее — в слайдах.
ChatGPT получил новые голосовые модели
OpenAI выпустила сразу три модели: Realtime-2 — для голосовых агентов, которые ведут диалог почти как человек, Translate — для перевода в реальном времени, Whisper — для потоковой транскрибации.
Google готовит Gemini Omni
Google готовит новую модель для генерации видео и преемника Veo 3.1. Релиз ждут 19 мая, поэтому вокруг анонса уже много внимания: все хотят понять, насколько сильно Google снова двинет рынок видео.
Claude Code стал ближе к автономному агенту
Agent View показывает все сессии в одном окне, а режим /goal позволяет задать цель и дать модели работать до результата без постоянных «да, продолжай».
Вышел первый рейтинг кодинг-агентов
Artificial Analysis сравнила Cursor, Claude Code, Codex и другие инструменты: кто лучше пишет код, кто быстрее, а кто дешевле.
Microsoft проверила LLM на длинных документах
Компания изучила, как модели ведут себя при долгом редактировании документов. Спойлер неприятный: даже сильные модели могут терять и искажать содержимое.
ИИ может специально «играть в слабого»
Anthropic и Redwood Research изучили сандбэггинг — ситуацию, когда ИИ специально занижает свои способности. Модель может понимать, где тест, а где реальная работа, и буквально «прикидываться».
Baidu выпустила Ernie 5.1
Это флагманская модель с хорошим балансом цены и качества. Она сильна в агентных задачах, умеет рассуждать, писать тексты и работать с данными из сети.
Bach.Art делает видео по промпту
Новый сервис от Video Rebirth собирает ролики до 30 секунд, добавляет звук и синхронизирует губы.
Ideogram добавил удаление фона
Теперь функция доступна на бесплатном тарифе. Вся работа занимает три клика: загрузил картинку, убрал фон, сохранил объект — и не нужно чинить артефакты вручную.