Google випустив Gemini 3.8 Flash: сильніший кодинг за $0,75 за мільйон токенів
Google випустив Gemini 3.8 Flash — нову production-ready модель сімейства Flash із фокусом на довгі задачі з програмування, AI-агентів і складні багатокрокові workflow. За бенчмарками самої Google, модель суттєво додала в software engineering і впритул наблизилася до дорожчих frontier-моделей.
Головний нюанс стосується ціни. Заявлені $0,75 за мільйон вхідних і $3,75 за мільйон вихідних токенів справді діють, але це промотариф лише до 31 грудня 2026 року. З 1 січня 2027 року стандартна API-ціна подвоїться до $1,50 і $7,50 відповідно.
Key Takeaways
- Gemini 3.8 Flash вийшов 2 вересня 2026 року та вже має статус General Availability.
- Google позиціонує його як свій найрозумніший Flash для coding, автономних агентів і складних knowledge workflows.
- На DeepSWE v1.1 модель набрала 73,7% проти 65,3% у Gemini 3.7 Flash за тестами Google.
- Контекстне вікно становить приблизно 1 млн токенів, максимальний output — 65 536 токенів.
- API коштує $0,75 за 1 млн input і $3,75 за 1 млн output токенів лише до кінця 2026 року.
- Одна задача може фактично обходитися дорожче, ніж у 3.7 Flash, оскільки 3.8 здатна витрачати більше reasoning-токенів і робити більше кроків через інструменти.
Gemini 3.8 Flash орієнтується на довгі coding-задачі
Google описує Gemini 3.8 Flash не просто як швидку модель для коротких запитів, а як workhorse для long-horizon software engineering. Йдеться про роботу з великими проєктами, multi-file refactoring, послідовне використання інструментів і задачі, де AI-агент має самостійно виконати багато кроків до готового результату.
Саме в цьому напрямку видно найбільший приріст відносно попереднього Gemini 3.7 Flash.
На DeepSWE v1.1, який оцінює довгі software engineering-задачі, Gemini 3.8 Flash отримав 73,7% проти 65,3% у версії 3.7. Для порівняння, у таблиці Google Claude Opus 5 має 74%, а GPT-5.6 Sol — 72,7%.
Тобто у конкретному тесті недорога Flash-модель фактично підійшла впритул до флагманського рівня. Водночас це результати, опубліковані Google, і переносити один benchmark на всі сценарії програмування не варто.
На Terminal-Bench результат також виріс
У Terminal-Bench 2.1, який перевіряє agentic coding через термінал, Google наводить результат 89,4% для Gemini 3.8 Flash проти 85,8% у 3.7 Flash.
Але модель не стала безумовним лідером у всіх агентних тестах. Наприклад, на складнішому Terminal-Bench 4.0 її результат становить 19,1%, тоді як окремі дорожчі frontier-моделі залишаються попереду.
Тому коректніше говорити про серйозний апгрейд саме в long-horizon coding і частині agentic workloads, а не про універсальне домінування над усіма конкурентами.
Модель сама «працює довше», щоб отримати кращий результат
Одна з найцікавіших змін Gemini 3.8 Flash — не лише нові benchmark scores, а й сама поведінка моделі.
Google прямо попереджає, що на складних задачах 3.8 Flash може виконувати більше проміжних reasoning-кроків, повторно викликати інструменти та перевіряти власний результат перед завершенням роботи.
Це потенційно підвищує надійність довгих agentic workflow, але створює важливий нюанс у вартості. Однакова ціна за токен не означає однакову ціну за виконану задачу: якщо нова модель генерує більше reasoning/output токенів і робить більше agent steps, фінальний чек може зрости.
Тому для production-сценаріїв правильніше порівнювати не лише $/1M tokens, а cost per completed task — скільки коштує реально завершений coding job або агентний workflow.
Ціна $0,75/$3,75 діятиме лише до кінця року
На старті Google залишив Gemini 3.8 Flash той самий промотариф, що й для 3.7 Flash: $0,75 за мільйон вхідних токенів і $3,75 за мільйон вихідних. Thinking tokens також рахуються як output.
Context caching коштує $0,075 за мільйон токенів. Для Batch та Flex inference ціна ще нижча: $0,375 за input і $1,875 за output.
Однак ці ставки діють лише до 31 грудня 2026 року. З 1 січня 2027 року стандартний тариф становитиме $1,50 за мільйон input і $7,50 за мільйон output токенів. Batch/Flex відповідно подорожчають до $0,75 та $3,75.
Тому теза «Google залишив ціну низькою» правильна лише для поточного introductory period.
1 млн токенів контексту та керований рівень thinking
Gemini 3.8 Flash підтримує вхідний контекст до 1 048 576 токенів і максимальний output у 65 536 токенів. На вході модель приймає текст, зображення, відео, аудіо та PDF, а генерує текст.
Розробники можуть керувати рівнем thinking через режими low, medium і high. За замовчуванням Google використовує medium.
Для простих задач нижчий effort може бути економнішим, тоді як складний debugging, робота з великим repository або автономний агент можуть отримати користь від більшого reasoning budget.
Gemini 3.8 Flash уже вміє працювати з інструментами та комп’ютером
Модель підтримує function calling, code execution, file search, structured outputs, URL context, grounding через Google Search і Maps. Computer Use також доступний, хоча поки має статус Preview.
Цей напрямок Google розвиває вже кілька поколінь. Раніше UAGEEK писав, як Gemini 3.5 Flash отримала Computer Use для взаємодії з інтерфейсами та виконання послідовностей дій замість користувача.
У 3.8 Flash Google робить наступний акцент: не просто дати моделі інструменти, а підвищити надійність довгих циклів, у яких агент сам планує, виконує дію, перевіряє результат і переходить до наступного кроку.
Де вже доступний Gemini 3.8 Flash
Gemini 3.8 Flash вийшов одразу в General Availability, тому розробникам не потрібно чекати завершення preview.
Модель доступна через Gemini API та Google AI Studio, а також використовується в Gemini App, Gemini Enterprise Agent Platform, Google AI Mode і Google Antigravity. Для Antigravity agent вона стала моделлю за замовчуванням.
Модельний ID для API — gemini-3.8-flash.
Google паралельно випустив Gemini 3.8 Flash Cyber
Разом зі звичайною моделлю Google представив Gemini 3.8 Flash Cyber — спеціалізований варіант для пошуку вразливостей та автоматизованого виправлення коду.
Але це не ще одна публічна модель в AI Studio. Cyber-версія має обмежений доступ через Fairwind Program і орієнтована на перевірених захисників, урядові структури та партнерів із кібербезпеки.
Чому Gemini 3.8 Flash цікавий саме для AI-агентів
Для розробників найбільш цікаве позиціонування 3.8 Flash — співвідношення між інтелектом, latency та ціною. Флагманська якість має значення, але в агентних системах один користувацький запит може запускати десятки або сотні model calls.
У такому сценарії навіть невелика різниця у вартості кожного виклику швидко множиться на обсяг. Саме тут Flash-моделі можуть бути практичнішими за дорогі флагмани, якщо вони дають достатньо високу успішність виконання задачі.
Google активно поширює агентний підхід і на інші продукти. UAGEEK також розбирав, як Gemini Omni автоматизує створення рекламних матеріалів усередині Google Ads, де AI уже використовується не лише для відповіді на запит, а для виконання повного production workflow.
Gemini 3.8 Flash виглядає дешевим, але рахувати треба весь workflow
На папері Gemini 3.8 Flash отримав сильне позиціонування: близький до frontier-рівня результат у частині coding-бенчмарків при значно нижчій ціні за токен.
Але два уточнення змінюють картину. По-перше, нинішня ціна тимчасова і подвоїться вже 1 січня 2027 року. По-друге, сама Google попереджає, що модель може витрачати більше токенів на складних задачах, оскільки ретельніше перевіряє свою роботу.
Тому головний тест Gemini 3.8 Flash буде не в тому, наскільки дешево коштує один мільйон токенів, а в тому, скільки коштує успішно закритий coding task порівняно з Gemini 3.7 Flash та дорожчими конкурентами.
Ще більше цікавого в нашому Telegram-каналі! Підписуйтесь ҐікNews.
Джерела для перевірки
Джерела для перевірки
Google. Офіційний анонс Gemini 3.8 Flash від 2 вересня 2026 року: позиціонування моделі, coding та agentic improvements, результати benchmark-тестів і запуск Gemini 3.8 Flash Cyber.
Анонс Gemini 3.8 Flash
Google AI for Developers. Офіційна документація моделі: GA-статус, 1M context window, 64K output, thinking levels, інструменти та рекомендації щодо використання.
Що нового в Gemini 3.8 Flash
Gemini API. Актуальна тарифна сторінка підтверджує $0,75/$3,75 до 31 грудня 2026 року та підвищення до $1,50/$7,50 з 1 січня 2027 року.
Ціни Gemini API
Google DeepMind. Сторінка моделі з benchmark-порівняннями, підтримуваними форматами, доступністю та основними сценаріями Gemini 3.8 Flash.
Gemini 3.8 Flash у Google DeepMind
Google DeepMind Model Card. Технічний опис, оцінювання та відомі обмеження моделі, включно з можливим зростанням token usage на складних задачах.
Model Card Gemini 3.8 Flash


