Gemini 3.5 Flash-Lite - Google 发布的高吞吐低成本模型

堆友AI

Gemini 3.5 Flash-Lite是什么

ジェミニ 3.5 Flash-Lite 是 Google 发布的高吞吐低成本模型,官方定位为 3.5 系列中最快、最具成本效益的型号,面向 agentic search、文档处理与大规模生产流量;约 350 output tokens/s 的速度、约 $0.30/$2.50 每百万输入/输出 トークン 的价格,以及可调 thinking level 与内置 コンピュータ use,适合批量抽取、自动化子代理、客服分流、代码辅助和多模态入口任务。

Gemini 3.5 Flash-Lite - Google 发布的高吞吐低成本模型

Gemini 3.5 Flash-Lite的功能特色

  • 低延迟高吞吐定位:主打“3.5-class 中最快、最具成本效益”,官方引用 人工分析 测得约 350 output tokens/s,适合高并发与生产级跑量任务。
  • 显著降本:价格约 $0.30/1M input tokens、$2.50/1M output tokens,明显低于同场发布的 Gemini 3.6 Flash,更适合规模化调用。
  • 长上下文与较大输出:公开资料显示支持 1M tokens 上下文;最大输出有 64K/66K 两种表述,建议以官方模型卡/API 文档为最终口径。
  • 可调推理强度:支持调整 thinking level,可在“更快更便宜”与“更深推理”之间按任务权衡,便于同一模型覆盖轻量问答到中等复杂任务。
  • Agentic 能力增强:内置 computer use,可执行跨应用、跨界面操作;官方称其相较 Gemini 3.1 Flash-Lite 在 Terminal-Bench 2.1、GDM-MRCR v2、GDPval-AA v2 上明显提升。
  • 部分越级表现:官方引用数据显示,它在 SWE-Bench Pro、OSWorld-Verified 等 agentic/coding 评测上可超过 Gemini 3 Flash,适合作为子代理或执行层模型。
  • 多模态与结构化输出:第三方目录列出 vision、tool calling、web search、caching、JSON schema 等能力,利于做文档解析、表单抽取、API 工作流和可校验输出 。

Gemini 3.5 Flash-Lite的核心优势

  • 极致速度:是 Gemini 3.5 系列中速度最快的模型,输出速度可达约 350 tokens/s,能够快速生成结果,满足实时或近实时的交互需求。
  • 极致性价比:价格极低,输入价格为 0.30 美元/百万 tokens,输出价格为 2.50 美元/百万 tokens,适合高并发、大批量调用,大幅降低大规模应用的运行成本。
  • 性能不弱:虽然为轻量级,但在多项基准测试(如 SWE-Bench Pro、OSWorld-Verified)中表现优异,部分成绩甚至超越前代标准版模型,具备良好的任务处理能力。
  • フレキシブルな構成:支持可配置的思考等级(minimal/low/higher),可根据任务复杂程度灵活调整,简单任务走低等级以保低延迟和低成本,复杂子任务走高等级以保证质量。

Gemini 3.5 Flash-Lite的操作步骤

  • 确认使用入口:个人使用 グーグルAIスタジオ 或 Gemini app;应用开发使用 Gemini API;企业级代理平台使用 Gemini Enterprise Agent Platform;Android 场景可用 Android Studio 集成入口 。
  • 创建项目与密钥:在 Google Cloud / AIスタジオ 开通项目,启用 Gemini API,创建 API Key,配置结算、配额、区域与访问权限;正式环境建议单独项目、单独密钥与最小权限。
  • 核对模型名与限额:调用前在官方文档确认 3.5 Flash-Lite 的精确 model ID、上下文窗口、最大输出、速率限制与计费规则;1M 上下文、约 $0.30/$2.50 每百万输入/输出 tokens。
  • 做最小连通测试:用 SDK 或 REST 发送短 prompt 验证鉴权、模型可用性与返回格式;再固定 temperature、max output tokens、system instruction 与超时/重试策略。
  • 按任务设 thinking level:轻量分类、抽取、改写用低推理;检索汇总、规则判断、代码修补用中推理;复杂多步任务再提高推理或切给更强主模型,避免为所有请求支付同等延迟成本。
  • 设计输入与结构化输出:长文档先切块/去重/压缩,必要时启用 caching;需要入库或联调用 JSON schema/枚举约束输出,并加 schema 校验与失败回退。
  • 接入工具与代理流程:需要联网、函数调用或跨界面操作时,配置 web search、tool calling 或 computer use;把“规划/验收”交给更强模型,把检索、清洗、批量执行交给 Flash-Lite 子代理,平衡质量与成本 。

Gemini 3.5 Flash-Lite的适用人群

  • 应用开发者与独立开发者:需要把摘要、分类、改写、轻量代码助手、工具调用嵌入 App/SaaS,且对延迟和单价敏感;其低价格与约 350 output tokens/s 的速度适合高频交互。
  • 初创团队与中小业务:预算有限但要上线 AI 客服、表单理解、订单/邮件处理、知识库问答等功能,可用 Flash-Lite 承接大部分流量,仅把复杂case升级给更强模型。
  • 企业平台与共享服务中心:适合客服分流、工单抽取、合同/发票/简历初筛、内部知识库检索改写等批量场景;企业可用 Gemini Enterprise Agent Platform 纳入治理与代理编排。
  • 数据与文档处理团队:处理长文档、批量清洗、字段抽取、JSON 化入库的人群;1M 上下文、caching 与 JSON schema 能力有利于流水线化,但具体输出上限应以官方文档为准。
  • Agent 编排/自动化工程师:适合让 Gemini 3.6 Flash 或更强模型做规划与验收,用 Flash-Lite 做检索子代理、执行子代理、页面/系统操作与尾部重试,显著压低整体成本。
  • 电商、运营与内容团队:用于商品标题/详情生成、评论聚类、FAQ 草稿、社媒文案变体、SEO 元信息批量产出;发布前仍需事实核验与品牌语气校对。

Gemini 3.5 Flash-Lite的常见问题

Q:它和 Gemini 3.6 Flash、Gemini 3 Flash 怎么选?
A:要最低成本/最高吞吐选 3.5 Flash-Lite;要更强 coding、多模态与主代理质量选 3.6 Flash;官方称 3.5 Flash-Lite 在 SWE-Bench Pro、OSWorld-Verified 等部分评测可超过 Gemini 3 Flash,但不等于全面替代更强模型。


Q:价格大概多少?
A:公开口径约为 $0.30/1M input tokens、$2.50/1M output tokens;输出 トークン 通常更贵,批量任务要重点压缩输出长度。


Q:上下文和最大输出是多少?
A:多方资料称支持 1M tokens 上下文;最大输出存在 64K/66K 两种写法,接入前应以 Google 官方模型卡/API 文档、返回错误与实测为准。


Q:速度有多快、为什么适合跑量?
A:官方引用 Artificial Analysis 测得约 350 output tokens/s,加上低价,适合客服分流、检索改写、表单抽取、日志/工单处理等高频请求。


Q:支持多模态、工具调用和结构化输出吗?
A:第三方模型目录列出 vision、tool calling、web search、caching、JSON schema 等能力;官方还强调内置 computer use,可用于跨界面 agentic 操作。


Q:thinking level 应该怎么调?
A:分类、抽取、改写用低档;多步检索、规则判断、代码修补用中档;复杂任务再升档或交给更强模型,避免全量请求使用高推理造成延迟与成本浪费 。
© 著作権表示

関連記事

コメントなし

コメントに参加するにはログインが必要です!
今すぐログイン
なし
コメントはありません