工具简介
Gemini(原名 Bard)是 Google 推出的对话式 AI 助手,基于 Gemini 系列大模型(Ultra、Pro、Nano)。作为原生多模态模型,Gemini 从训练之初就同时理解文本、图像、音频、视频与代码。凭借与 Google 搜索、Workspace、Android 系统的深度集成,Gemini 在信息实时性和生态协同方面独具优势,是 ChatGPT 最主要的竞争对手之一。
核心功能
原生多模态
同时处理文本、图像、音频、视频输入,跨模态推理能力强
实时联网
深度集成 Google 搜索,实时获取最新信息,标注来源
超长上下文
Gemini 1.5 Pro 支持 200 万 token 上下文,可处理小时级视频
Workspace 集成
直接在 Gmail、Docs、Sheets、Slides 中调用 AI 辅助
Android 深度整合
取代 Google Assistant,成为 Pixel/Samsung 手机的默认助手
Imagen 图像生成
内置 Imagen 3 图像生成能力,直接在对话中生成高质量图片
使用教程
访问 Gemini
前往 gemini.google.com,使用 Google 账号登录,国内需科学上网
选择版本
免费版可用 Gemini 1.5 Flash,Advanced ($20/月) 解锁 1.5 Pro 与 2.0 Ultra
上传多模态输入
拖拽图片、PDF、音频、视频文件到对话框,Gemini 可综合理解
调用 Extensions
开启 @Gmail、@Maps、@YouTube 等扩展直接在对话中调用 Google 服务
创始故事
Google 于 2023 年 3 月推出对话 AI 产品 Bard,作为对 ChatGPT 的回应。2023 年 12 月,Google 正式发布 Gemini 系列模型,并将 Bard 更名为 Gemini。2024 年 2 月推出 Gemini Advanced($20/月),提供 Ultra 级别能力。2024 年底推出 Gemini 2.0,具备原生工具调用和 Agent 能力。作为 Google 全面 AI 化战略的核心产品,Gemini 已集成到 Google 搜索的 AI Overviews、Pixel 手机、Android 系统以及 Workspace 全套办公产品中。