通义万相2.5-图像编辑-Preview调用ID:ali/wan2.5-i2i-preview图像生成图像与设计+1图像生成图像与设计指令编辑图片内容,轻松实现局部修改、风格变化、一致性保持等价格多项属性定价多项属性定价每张图片公开价格¥0.2/每张图片
通义万相2.5-文生图-Preview调用ID:ali/wan2.5-t2i-preview图像生成图像与设计+1图像生成图像与设计文字生成图片,写实质感细腻画面,文字内容生成,艺术风格表现价格多项属性定价多项属性定价每张图片公开价格¥0.2/每张图片
Gemini 2.5 Pro调用ID:google/gemini-2.5-pro文本编程多模态理解编程数学与科学学术与教育文档与办公+6文本编程多模态理解编程数学与科学学术与教育文档与办公Gemini 2.5 Pro是一款强大的推理模型,专为解决复杂问题而设计。它具备卓越的理解与分析能力,能够处理来自多种信息源的海量数据,包括文本、音频、图像、视频,甚至是完整的代码库。价格多项属性定价多项属性定价输入≤200k¥8.75/M token200k~不限¥17.5/M token输出≤200k¥70/M token200k~不限¥105/M token缓存读≤200k¥0.875/M token200k~不限¥1.75/M token
Gemini 2.5 Flash调用ID:google/gemini-2.5-flash文本多模态理解对话与客服编程内容创作数学与科学+5文本多模态理解对话与客服编程内容创作数学与科学Gemini 2.5 Flash是Google在性价比方面表现最优的模型,兼具全面能力与高效性能。作为首个具备“思维能力”的 Flash 系列模型,Gemini 2.5 Flash支持可视化的思维过程,让用户直观了解模型在生成回答时的推理路径。价格多项属性定价多项属性定价缓存写(5m)公开价格¥0.581/M token
Qwen3-VL-Plus调用ID:ali/qwen3-vl-plus文本多模态理解图像与设计视频与3D智能代理与数据编程+5文本多模态理解图像与设计视频与3D智能代理与数据编程Qwen3系列视觉理解模型,实现思考模式和非思考模式的有效融合,视觉智能体能力在OS World等公开测试集上达到世界顶尖水平。此版本在视觉coding、空间感知、多模态思考等方向全面升级;视觉感知与识别能力大幅提升,支持超长视频理解。价格多项属性定价多项属性定价输入≤32k¥1/M token32k~128k¥1.5/M token128k~不限¥3/M token输出≤32k¥10/M token32k~128k¥15/M token128k~不限¥30/M token缓存读≤32k¥0.2/M token32k~128k¥0.3/M token128k~不限¥0.6/M token
Doubao-Seed-1.8调用ID:bytedance/doubao-seed-1.8文本多模态理解智能代理与数据对话与客服+3文本多模态理解智能代理与数据对话与客服全新面向多模态 Agent 场景定向优化模型。更强Agent能力、升级多模态理解、更灵活的上下文管理。价格多项属性定价多项属性定价输入≤32k¥0.8/M token32k~128k¥1.2/M token128k~不限¥2.4/M token输出≤32k¥8/M token32k~128k¥16/M token128k~不限¥24/M token缓存读≤32k¥0.16/M token32k~128k¥0.16/M token128k~不限¥0.16/M token
通义万相2.2-图生视频-Fast-Lora调用ID:ali/wan-2.2-i2v-fast-lora视频生成视频与3D+1视频生成视频与3DPrunaAI 开发的 Wan 2.2 A14B 图像转视频优化版本,速度极快且价格低廉。价格多项属性定价多项属性定价每个视频480P¥0.35/秒720P¥0.77/秒
Qwen3-Max调用ID:ali/qwen3-max文本编程数学与科学智能代理与数据多模态理解翻译+5文本编程数学与科学智能代理与数据多模态理解翻译Qwen3-Max 是在 Qwen3 系列的基础上构建的更新版本,与 2025 年 1 月版本相比,在推理、指令遵循、多语言支持和长尾知识覆盖方面进行了重大改进。它在数学、编码、逻辑和科学任务中提供更高的准确性,更可靠地遵循复杂的中文和英文指令,减少幻觉,并为开放式问答、写作和对话提供更高质量的回答。该模型支持 100 多种语言,具有更强的翻译和常识推理能力,并针对检索增强生成 (RAG) 和工具调用进行了优化,尽管它不包括专用的“思考”模式。价格多项属性定价多项属性定价输入≤32k¥6/M token32k~128k¥10/M token128k~不限¥15/M token输出≤32k¥24/M token32k~128k¥40/M token128k~不限¥60/M token缓存读≤32k¥1.2/M token32k~128k¥2/M token128k~不限¥3/M token
即梦4.0调用ID:bytedance/jimeng_v40图像生成图像与设计多模态理解+2图像生成图像与设计多模态理解即梦4.0是即梦同源的图像生成能力,该能力在统一框架内集成了文生图、图像编辑及多图组合生成的功能:支持单次输入最多 10 张图像及进行复合编辑,并能通过对提示词的深度推理,智能适配最优的图像比例尺寸与生成数量,可一次性输出最多 15 张内容关联的图像。此外,模型显著提升了中文生成的准确率与内容多样性,且支持 4K 超高清输出,为专业图像创作提供了从生成到编辑的一站式解决方案。价格多项属性定价多项属性定价每张图片公开价格¥0.22/每张图片
MiMo V2 Flash调用ID:xiaomi/mimo-v2-flash文本编程智能代理与数据+2文本编程智能代理与数据这是一个专为极致推理效率自研的总参数 309B(激活 15B)的 MoE 模型,通过 Hybrid 注意力架构创新及多层 MTP 推理加速,在多个 Agent 测评基准上保持进入全球开源模型 Top 2;代码能力超过所有开源模型,比肩标杆闭源模型 Claude 4.5 Sonnet,但推理成本仅为其 2.5%,生成速度提升 2 倍,成功将大模型推理效率推向极致。输入¥0.7/M输出¥2.1/M上下文256K
GPT-5-Nano调用ID:openai/gpt-5-nano文本编程对话与客服多模态理解+3文本编程对话与客服多模态理解GPT-5-Nano是GPT-5系列中最快速的版本,专为开发者工具、即时交互和超低延迟场景优化。尽管在复杂推理能力上略逊于更大的模型,但它保留了核心的指令跟随与安全特性。输入¥0.35/M输出¥2.8/M上下文400K
GPT-5调用ID:openai/gpt-5文本编程数学与科学多模态理解智能代理与数据+4文本编程数学与科学多模态理解智能代理与数据GPT-5是OpenAI推出的最新一代先进模型,在推理能力、代码生成质量和用户体验方面实现显著提升。该模型针对复杂任务进行了专项优化,尤其擅长需要逐步推理、精准遵循指令以及对准确性要求严格的高风险场景。输入¥8.75/M输出¥70/M上下文400K
MiniMax H3调用ID:minimax/minimax-h3视频生成MiniMax H3 是开放通用的多模态视频模型,可以统一理解文本、图片、视频和音频输入,完成视频生成、参考创作与视频编辑。价格多项属性定价多项属性定价参考图片(前 5 张免费)公开价格¥0.2/张每秒输出2K¥0.8/秒768P¥0.5/秒每秒输入2K¥0.8/秒768P¥0.5/秒
通义万相2.5-文生视频-Preview调用ID:ali/wan2.5-t2v-preview视频生成视频与3D+1视频生成视频与3D文字生成视频内容,丝滑动态能力,电影美学控制,精准指令遵循价格多项属性定价多项属性定价视频480P¥0.3/次720P¥0.6/次1080P¥1/次
Qwen3-Omni-Flash调用ID:ali/qwen3-omni-flash文本对话与客服内容创作翻译编程文档与办公+5文本对话与客服内容创作翻译编程文档与办公Qwen-Omni 模型能够接收文本、图片、音频、视频等多种模态的组合输入,并生成文本或语音形式的回复, 提供多种拟人音色,支持多语言和方言的语音输出,可应用于文本创作、视觉识别、语音助手等场景。输入¥1.8/M输出¥6.9/M上下文65.5K
GLM-4.6调用ID:bigmodel/glm-4.6文本对话与客服文档与办公编程内容创作学术与教育+5文本对话与客服文档与办公编程内容创作学术与教育GLM-4.6 是智谱最新的旗舰模型,其总参数量 355B,激活参数 32B。GLM-4.6 所有核心能力上均完成了对 GLM-4.5 的超越价格多项属性定价多项属性定价输入≤32k¥2/M token≤32k¥3/M token32k~不限¥4/M token输出≤2k¥8/M token2k~不限¥14/M token全部¥16/M token缓存读全部¥0.4/M token全部¥0.6/M token全部¥0.8/M token
Gemini-2.5-flash-image调用ID:google/gemini-2.5-flash-image图像生成图像与设计+1图像生成图像与设计谷歌最强图像模型,nano-banana 的正式版。价格多项属性定价多项属性定价音频·输入公开价格¥7/M token图片·输入公开价格¥2.1/M token图片·输出公开价格¥210/M token视频·输入公开价格¥2.1/M token输入公开价格¥2.1/M token输出公开价格¥17.5/M token
Qwen-VL-OCR调用ID:ali/qwen-vl-ocr文本多模态理解文档与办公图像与设计+3文本多模态理解文档与办公图像与设计通义千问VL-OCR(qwen-vl-ocr),即基于Qwen-VL训练的OCR识别大模型。通过统一模型的方式聚合多种图文识别、解析、处理类任务,提供强大的图文识别能力。输入¥0.3/M输出¥0.5/M上下文32K
DeepSeek-OCR调用ID:deepseek/deepseek-ocr文本图像与设计多模态理解文档与办公+3文本图像与设计多模态理解文档与办公DeepSeek-OCR 是 DeepSeek AI 发布的视觉语言模型,旨在探索视觉-文本压缩边界,专注于文档识别及图像转文本场景的解决方案 。该模型可将长文本渲染为高压缩比图像,在 10 倍无损压缩下能实现 97% 的 OCR 准确率,即使压缩到 20 倍也能保持约 60% 的准确率。输入¥0.0001/M输出¥0/M上下文0
KlingV2.1调用ID:kling/kling-v2-1视频生成视频与3D+1视频生成视频与3DKling v2.1 是快手研发的文 / 图生视频模型,搭载 3D 时空注意力机制,能精准还原动态细节,支持 720P/1080P、24fps 输出。内置 10 + 运镜与多艺术风格,可自动补连贯动作、生成同步音效价格多项属性定价多项属性定价图像生成视频720p5秒¥2.00/次720p10秒¥4.00/次1080p5秒¥3.50/次1080p10秒¥7.00/次文本生成视频720p5秒¥2.00/次720p10秒¥4.00/次1080p5秒¥3.50/次1080p10秒¥7.00/次
Kling V2.1 Master调用ID:kling/kling-v2-1-master视频生成视频与3D+1视频生成视频与3DKling/Kling v2.1 Master 是快手文生视频大师级版本,主打 1080P 高清输出及 4K 适配,搭载专属动态光影追踪技术,可精准实现多主体动作协同与影视级粒子特效。支持材质细节实时渲染,5 秒 1080P 视频生成仅需 30 秒,兼顾高端画质与效率,适配影视预演、高端广告等场景,还能通过情绪参数调画面氛围,强化叙事感。价格多项属性定价多项属性定价图像生成视频720p5秒¥10.00/次720p10秒¥20.00/次1080p5秒¥10.00/次1080p10秒¥20.00/次文本生成视频720p5秒¥10.00/次720p10秒¥20.00/次1080p5秒¥10.00/次1080p10秒¥20.00/次
GLM-4.6 Thinking调用ID:bigmodel/glm-4.6:thinking文本编程数学与科学学术与教育文档与办公对话与客服+5文本编程数学与科学学术与教育文档与办公对话与客服GLM-4.6 是智谱最新的旗舰模型,其总参数量 355B,激活参数 32B。GLM-4.6 所有核心能力上均完成了对 GLM-4.5 的超越价格多项属性定价多项属性定价输入≤32k¥2/M token≤32k¥3/M token32k~不限¥4/M token输出≤2k¥8/M token2k~不限¥14/M token全部¥16/M token缓存读全部¥0.4/M token全部¥0.6/M token全部¥0.8/M token