大语言模型,涵盖文本生成、对话、推理与代码生成等,如 GPT、GLM、Qwen 等系列。
自动语音识别,将语音转为文字,用于语音助手、会议转写、实时字幕等场景。
文本转语音与语音合成,实现多音色、多语种、情感化朗读与配音。
计算机视觉开源库,图像处理、特征提取、相机标定与视觉算法基础。
目标检测模型,实时检测与定位,适用于工业检测、安防与自动驾驶等。
分割一切模型,通用图像分割与实例分割,支持点、框提示与自动分割。
图文对齐模型,多模态理解与检索,零样本分类、以图搜图与跨模态匹配。
持续更新中,欢迎关注热热