调研的时候发现,语音转文字,图识别,图像生成,视频生成,大语言模型,这些是分开的,输入有很多格式,输出也有很多格式,不同的输入与输出之间也有不同的模型。 王赞 @wangzan101 · 2026-07-03