دربارهٔ گفتار
پیادهسازی صدای فارسی کار کُندی است. یک جلسهٔ یکساعته، دستکم سه ساعت تایپ میبرد؛ و ابزارهای خارجی که این کار را خودکار میکنند یا فارسی را خوب نمیفهمند یا از ایران در دسترس نیستند.
گفتار برای همین ساخته شده: تبدیل صوت به متن فارسی، با زیرساخت داخل ایران و پرداخت ریالی.
چه چیزی متفاوت است
- یک مدل کافی نیست. دقت مدلها روی فارسی یکسان نیست و به جنس فایل بستگی دارد. گفتار چند مدل را پشت یک واسط جمع میکند و میگوید هر متن را کدام مدل تولید کرده است.
- متن خام هیچوقت پنهان نمیشود. اگر متنی اصلاح شود، آنچه مدل واقعاً گفته است باقی میماند و قابل بازگرداندن است.
- هر پردازش تاریخچه دارد. میبینید هر مرحله چقدر طول کشیده و اگر شکست خورده، کجا و چرا.
در چه مرحلهای هستیم
گفتار تازه راه افتاده است. تفکیک گوینده، اصلاح هوشمند متن و جمعبندی جلسه در دست ساختاند. هر قابلیتی پیش از عرضه روی دادهٔ واقعی فارسی سنجیده میشود — چون ادعای دقت بدون اندازهگیری، ادعا نیست.