یک سیگنال گفتار اطلاعات زبانی را برای به اشتراک گذاری اطلاعات و ایده ها حمل می کند.
اصطلاحات مرتبط:
درباره این صفحه
حداقل فیلتر تطبیقی مربع حداقل اصلاح شده برای تقویت گفتار
M. Kalamani ، M. Krishnamoorthi ، در پردازش گفتار کاربردی ، 2021
خلاصه
سیگنال های گفتار نقش مهمی در سیستم ارتباطات انسانی دارند. در برنامه های پردازش گفتار مانند سمعک ، تشخیص خودکار گفتار ، تلفن های همراه ، ارتباطات اتومبیل ، رمزگذار صدا ، سیستم های مخابراتی ، تلفن های هندزفری ، پزشکی قانونی و غیره ، حذف نویز پس زمینه یک روند خسته کننده است. از الگوریتم های کاهش نویز برای تقویت گفتار برای غلبه بر این مشکل در برنامه های پردازش گفتار استفاده می شود. این نوع الگوریتم تقویت گفتار ، نویز پس زمینه را از بین می برد و قابلیت درک و کیفیت گفتار را بهبود می بخشد. در این فصل ، ما یک الگوریتم حداقل میانگین متوسط کاهش نویز تطبیقی مربع (LMS-ANR) برای تقویت سیگنال گفتار تامیل با کیفیت قابل قبول در محیط های نویز غیر ایستگاه ایجاد می کنیم. این الگوریتم پیشنهادی به طور خودکار ضرایب خود را با توجه به سیگنال های پر سر و صدا ورودی تطبیق می دهد.
بیشتر بخوانید URL: https://www. scienceirect. com/science/article/pii/b9780128238981000047
رسانه انتقال داده ها
II. B سیگنال های گفتار
سیگنال های گفتار معمولاً از طریق کانال های تلفنی منتقل می شوند. مجموعه تلفن سیگنال های صوتی را به سیگنال های آنالوگ الکتریکی تبدیل می کند که به مبادله تلفن محلی منتقل می شوند و سپس از طریق شبکه تلفنی منطقه گسترده به طرف گیرنده منتقل می شوند. اگرچه گفتار به طور معمول فرکانس های 30 تا 10،000 هرتز را در بر می گیرد ، اما بیشتر انرژی در محدوده 200 تا 3500 هرتز است. از آنجا که گوش انسان نسبت به تغییرات کوچک در فرکانس ها بسیار حساس نیست و از آنجا که انسان می تواند برای مواردی مانند هجا یا کلمات گمشده اصلاح کند ، ما نیازی به تولید مثل سیگنال های گفتار دقیقاً برای دستیابی به کیفیت قابل قبول انتقال نداریم. در نتیجه ، بیشتر ارتباطات تلفنی برای صرفه جویی در هزینه های انتقال ، بین 200 تا 3500 هرتز به دست می آیند. این پس انداز به وجود می آید زیرا هزینه ها به طور مستقیم با پهنای باند (یعنی دامنه فرکانسهای منتقل شده) مرتبط است و (همانطور که بعداً توضیح داده می شود) بانداسیون اجازه می دهد تا تعداد بیشتری از کانال های صوتی در یک کانال باند بلند چند برابر شوند. با این حال ، لازم به ذکر است که پهنای باند اسمی یک کانال صوتی به عنوان 4000 هرتز تعریف شده است ، با پهنای باند اضافی به یک باند نگهبان در هر دو طرف سیگنال گفتار اجازه می دهد تا تداخل بین کانال ها را کاهش دهد.
زمان لازم برای برقراری اتصال تلفنی می تواند از چند ثانیه تا ده ها ثانیه متفاوت باشد ، ارتباطات تقریباً همیشه دو طرفه است و دو طرف به طور مداوم انتقال می دهند (صحبت می کنند) ، گوش دادن (دریافت) یا مکث تا زمان تماسخاتمه یافتهدامنه پویا گسترده در حجم مورد نیاز است ، اگرچه به اندازه سیگنال های برنامه بزرگ نیست. مکالمات نیاز به تحویل فوری سیگنال دارند (یعنی تأخیرها تحمل نمی شوند) ، اما ارتباطات نسبتاً تحمل نویز در کانال است.
بیشتر بخوانید URL: https://www. sciencedirect. com/science/article/pii/b0122274105001654
تکنیک های پارامتر سازی سیستم تشخیص خودکار گفتار
10. 5. 4 تجزیه و تحلیل زمان کوتاه
سیگنال های گفتار از نظر ماهیت غیر ایستگاه هستند ، به این معنی که پارامترهای آماری آنها مانند شدت و واریانس با گذشت زمان متفاوت است [11]. سیگنال های گفتار ممکن است برای یک دوره کوتاه تر ثابت باشند اما وقتی در مدت زمان طولانی تری در نظر گرفته شود ، آنها بی پروا هستند. بنابراین تبدیل فوریه یک تکنیک مناسب برای تجزیه و تحلیل گفتار نیست زیرا برای زمان بی نهایت به یک سیگنال دوره ای نیاز دارد. از تکنیکی به نام تجزیه و تحلیل زمان کوتاه استفاده می شود. در این تکنیک ، سیگنال به فریم یا بخش های کوتاه تقسیم می شود ، با فرض اینکه سیگنال در آن قاب کوتاه ثابت است و هر قاب یا بخش را به طور جداگانه تجزیه و تحلیل می کند. طول هر فریم حدود 10-20 میلی ثانیه است ، به اندازه کافی کوتاه برای برآورده کردن فرض. طیف سنجی نمونه ای از تجزیه و تحلیل RIME کوتاه است که در بخش بعدی مورد بحث قرار می گیرد. تبدیل فوریه زمان گسسته برای هر فریم اعمال می شود که منجر به طیف ها با گذشت زمان می شود.
برای یک سیگنال داده شده X [N] ، سیگنال زمان کوتاه x m [n] فریم M توسط Eq نشان داده شده است.(10. 15):
(10. 15) x m [n] = x [n]. W M [n]
جایی که w m [n] یک تابع پنجره است ، فراتر از یک منطقه خاص مقدار آن صفر است. برای این تکنیک ، w m [n] باید برای همه فریم ها برابر باشد. بنابراین محاسبات مانند معادلات است.(10. 16) و (10. 17).
(10. 16) w m [n] = w [m - n] (10. 17) w [n] =N 2>
جایی که n طول پنجره است.
بیشتر بخوانید URL: https://www. scienceirect. com/science/article/pii/b9780128212295000100
روشهای فرکانس زمان در رادار ، سونار و آکوستیک
14. 7. 1. 1 سیگنال های گفتار
بیشتر سیگنال های گفتار فرآیندهای غیر ایستگاه با چند مؤلفه هستند که ممکن است در زمان و فرکانس متفاوت باشند. روشهای ثابت کلاسیک قادر به ارائه این تغییرات به طور دقیق نیستند ، در حالی که بازنمایی ها (t ، f) توضیحات دقیق تری از سیگنال های غیر ایستگاه را امکان پذیر می کنند. دو ویژگی آکوستیک مفید در یک سیگنال گفتار صدا وجود دارد: فرکانس اساسی (PITCH) و Formant. فرکانس اساسی معمولاً کمترین مؤلفه فرکانس سیگنال است. این نشان دهنده فرکانس لرزش تارهای صوتی در هنگام تولید صدا است. فرمت غلظت انرژی آکوستیک در اطراف یک فرکانس خاص در موج گفتار است. هر فرمن با یک رزونانس در دستگاه صوتی مطابقت دارد. مدلی که برای نشان دادن سیگنال های گفتاری ابراز شده استفاده می شود توسط Ref تعریف شده است.[53]
(14. 7. 1) s (t) = ∑ k = 1 n s k (t)
با s k (t) = a k (t) cos (2 π [f c k t + ∫ 0 t f k (τ) d τ] + θ) ، جایی که f c k فرکانس مرکزی است ، fk(t) مدولاسیون فرکانس و الف استk(T) دامنه متغیر زمان است. فرکانس آنی (if) sk(t) به عنوان f i k (t) = f c k + f k (t) تعریف شده است. این مدل مجموعه ای از مدولاسیون دامنه N و مدولاسیون فرکانس (AM-FM) است ، که در آن هر سیگنال یک شکل دهنده را نشان می دهد [54]. فرکانس های اساسی و فرمت ، که توسط قله های اصلی در طیف نشان داده شده است ، اطلاعات مهمی در مورد گفتار را منتقل می کند. در حقیقت ، مقدار زیادی از اطلاعات آوایی توسط بخش های مربوط به سیگنال های گفتاری صدایی منتقل می شود. بر این اساس ، تشخیص و ردیابی فرمت در استخراج ویژگی های گفتار و در شناخت رفتار تکاملی آن مهم است. بازنمایی یک سیگنال گفتار صوتی توسط پاکت دامنه فرمت و فرکانس آنی غنی است ، زیرا هم ساختار طیفی و هم اطلاعات زمان بندی تحریک از باندهای مختلف فرم را نشان می دهد. اگرچه اساساً تعداد نامحدودی از فرمت ها در سیگنال های گفتار وجود دارد ، اما چهار شکل برای نشان دادن خصوصیات آهنگ صوتی کافی است [54]. در نتیجه ، نیازی به تشخیص و پیروی از تمام اجزای فرکانس گفتار در اکثر برنامه ها نیست. به طور سنتی ، ردیاب های فرمت از پیش بینی خطی استفاده می کنند یا مبتنی بر STFT هستند [54]. چنین ردیاب های فرم به خوبی کار می کنند که فرم ها به آرامی و به تدریج تغییر می کنند ، اما در صورت تغییرات ناگهانی در مسیرهای فرمت ، نتایج ضعیف به دست می آید. به طور کلی ، از دو طیف سنج با طول پنجره های مختلف استفاده می شود. در طیف سنجی پهنای باند (طول پنجره کوچک) ، وضوح زمانی خوب است و می توان تناوب زمین را مشاهده کرد ، اما ما بومی سازی ساختارهای تشکیل دهنده را قربانی می کنیم. طیف سنجی باریک دومی را از نظر وضوح فرکانس بهبود می بخشد ، اما وضوح زمان تخریب می شود. مشکل دیگری با این نوع روش ها وجود دارد. اگر دو شکل مجاور در صفحه (T ، F) خیلی نزدیک باشند ، این پدیده ممکن است در فواصل معینی یک قله واحد در طیف ایجاد کند و منجر به از دست رفتن یکی از فرمت های موجود شود. دو روش ممکن برای غلبه بر محدودیت های طیف سنجی معمولی وجود دارد. روش اول استفاده از روشهای با وضوح بالا (T ، F) است (به فصل های 2 و 3 مراجعه کنید) ، در حالی که رویکرد دوم استفاده از برخی از روشهای پس از پردازش مانند انتقال مجدد است (به بخش 7. 5 مراجعه کنید).
بیشتر بخوانید URL: https://www. scienceirect. com/science/article/pii/b9780123984999000145
پیشگفتار
به طور کلی ، سیگنال های گفتار و صوتی با یک یا چند میکروفن ثبت می شوند. به همین دلیل ، فناوری جداسازی منبع صدا را می توان در جداسازی منبع صدا مونورال و جداسازی منبع صدا چند کاناله طبقه بندی کرد. این کتاب بر جداسازی منبع کور (BSS) متمرکز شده است که روند جدا کردن مجموعه ای از سیگنال های منبع از مجموعه ای از سیگنال های مختلط بدون کمک اطلاعات یا با اطلاعات بسیار کمی در مورد سیگنال های منبع یا فرآیند اختلاط است. نادر است که اطلاعات مربوط به سیگنال منبع صوتی از قبل جدا شده است ، از قبل بدست آمده است ، بنابراین مهم است که بتوانید منبع صوتی را بدون چنین اطلاعاتی جدا کنید. این کتاب همچنین به موضوعات مختلف چالش برانگیز پوشش جداسازی منبع تک کانال می پردازد که در آن سیگنال های منبع چندگانه از یک سیگنال مختلط به روشی تحت نظارت آموخته می شوند ، و همچنین جدایی منبع مستقل از بلندگو و سر و صدا که در آن مجموعه بزرگی از داده های آموزشی در دسترس استبرای یادگیری یک مدل کلی.
بیشتر بخوانید URL: https://www. scienceirect. com/science/article/pii/b9780128045664000073
مفهوم کلی با مورب شدن ماتریس همبستگی گفتار
یعقوب بنستی ،. جینگدونگ چن ، در تقویت سخنرانی ، 2014
2. 3. 2 تحریف گفتار
سیگنال گفتار مورد نظر تبدیل شده را می توان با ماتریس فیلتر مستطیل شکل تحریف کرد. بنابراین ، ضریب کاهش گفتار به عنوان تعریف شده است
.
از (2. 16) ، یک ماتریس فیلتر مستطیل شکل که بر سیگنال مورد نظر تبدیل شده تأثیر نمی گذارد ، نیاز به محدودیت دارد:
(2. 31) H ∼ t x = i p ،
where I P is the P × P identity matrix. Hence, ξ sr H ∼ = 1 in the absence of distortion and ξ sr H ∼>1 در حضور اعوجاج. با در نظر گرفتن حداقل محلول 2mor m-norm از (2. 31) ، ما دریافت می کنیم
(2. 32) H ∼ = t x H t x - 1 t x h = t x h.
این راه حل با فیلتر MVDR با سر و صدای سفید مطابقت دارد (به بخش 2. 4. 3 مراجعه کنید).
با انجام تعویض های مناسب ، می توان رابطه را بین اقدامات تعریف شده تاکنون ، یعنی ، به دست آورد.
.
هنگامی که هیچ اعوجاعی رخ نمی دهد ، افزایش SNR با ضریب کاهش نویز همزمان است.
راه دیگر برای اندازه گیری اعوجاج سیگنال گفتار مورد نظر تبدیل شده به دلیل عملکرد فیلتر از طریق شاخص اعوجاج گفتار تعریف شده به عنوان [4]
(2. 34) υ SD H ∼ = E X ∼ FD - X ∼ H x ∼ FD - X ∼ TR λ X ∼ = TR H ∼ T X - I P λ X ∼ H ∼ T X - I P H TR λ x ∼ = υ SDح.
شاخص اعوجاج گفتار همیشه بیشتر از یا برابر با 0 است و برای ماتریس های فیلتر مستطیل بهینه باید از 1 محدود باشد. بنابراین هرچه مقدار SD H ∼ بالاتر باشد ، سیگنال مورد نظر تبدیل شده بیشتر تحریف می شود.
بیشتر بخوانید URL: https://www. sciencedirect. com/science/article/pii/b97801280013940025
شبکه عصبی عمیق
7. 6. 3 ارزیابی سیستم
در ارزیابی سیستم ، سیگنال های گفتار از 83 بلندگو نمونه برداری شد و سیگنال های نویز با 88 نوع نویز جمع آوری شد (Tsou and Chien ، 2017). در میان این بلندگوها ، 77 سخنران به عنوان سخنران آموزش انتخاب شدند و 6 سخنران باقیمانده به عنوان سخنران آزمون غیب رفتار می شدند. سخنان بلندگوهای مختلف به طور تصادفی با صداهای مختلف غیر ایستگاه آمیخته شد. 7768 حرف آموزشی وجود داشت که با استفاده از 86 نوع نویز مخلوط شدند. داده های آموزش پر سر و صدا توسط SNR از 5 دسی بل ایجاد شد در حالی که داده های تست پر سر و صدا توسط SNR از 5 ، 0 و 5 دسی بل با دو نوع نویز غیب (کافه تریا و اتوبوس) تولید شد. شرایط بلندگوهای دیده و غیب نیز مورد بررسی قرار گرفت. در این دو شرط 300 حرف آزمایش پر سر و صدا جمع آوری شده است. وظیفه تقویت گفتار تک کانال مورد بررسی قرار گرفت. در اجرای ، STFT 1024 نقطه برای سیگنال های مخلوط x t مخلوط ∈ R 513 محاسبه شد. DNN با توپولوژی 513-1000-1000-1000-700- تحقق یافت. برای قوام در مقایسه با DNN ، LSTM و NTM همان توپولوژی را با همان تعداد نورون ها دنبال کردند اما در سبک لایه های پنهان 3 و 4 متفاوت بودند. LSTM دو لایه مکرر از LSTM را اجرا کرد در حالی که NTM لایه 3 پنهان را به عنوان یک لایه LSTM و لایه 4 به عنوان یک لایه NTM پیاده سازی کرد. اندازه حافظه M T به عنوان 32 ثابت شد. همه مدل ها با استفاده از الگوریتم SGD با اندازه مینی دسته 50 فریم آموزش داده شدند. اندازه پله 20 فریم در زمان بازگشت به طول زمان استفاده شد. بهینه ساز آدم اعمال شد. تقویت گفتار با استفاده از درک عینی کوتاه مدت (STOI) مورد بررسی قرار گرفت. هرچه STOI بالاتر باشد ، جداسازی منبع بهتر می شود.
ما عملکرد جداسازی منبع مونورال را با استفاده از DNN ، LSTM و NTM از نظر STOI در حضور بلندگوهای آزمایش دیده و غیب مقایسه می کنیم ، همانطور که در جداول 7. 2 و 7. 3 نشان داده شده است. 77 سخنران آموزش وجود دارد. نتایج demixing تحت SNR های مختلف و صداهای آزمایشی به طور متوسط انجام می شود. بهبود NTM نسبت به DNN و LSTM به طور مداوم برای بلندگوهای دیده و غیب تحت صداهای مختلف و SNR به دست می آید. بهبود برای 5 dB قابل توجه است در حالی که بهبود جزئی برای 0 و 5 دسی بل مشاهده می شود.
جدول 7. 2. مقایسه Stois با استفاده از DNN ، LSTM و NTM تحت SNR های مختلف با بلندگوهای دیده شده
| مدل | - 5 dB | 0 دسی بل | 5 دسی بل |
| فرآوری نشده | 0. 614 | 0. 717 | 0. 808 |
| DNN | 0. 662 | 0. 763 | 0. 820 |
| LSTM | 0. 688 | 0. 788 | 0. 847 |
| NTM | 0. 702 | 0. 797 | 0. 851 |
جدول 7. 3. مقایسه Stois با استفاده از DNN ، LSTM و NTM تحت SNR های مختلف با بلندگوهای غیب
| مدل | - 5 dB | 0 دسی بل | 5 دسی بل |
| فرآوری نشده | 0. 647 | 0. 746 | 0. 829 |
| DNN | 0. 678 | 0. 785 | 0. 844 |
| LSTM | 0. 718 | 0. 815 | 0. 872 |
| NTM | 0. 731 | 0. 825 | 0. 877 |
بیشتر بخوانید URL: https://www. scienceirect. com/science/article/pii/b978012804566400019x
سیستم های پردازش سیگنال دیجیتال: تکنیک های اجرای
گفتار برنامه نویسی با نرخ کم بیتی
یک روش ساده برای دیجیتالی کردن سیگنال های گفتار برای انتقال از طریق یک کانال ارتباطی از طریق استفاده از مدولاسیون کد پالس (PCM) است که با سرعت استاندارد 64 کیلوبایت بر ثانیه کار می کند. این نرخ داده بالا برای اجرای آن پهنای باند کانال بالاتری دارد. با این حال ، در برنامه های خاص (به عنوان مثال ، ارتباط ایمن از طریق کانال های رادیویی که از ظرفیت کم برخوردار هستند) ، پهنای باند کانال در حق بیمه است. در برنامه های کاربردی از این نوع ، نیاز قطعی به برنامه نویسی گفتار در نرخ بیت پایین وجود دارد ، ضمن حفظ وفاداری قابل قبول یا کیفیت تولید مثل (جیانت و نول ، 1984). در این زمینه ، دو روش برنامه نویسی برای گفتار که به ذهن متبادر می شوند ، مدولاسیون پالس دیفرانسیل تطبیقی و پیش بینی رمزگذاری شده هستند.
یک سیستم مدولاسیون پالس دیفرانسیل تطبیقی سازگار (ADPCM) شامل یک رمزگذار و یک رمزگشایی است که توسط یک کانال ارتباطی جدا شده است. رمزگذار ، واقع در فرستنده ، از یک طرح بازخورد استفاده می کند که شامل یک Quantizer سازگار در مسیر رو به جلو و یک پیش بینی کننده سازگار در مسیر بازخورد است ، همانطور که در شکل 9 (A) نشان داده شده است. پیش بینی کننده ، که بر اساس یک نسخه کمکی از سیگنال گفتار ورودی عمل می کند ، پیش بینی یک مرحله ای از این سیگنال را تولید می کند. خطای پیش بینی ، به عنوان تفاوت بین سیگنال گفتار واقعی و پیش بینی یک مرحله ای که تولید می شود ، به نوبه خود کمیت می شود و از این طریق حلقه بازخورد را تکمیل می کند (کاتلر ، 1952 ؛ هایکین ، 1994b). نسخه رمزگذاری شده خطای پیش بینی کمکی سیگنال منتقل شده را تشکیل می دهد. این سیگنال منتقل شده یک نسخه فشرده شده از سیگنال گفتار اصلی را به واسطه حذف بخش اضافی (یعنی قابل پیش بینی) از سیگنال گفتار نشان می دهد. رمزگذار ، واقع در گیرنده ، از ماکت دقیقی از پیش بینی کننده سازگار مورد استفاده در فرستنده استفاده می کند ، همانطور که در شکل 9 (b) نشان داده شده است. در صورت عدم وجود نویز ، سیگنال گفتار بازسازی شده در خروجی گیرنده دقیقاً برابر با سیگنال گفتار اصلی است ، به جز نویز به دلیل فرآیند کمیت در فرستنده. چالش در طراحی یک سیستم ADPCM انجام بازسازی سیگنال بدون انتقال هرگونه اطلاعات جانبی است ، یعنی اطمینان از اینکه گیرنده صرفاً به خطای پیش بینی (کمکی) برای عملکرد خود نیاز دارد. پیکربندی شرح داده شده در شکل 9 امکان تحقق این چالش را فراهم می کند.
شکل سنتی ADPCM از یک پیش بینی کننده تطبیقی خطی استفاده می کند (جیانت و نول ، 1985). به طور خاص ، در یک سیستم ADPCM 32 کیلوبایت بر ثانیه ، در سطح بین المللی به عنوان یک روش کدگذاری استاندارد برای سیگنال های گفتار پذیرفته شده است ، پیش بینی کننده خطی شامل یک فیلتر پاسخ تکانه ای نامحدود است که عملکرد انتقال آن دارای 6 صفر و 2 قطب و پارامترهای رایگان است کهمطابق با یک الگوریتم به روزرسانی ضریب جدید که به حداقل می رسد سوء استفاده می کند (Cointor ، 1982). با این حال ، به طور گسترده ای شناخته شده است که یک سیگنال گفتار نتیجه یک فرآیند پویا است که هم غیرخطی و هم غیر ایستگاه است. بنابراین نباید جای تعجب داشت که استفاده از یک پیش بینی کننده غیرخطی در ساخت یک سیستم ADPCM پیشرفت قابل توجهی در عملکرد آن ایجاد می کند. در واقع ، این اولین بار توسط هایکین و لی (1993) با استفاده از پیش بینی مبتنی بر PRNN برای طراحی پیش بینی کننده غیرخطی نشان داده شد. یک مطالعه دقیق تر از عملکرد برتر یک ADPCM با استفاده از یک پیش بینی کننده مبتنی بر PRNN ، در مقایسه با نسخه AT& T سیستم با استفاده از یک پیش بینی کننده خطی ، در یک پایان نامه دکتری توسط لی (1994) ارائه شده است. این مطالعه اخیر با ارزیابی های کمی و آزمایش های ذهنی پشتیبانی می شود.
در کنار کد - برنامه نویسی پیش بینی شده از سیگنال های گفتار ، روش کدگذاری جستجوی چندگانه مورد نظر ، کدگذاری کتاب کد است. به طور کلی ، کدگذاری کتاب کد به دلیل اندازه زیاد کتاب کد مورد نیاز غیر عملی است. با این حال ، جستجوی جامع کتاب کد برای یافتن دنباله بهینه نوآوری (پیش بینی-خطا) برای رمزگذاری بخش های کوتاه سیگنال گفتار با نرخ بیت بسیار پایین امکان پذیر می شود (شرودر و آتال ، 1985). بخش رمزگذاری سیستم از یک سینت سایزر گفتار استفاده می کند که از دو فیلتر متغیر تشکیل شده است ، هر کدام دارای یک پیش بینی کننده در حلقه بازخورد هستند ، همانطور که در شکل 10 نشان داده شده است. اولین حلقه بازخورد شامل یک پیش بینی کننده تاخیر طولانی (PITCH) است که دوره زمین گفتار صدایی را ایجاد می کند ، در حالی که حلقه بازخورد دوم شامل یک پیش بینی کننده تأخیر کوتاه برای بازگرداندن پاکت طیفی است (شرودر و آتال ، 1985). در مورد کد - پیش بینی خطی هیجان زده (CELP) برای گفتار با کیفیت بالا با نرخ بیت بسیار پایین ، هر دو این پیش بینی کننده خطی هستند. وو و نیرانجان (1994) استفاده از پیش بینی کننده های غیرخطی برای کدگذاری گفتار پیش بینی شده با کد را بررسی کرده اند. به طور خاص ، آنها از یک شبکه عصبی مکرر که با یک نسخه ساده از الگوریتم RTRL که در ابتدا توضیح داده شد ، استفاده کردند. در اینجا همچنین گزارش شده است که استفاده از یک پیش بینی کننده غیرخطی منجر به بهبود عملکرد برنامه نویسی گفتار می شود.
فارکس تحلیل تکنیکال...
ما را در سایت فارکس تحلیل تکنیکال دنبال می کنید
برچسب :
نویسنده : مرتضی احمدی
بازدید : <-PostHit->
تاريخ : يکشنبه
22 مرداد
1402 ساعت: 21:54