<?xml version='1.0' encoding="utf-8"?>
      <rss version='2.0'>
      <channel>
      <title>Форум на Исходниках.RU</title>
      <link>https://forum.sources.ru</link>
      <description>Форум на Исходниках.RU</description>
      <generator>Форум на Исходниках.RU</generator>
  	
      <item>
        <guid isPermaLink='true'>https://forum.sources.ru/index.php?showtopic=409747&amp;view=findpost&amp;p=3689736</guid>
        <pubDate>Thu, 20 Oct 2016 13:37:52 +0000</pubDate>
        <title>С чего начать делать VAD?</title>
        <link>https://forum.sources.ru/index.php?showtopic=409747&amp;view=findpost&amp;p=3689736</link>
        <description><![CDATA[nsh: <div class='tag-quote'><span class='tag-quote-prefix'>Цитата</span> <div class='quote '>Какие классификаторы использовать</div></div><br>
<br>
Смеси гауссианов или нейросеть.<br>
<br>
<div class='tag-quote'><span class='tag-quote-prefix'>Цитата</span> <div class='quote '>какие фичи из семплов вытаскивать</div></div><br>
<br>
MFCC<br>
<br>
<div class='tag-quote'><span class='tag-quote-prefix'>Цитата</span> <div class='quote '>да и как семплы вообще готовить?</div></div><br>
<br>
<a class='tag-url' href='http://scikits.appspot.com/talkbox' target='_blank'>http://scikits.appspot.com/talkbox</a><br>
<br>
<div class='tag-code'><span class='pre_code'></span><div class='code  code_collapsed ' title='Подсветка синтаксиса доступна зарегистрированным участникам Форума.' style=''><div><div><ol type="1"><div class="code_line">import numpy as np</div><div class="code_line">import scipy.io.wavfile</div><div class="code_line">from scikits.talkbox.features import mfcc</div><div class="code_line">&nbsp;</div><div class="code_line">sample_rate, X = scipy.io.wavfile.read(&quot;path/to/audio_file&quot;)</div><div class="code_line">ceps, mspec, spec = mfcc(X)</div><div class="code_line">subtract_mean(ceps) # Нормализацию обязательно делать</div></ol></div></div></div></div><script>preloadCodeButtons('1');</script><br>
<br>
<div class='tag-quote'><span class='tag-quote-prefix'>Цитата</span> <div class='quote '>Какая длительность семплов?</div></div><br>
<br>
Зависит от требуемого разрешения VAD<br>
<br>
<div class='tag-quote'><span class='tag-quote-prefix'>Цитата</span> <div class='quote '> Потому что гласная вполне может оказаться каким-то музыкальным инструментом, если окошко короткое.</div></div><br>
<br>
Нужно баланс соблюсти между разрешением и точностью определения. Окна где-то в 0.5 секунд должно хватить.<br>
<br>
<div class='tag-quote'><span class='tag-quote-prefix'>Цитата</span> <div class='quote '>Должны ли окошки перекрываться?</div></div><br>
<br>
Да<br>
<br>
<div class='tag-quote'><span class='tag-quote-prefix'>Цитата</span> <div class='quote '>Как потом проводить поиск?</div></div> <br>
<br>
HMM потом декодирование для сглаживания решений классификаторов.<br>
<br>
<div class='tag-quote'><span class='tag-quote-prefix'>Цитата</span> <div class='quote '>На выходе будет какая-то матрица для перемножения весовых коэфициентов или что-то еще?</div></div><br>
<br>
На выходе будут предсказания для каждого окна - речь/музыка/шум<br>
<br>
<div class='tag-quote'><span class='tag-quote-prefix'>Цитата</span> <div class='quote '>В приведенной PDF предлагается сделать классификатор на шум и музыку отдельно, а может быть стоит все ненужное вместе слепить?</div></div><br>
<br>
Лучше отдельно.]]></description>
        <author>nsh</author>
        <category>Речевые Технологии</category>
      </item>
	
      <item>
        <guid isPermaLink='true'>https://forum.sources.ru/index.php?showtopic=409747&amp;view=findpost&amp;p=3689682</guid>
        <pubDate>Thu, 20 Oct 2016 10:11:26 +0000</pubDate>
        <title>С чего начать делать VAD?</title>
        <link>https://forum.sources.ru/index.php?showtopic=409747&amp;view=findpost&amp;p=3689682</link>
        <description><![CDATA[powitoju: <strong class='tag-b'>nsh</strong><br>
<em class='tag-i'>можно с помощью scikit-learn.</em><br>
А можно поподробнее? Какие классификаторы использовать, какие фичи из семплов вытаскивать, да и как семплы вообще готовить? Голые звуки, FFT или MFCC скармливать? Может что-то еще? Или что-то уже из них?<br>
<br>
Какая длительность семплов? Потому что гласная вполне может оказаться каким-то музыкальным инструментом, если окошко короткое. Должны ли окошки перекрываться?<br>
<br>
Как потом проводить поиск? На выходе будет какая-то матрица для перемножения весовых коэфициентов или что-то еще? В приведенной PDF предлагается сделать классификатор на шум и музыку отдельно, а может быть стоит все ненужное вместе слепить?]]></description>
        <author>powitoju</author>
        <category>Речевые Технологии</category>
      </item>
	
      <item>
        <guid isPermaLink='true'>https://forum.sources.ru/index.php?showtopic=409747&amp;view=findpost&amp;p=3689328</guid>
        <pubDate>Tue, 18 Oct 2016 13:03:33 +0000</pubDate>
        <title>С чего начать делать VAD?</title>
        <link>https://forum.sources.ru/index.php?showtopic=409747&amp;view=findpost&amp;p=3689328</link>
        <description><![CDATA[nsh: Нужно классификатор тренировать, можно с помощью scikit-learn. Базу музыки и шумов для обучения можно скачать тут:<br>
<br>
<a class='tag-url' href='http://www.openslr.org/17/' target='_blank'>http://www.openslr.org/17/</a><br>
<br>
Описание тут:<br>
<br>
<a class='tag-url' href='https://arxiv.org/pdf/1510.08484v1.pdf' target='_blank'>https://arxiv.org/pdf/1510.08484v1.pdf</a>]]></description>
        <author>nsh</author>
        <category>Речевые Технологии</category>
      </item>
	
      <item>
        <guid isPermaLink='true'>https://forum.sources.ru/index.php?showtopic=409747&amp;view=findpost&amp;p=3689314</guid>
        <pubDate>Tue, 18 Oct 2016 12:04:37 +0000</pubDate>
        <title>С чего начать делать VAD?</title>
        <link>https://forum.sources.ru/index.php?showtopic=409747&amp;view=findpost&amp;p=3689314</link>
        <description><![CDATA[powitoju: VAD - Voice Activity Detection обычно применяется в телефонии, чтобы резать все что на речь не похоже и не захламлять канал. Мне же надо как можно точнее разметить звуковой файл. Границы слов, мелкие паузы и придыхания не интересуют, надо как-то уметь отделять звук речи от звуков музыки или шумов. Шумы - это посторонние звуки, а не белый шум.<br><br>Пробовал смотреть на спектрограмму. Русская и японская речь достаточно сильно отличаются, а если ее еще пропустить через пару-тройку фильтров, то уши продолжают устойчиво распознавать речь, но на спектрограмме глазами уже ничего не разобрать.<br><br>Имеет ли задача решение? Разбирал реализации из WebRTC (считается лучшим), Speex и Audacity. Во всех фактически идет проверка на некую амплитуду сигнала, а не именно на речь. Некие фильтры есть в реализации из WebRTC, но чего-то полезного от нее я не смог добиться.]]></description>
        <author>powitoju</author>
        <category>Речевые Технологии</category>
      </item>
	
      </channel>
      </rss>
	