Back to people
@nkzwkzs
N

nakazawa kazushi(中澤和司)

音声
@nkzwkzs

博士(工学)音声認識系の仕事をしています DNNベースで音声の品質を評価する研究していました IEEE Sendai YPとASJ若手フォーラムで活動してます

764Followers3.3KFollowing4.1KPostsView on X

Recent posts

SLTのレビューきましたね、リバッタル頑張ってみます。

Ubranch Conformer、このエンコーダーモデルは知りませんでした https://ieeexplore.ieee.org/document/10700716

ASR関連でもarXivのSDやASに入っていない論文を見逃すことがあるので広めにチェックしないといけないですね

こちらはWhisper EncoderをSparse Autoencoder(SAE)で解析した研究みたいです。内部表現を分解して、どのような情報が表現されているのかを調べるだけでなく、その特徴を操作して認識や翻訳への影響も解析しているのが面白そうです。 https://arxiv.org/html/2605.12225v2

ASRの内部表現をMechanistic Interpretabilityの観点から解析した研究みたいです。Linear ProbingやLogit Lensだけでなく、Activation Patchingを用いてEncoderからDecoderへの情報伝搬やhallucinationの原因を因果的に解析しているのが面白そうです。

@ArxivSound
A
arXiv Sound@ArxivSound

Neta Glazer, Yael Segal-Feldman, Hilit Segev, Aviv Shamsian, Asaf Buchnick, Gill Hetz, Ethan Fetaya, Joseph Keshet, Aviv Navon, "Beyond Transcription: Mechanistic Interpretability in ASR," https://arxiv.org/abs/2508.15882

テクニカルレポート来てくれー😣

金沢のホテルとりましたが3泊で1万5000円いきませんでした 安いですね

Cross-Attentionに単語境界を教師あり学習させることで、タイムスタンプ精度を改善しているみたいです。非流暢音声でも高精度なタイムスタンプが得られているのが面白そうです。

@fly51fly
F
fly51fly@fly51fly

[CL] Transcription Policy as a Latent Variable: Activating Controllable Verbatim ASR with Word-Level Timing L Wagner, M Zusag, B Thallinger [nyra labs] (2026) https://arxiv.org/abs/2607.18934

Photo 1Photo 2Photo 3Photo 4

正常聴力者と難聴者を対象に、駅などの仮想音響環境で語音了解度や聴取努力、補聴器の効果を多面的に測定した研究みたいです。 https://www.tandfonline.com/doi/full/10.1080/14992027.2026.2615093

こちらの音声系のベンチマークは知りませんでした https://benchmarks.coval.ai/stt

言語に依存しない聴覚評価について整理したレビュー論文みたいです 読んでみたいです https://www.frontiersin.org/journals/neuroscience/articles/10.3389/fnins.2026.1887850/full

いろいろなお話聞けて勉強になりました 関係者の皆様ありがとうございました #sumo_ai

Photo 1Photo 2

LLM使ってないモデルとしてはOpen ASR Leaderboardで結構高いように見えます

ZipformerとCR-CTCを使ったTransducerモデルが公開されていますね CR-CTCなしバージョンもあるみたいですがそれより精度高いみたいですね https://huggingface.co/soundsgoodai/Zipformer-cr-ctc-transducer-XL-290M

スペイン強いですね 点取られたの結局ベルギーのデケテラーレだけ

MossFormer2調べたらFSMN使われているんですね VADに適用されるイメージがありました