神楽 モニカ 先生 のセリフ集 (60 発言)

そうそう、日本では2003年に制定されて、2017年・2022年と改正が続いているのよ。 データサイエンティストとしては最新版を意識しておく必要があるわ。

そう、相関係数1.5なんてあり得ないから即見直し。 基本中の基本だけど、本番のミスを減らすには一番効くのよ。

『売上が落ちた』を Why × 5 で深掘りすると、表層の『広告効果が落ちた』から、根本の『顧客の生活様式が変わった』まで辿り着けたりするの。

目安として80〜90%。 業務によっては95%まで欲張る場合もある。 ただし主成分数を増やすと次元削減のメリットが減るので、トレードオフ。

F1は特定の閾値での性能、AUCは閾値全体に渡る性能。 モデル比較ではAUCが便利、運用閾値が決まっているならF1で評価する、と使い分けるのよ。

DS検定★では『SVMはマージン最大化』『k-NNは距離ベースの多数決』『ナイーブベイズはベイズ+独立仮定』を押さえれば十分よ。

『新しいサンプルから最も近い k 個の既存サンプルを見て、多数決で分類する』というシンプルな手法。 学習なしで予測時に距離計算するだけ。

計算過程を全て書き残すこと。 暗算で飛ばすと検算できないし、ミスを見つけにくい。 試験本番でも、途中の数字をメモ用紙に残しておくと見直しが速いの。

現在の公式試験ページは、基盤、データサイエンス、データエンジニアリング、価値創造の4カテゴリを試験範囲として示しているわ。

DS検定★では複雑な計算は問われないけれど、『行列の積で次元が合わない選択肢を見抜く』『内積の計算』『単位行列・転置行列の意味』は押さえてね。

その理解こそデータサイエンティストに求められる素養。 DS協会のスキルチェックリストにも『行動規範』として明記されているの。

(1)入力データの分布を継続監視、(2)精度劣化を検出したら再学習、(3)定期的にモデルを更新、というサイクルを回す。 これが MLOps の要諦。

目安として『1行に欠損が大半ある』『列の50%以上が欠損』なら削除を検討。 ただしデータ量が少ない場合は埋めることも検討。 ケースバイケース。

積の各要素は『左の行と右の列の内積』だから、長さが一致しないと内積が計算できないのよ。

どちらも大量データの保管庫だけど、使い方がちょっと違うのよ。 整理してみましょうか。

実はRIGHTを使う場面って少なくて、テーブルの順序を入れ替えてLEFTで書くことが多いのよ。 結果は同じになるの。

DS検定では CRISP-DM の段階順序や、各段階での主タスクが問われることがあるわ。

これは模擬問題セットの内訳で、実際の本試験におけるカテゴリ別出題数を4問と公表したものではないわ。

上から順に1段ずつね。 各段で『何の形状(Series/DataFrame)・何の意味』を持つかを把握しながら追っていくのよ。

そう、ただし閾値は問題に応じて変えられる。 不均衡データ(例: 病気の患者は1%)では0.5より低い閾値が適切なことも。
紅林 かえで のセリフ集 (137 発言)

表データで迷ったら『まずは線形/ロジスティック回帰でベースライン → LightGBM で精度向上』が定石ですね。 シンプルから始めて複雑化、が鉄則です。

そう、第3変数の影響を取り除いて『本当の関連』を見るのが偏相関の目的。 計算は標準化された残差同士の相関で求める。

そう、{kw('t検定')}は2群の平均の差を検定するときに使う頻出手法ね。

DS検定では『k-meansはk事前指定』『階層型はデンドログラム』『k選択にエルボー法』が頻出。

DS検定★では、このレベルのCTEとウィンドウ関数の組み合わせ問題が出ます。 慣れれば30秒で読み切れるようになりますよ。

DS検定では『パーセプトロン構造』『誤差逆伝播の役割』『活性化関数の種類』が頻出。

DS検定★では『AICとBICの違い』『AICの罰則項はパラメータ数の2倍』が頻出よ。

forループを書かずに、配列全体に演算を一括適用することです。 これがNumPyが速い理由ですよ。

DS検定では『次のデータの代表値はどれか』『外れ値があるとどう変化するか』が頻出よ。

あとCatBoostもあって、こちらはカテゴリ変数の扱いが得意なの。 この3つはGBDT御三家と呼ばれているわ。

そうだね、各段が『フィルタ→集計→並び替え→絞り込み』みたいに目的を持っているんだ。 SQLの実行順序とよく似た発想だよ。

DS検定★ では『Society 5.0 の定義』『DXとデジタル化の違い』『2025年の崖』が頻出よ。

DS検定では『決定木の不純度』『ランダムフォレストはバギング+特徴量サンプリング』が頻出よ。

非線形性を入れるためだよ。 線形変換を何回重ねても結局は線形変換のままだから、非線形を挟むことで複雑な関数を表現できるの。

少子高齢化、地方衰退、エネルギー問題、医療格差、災害対応など、個別では解きにくい社会課題を、データとAIでまとめて解こうという発想ですね。

訓練精度↑↑でテスト精度↓なら過学習。 訓練もテストも精度↓なら未学習。 両方の精度を比べるのがポイントね。

そこが落とし穴なの。 テストデータで学習しちゃってたら、未知のデータに対する性能はわからないのよ。

DS検定★ では『敵対的攻撃 vs データ汚染攻撃の違い』『推論時 vs 学習時』が頻出。

補足すると、訓練はモデルのパラメータ学習、検証はハイパーパラメータ調整やモデル選択、テストは最終的な汎化性能の評価、という役割分担になっているの。

識別子(氏名・ID)を別の符号(乱数ID)に置き換える。 マッピング表を保持していれば復元できるのが匿名化との違い。
藍沢 しずく のセリフ集 (201 発言)

うぅ〜ん…厳しいルールなんですねぇ…

k-匿名性、聞いたことありますぅ。

実務では分散はわからないことが多いんですねぇ。

シンプルですぅ♪でも『あるべき姿』って、どうやって決めるんですかぁ?

個人情報保護とは違うんですかぁ?

活性化関数って、なんのためにあるんですかぁ?

実例で覚えますぅ♪

シナリオから読み取るのって、難しそうですぅ…

わぁ、回帰でも気をつけることがたくさんあるんですねぇ。

最初に成功基準を決めるのが大事なんですねぇ♪

リーク防止のためですねぇ♪

暗記しますぅ♪

選択バイアスって、具体的にはどんなのぉ?

怖いですぅ…

層化って、統計のサンプリングのところで出てきましたねぇ♪

医療はどうですかぁ?

線形性、しっかり覚えますぅ♪

選び方、整理してほしいですぅ♪

ランダムに分けないとどうなるんですかぁ?

なにかコツはありますかぁ?
白峰 リリ のセリフ集 (252 発言)

二項分布で n が大きくて p が小さいときは、ポアソン分布で近似できるって聞いたよ!

AIに任せるべきこと、人間が決めるべきこと、どう線引きすればいい?

計算式も違うの?

上司から『改善案を考えて』って言われたんだけど、対象が広すぎてどこから手をつけたらいいか分かんないよ…

要は、難しい問題に出会ったら潔く飛ばす勇気が要るってこと?

じゃあ偏差値60って、平均から1σ高いから、上位16%くらいってことか!

変数選択って自動でやれるの?

新しいAIシステムをいきなり全社展開するのって、ちょっと怖くない?

訓練データだと99%正解なのに、テストだと60%しかなかったんだけど…なんで?

なるほど〜、無いことを示すのは難しいんだね。

実務でもよく使われてるって聞くよ!

複数のCSVを組み合わせるのって、SQLのJOINみたいなことPandasでもできるの?

計算ミスを防ぐコツってある?

機械学習って、どこから手をつければいいの?

標準偏差って、よく『SD』とか『σ』って書かれてるやつだよね!

テストデータで100%正解だったら、それでバッチリってこと?

単位の確認?

なるほどね〜、だから医療では確認のために再検査するんだ!

うわぁ、覚えること多いなぁ…

信頼区間が狭いほど、推定が正確、ってこと?