asopi tech
asopi techOSS Developer

#AIタグの記事

表示切り替え
それでも、私はAlopex DBを作る
ALOPEX
Alopex DB

それでも、私はAlopex DBを作る

SQLite・DuckDB・PostgreSQL・分散DB・ベクトルDB・グラフDB。優れた製品はいくらでもある。それでも新しいデータベースを作っているのは、開発段階が進むたびにDBを選び直し、そのたびにデータそのものを作り直しているからだ。ローカルからクラウド、単体から分散へスケールしても、データの量・変換時間・再生成コスト・来歴を失わない基盤を目指すAlopex DBの話。

【第5回】物理的に正しい動画へ ― ワールドモデル統合とAIが教師データを作る時代
AI
生成 AI

【第5回】物理的に正しい動画へ ― ワールドモデル統合とAIが教師データを作る時代

単なる動画生成は「見た目は自然だが物理的にはおかしい」映像になりがちです。物体が消え、重力を無視し、操作結果が一貫しない。第5回(最終回)では、動画生成にワールドモデルを組み込み、物理制約を損失に入れて「物理的に整合した動画」を作る方法を最小コードで示し、教師データをAIとシミュレーションで丸ごと作る未来までを描きます。全5回シリーズ第5回。

【第4回】動画生成とワールドモデルは何が違うのか ―「それっぽい映像」と「状態遷移」
AI
生成 AI

【第4回】動画生成とワールドモデルは何が違うのか ―「それっぽい映像」と「状態遷移」

SoraやVeoのような動画生成と、ワールドモデルは似て見えて別物です。前者は「もっともらしい映像」を作り、後者は「行動すると世界がどう変わるか」を学びます。第4回では、動画生成のノイズ予測と、ワールドモデルの `S_t + A_t → S_{t+1}` を対比し、NVIDIA CosmosやGoogle Genieが何を教師データにしているのかを整理します。全5回シリーズ第4回。

【第3回】音声モデルはLLMに近づく ― TTSとSpeech2Speechの教師データ
AI
生成 AI

【第3回】音声モデルはLLMに近づく ― TTSとSpeech2Speechの教師データ

音声合成(TTS)は、かつてMel Spectrogramを正解にしていました。しかし最近のモデルは、音声を「音声トークン」に変換し、それを予測します。構造はもうLLMそっくりです。第3回では、TTSとSpeech2Speech(音声翻訳・声質変換・エンドツーエンド会話AI)の教師データの作り方を追い、対応データ収集の難しさとその回避策までを整理します。全5回シリーズ第3回。

【第2回】画像生成は「ノイズ」か「トークン」を当てる ― TXT2IMGの教師データとキャプション
AI
生成 AI

【第2回】画像生成は「ノイズ」か「トークン」を当てる ― TXT2IMGの教師データとキャプション

画像生成にはGAN・自己回帰(トークン)型・拡散モデルの系統があり、いまの主流はStable Diffusionのような拡散モデルです。拡散型は「画像を直接描く」のではなく「加えたノイズを当てる」ことを学び、自己回帰型はLLMのように「次の画像トークン」を当てます。第2回では、画像とテキストのペアの集め方・CLIPによる品質フィルタから両方式の教師データまでを最小コードで整理します。全5回シリーズ第2回。

【第1回】生成AIは何を「正解」に学ぶのか ― 自己教師あり学習とLLM
AI
生成 AI

【第1回】生成AIは何を「正解」に学ぶのか ― 自己教師あり学習とLLM

LLMも画像生成も、人間が全件ラベルを付けた教師データで学んでいるわけではありません。カギは「元データから入力と正解を機械的に作る」自己教師あり学習です。第1回では、元データと教師データの違い、そしてLLMがどうやってテキストそのものを次トークン予測問題に変えて学ぶのかを、最小コードとともに整理します。全5回シリーズ第1回。

【第3回】巨大モデル一つで全部やるな ― 階層と責務分離のアーキテクチャ
AI
生成 AI

【第3回】巨大モデル一つで全部やるな ― 階層と責務分離のアーキテクチャ

「お腹が空いた」の判断だけで数十億パラメータが動く——全部を一つの巨大モデルでやるのは資源の無駄使いです。人間の神経系が処理の種類ごとに回路を分けているように、AIも時間スケールと責務で階層化すべき。ロボットの制御階層、エネルギー効率、OSのような構造、そして制御ソフトウェアの「組織化」まで。全3回シリーズ完結編。

【第2回】AIに「小脳」と「自律神経」を ― 身体を持つ知能の設計図
AI
生成 AI

【第2回】AIに「小脳」と「自律神経」を ― 身体を持つ知能の設計図

文字列データで発展したLLMを人間の大脳に例えるなら、小脳や脊髄、そして心臓や胃腸からの生理的フィードバックを司る自律神経に相当する仕組みが要るはずです。人体とAIシステムの階層対応、人工小脳(Diffusion Policy)、内受容感覚、恒常性(Homeostasis)まで、身体を持つ知能の設計図を描きます。全3回シリーズ第2回。

【第1回】フィジカルAIの現在地 ―「LLMの延長」なのか、それとも別物なのか
AI
生成 AI

【第1回】フィジカルAIの現在地 ―「LLMの延長」なのか、それとも別物なのか

ロボットに「見る・言葉で理解する・物理的に動く」を統合させるフィジカルAI。これはLLMの発展研究なのか、それとも拡散モデルなど別系統なのか。VLA・拡散/flow・World Modelの3系統と、RT-2・Gemini Robotics・OpenVLA・π0・GR00T・Cosmosといった具体モデルから、2026年時点の現在地を整理します。全3回シリーズ第1回。

日米IT産業比較 ―「製品」と「サービス」、そしてAIによる再編
AI
生成 AI

日米IT産業比較 ―「製品」と「サービス」、そしてAIによる再編

アメリカでIT企業といえばMicrosoftやNVIDIA、日本ではNTTデータや富士通——同じ「IT企業」でも指すものが違います。製品を世界へ量産する米国型と、顧客固有の業務を支える日本型。この構造差が収益・人材・競争力を分けてきました。生成AIはこの構図をどう再編するのか、日本の弱みと強みから展望します。

AIに負けないスキル。データのエンジニアリング
DATA
データ・DB

AIに負けないスキル。データのエンジニアリング

コーディングエージェントはロジックやテストに強い。しかし「このデータは何を意味し、誰が責任を持ち、どの鮮度で流れ、正本はどれか」は分からない。これは「AIに身体性がない」ことから演繹されるテーマです。データの意味・品質・来歴・責任範囲を設計できる人こそ、AI時代に価値が上がる——最新のデータエンジニアリング議論とともに整理します。

【第2回】ビギナーこそAIで経験を積む ― いちばん伸びるのは、初心者だ
AI
生成 AI

【第2回】ビギナーこそAIで経験を積む ― いちばん伸びるのは、初心者だ

AIが答えをくれる時代、初心者は不利なのか。むしろ逆です。開発環境の構築やコンテナ・VMなど詰まりやすい題材をAIと一緒に試し、一緒に失敗する——その反復(イテレーション)でビギナーは最速で経験を積めます。AIにたくさん失敗させて観察する使い方まで解説。シリーズ第2回。

それでも、私はAlopex DBを作る

SQLite・DuckDB・PostgreSQL・分散DB・ベクトルDB・グラフDB。優れた製品はいくらでもある。それでも新しいデータベースを作っているのは、開発段階が進むたびにDBを選び直し、そのたびにデータそのものを作り直しているからだ。ローカルからクラウド、単体から分散へスケールしても、データの量・変換時間・再生成コスト・来歴を失わない基盤を目指すAlopex DBの話。

【第5回】物理的に正しい動画へ ― ワールドモデル統合とAIが教師データを作る時代

単なる動画生成は「見た目は自然だが物理的にはおかしい」映像になりがちです。物体が消え、重力を無視し、操作結果が一貫しない。第5回(最終回)では、動画生成にワールドモデルを組み込み、物理制約を損失に入れて「物理的に整合した動画」を作る方法を最小コードで示し、教師データをAIとシミュレーションで丸ごと作る未来までを描きます。全5回シリーズ第5回。

【第4回】動画生成とワールドモデルは何が違うのか ―「それっぽい映像」と「状態遷移」

SoraやVeoのような動画生成と、ワールドモデルは似て見えて別物です。前者は「もっともらしい映像」を作り、後者は「行動すると世界がどう変わるか」を学びます。第4回では、動画生成のノイズ予測と、ワールドモデルの `S_t + A_t → S_{t+1}` を対比し、NVIDIA CosmosやGoogle Genieが何を教師データにしているのかを整理します。全5回シリーズ第4回。

【第3回】音声モデルはLLMに近づく ― TTSとSpeech2Speechの教師データ

音声合成(TTS)は、かつてMel Spectrogramを正解にしていました。しかし最近のモデルは、音声を「音声トークン」に変換し、それを予測します。構造はもうLLMそっくりです。第3回では、TTSとSpeech2Speech(音声翻訳・声質変換・エンドツーエンド会話AI)の教師データの作り方を追い、対応データ収集の難しさとその回避策までを整理します。全5回シリーズ第3回。

【第2回】画像生成は「ノイズ」か「トークン」を当てる ― TXT2IMGの教師データとキャプション

画像生成にはGAN・自己回帰(トークン)型・拡散モデルの系統があり、いまの主流はStable Diffusionのような拡散モデルです。拡散型は「画像を直接描く」のではなく「加えたノイズを当てる」ことを学び、自己回帰型はLLMのように「次の画像トークン」を当てます。第2回では、画像とテキストのペアの集め方・CLIPによる品質フィルタから両方式の教師データまでを最小コードで整理します。全5回シリーズ第2回。

【第1回】生成AIは何を「正解」に学ぶのか ― 自己教師あり学習とLLM

LLMも画像生成も、人間が全件ラベルを付けた教師データで学んでいるわけではありません。カギは「元データから入力と正解を機械的に作る」自己教師あり学習です。第1回では、元データと教師データの違い、そしてLLMがどうやってテキストそのものを次トークン予測問題に変えて学ぶのかを、最小コードとともに整理します。全5回シリーズ第1回。

【第3回】巨大モデル一つで全部やるな ― 階層と責務分離のアーキテクチャ

「お腹が空いた」の判断だけで数十億パラメータが動く——全部を一つの巨大モデルでやるのは資源の無駄使いです。人間の神経系が処理の種類ごとに回路を分けているように、AIも時間スケールと責務で階層化すべき。ロボットの制御階層、エネルギー効率、OSのような構造、そして制御ソフトウェアの「組織化」まで。全3回シリーズ完結編。

【第2回】AIに「小脳」と「自律神経」を ― 身体を持つ知能の設計図

文字列データで発展したLLMを人間の大脳に例えるなら、小脳や脊髄、そして心臓や胃腸からの生理的フィードバックを司る自律神経に相当する仕組みが要るはずです。人体とAIシステムの階層対応、人工小脳(Diffusion Policy)、内受容感覚、恒常性(Homeostasis)まで、身体を持つ知能の設計図を描きます。全3回シリーズ第2回。

【第1回】フィジカルAIの現在地 ―「LLMの延長」なのか、それとも別物なのか

ロボットに「見る・言葉で理解する・物理的に動く」を統合させるフィジカルAI。これはLLMの発展研究なのか、それとも拡散モデルなど別系統なのか。VLA・拡散/flow・World Modelの3系統と、RT-2・Gemini Robotics・OpenVLA・π0・GR00T・Cosmosといった具体モデルから、2026年時点の現在地を整理します。全3回シリーズ第1回。

日米IT産業比較 ―「製品」と「サービス」、そしてAIによる再編

アメリカでIT企業といえばMicrosoftやNVIDIA、日本ではNTTデータや富士通——同じ「IT企業」でも指すものが違います。製品を世界へ量産する米国型と、顧客固有の業務を支える日本型。この構造差が収益・人材・競争力を分けてきました。生成AIはこの構図をどう再編するのか、日本の弱みと強みから展望します。

AIに負けないスキル。データのエンジニアリング

コーディングエージェントはロジックやテストに強い。しかし「このデータは何を意味し、誰が責任を持ち、どの鮮度で流れ、正本はどれか」は分からない。これは「AIに身体性がない」ことから演繹されるテーマです。データの意味・品質・来歴・責任範囲を設計できる人こそ、AI時代に価値が上がる——最新のデータエンジニアリング議論とともに整理します。

【第5回】AIを育てる人が勝つ ―「使う人」ではなく「育てる人」へ

シリーズの締めくくり。各回に共通する中核スキルは「経験を、人とAIが動ける形に変える力」です。なぜそれがAIでコモディティ化せず複利で効くのか、日々の実践、そして「AIが身体を持ったら?」という問いまで、総論として掘り下げます。

【第4回】AIチームでリーダー・マネージャーを育てる ― 指示力は、育成力

仕事を分解し、期待値と判断基準を共有し、フィードバックする。優れたマネジメントの型は、そのままAIチームへの良い指示の型と重なります。AIを率いる経験がリーダー・マネージャーを育て、組織の学習を回す仕組みを解説します。シリーズ第4回。

【第3回】AIを生徒にして脱・中級 ―「わかったつもり」を卒業する

「だいたい分かる」で止まりがちな中級者が次の段階へ進む鍵は、AIに教えることです。前提・制約・判断基準・例外まで言語化する過程が、暗黙知を形式知へ変える訓練になります。AIを「理解を映す鏡」として使う学習法と実践5ステップを解説します。シリーズ第3回。

【第2回】ビギナーこそAIで経験を積む ― いちばん伸びるのは、初心者だ

AIが答えをくれる時代、初心者は不利なのか。むしろ逆です。開発環境の構築やコンテナ・VMなど詰まりやすい題材をAIと一緒に試し、一緒に失敗する——その反復(イテレーション)でビギナーは最速で経験を積めます。AIにたくさん失敗させて観察する使い方まで解説。シリーズ第2回。

【第1回】AIにキャリアを奪われないためには? ― AI時代のキャリアパス論

「AIに仕事を奪われるのでは」という不安は、多くの人が抱えています。しかし問いを立て直すと、道が見えてきます。AI時代のキャリアを、ビギナー・中級者・リーダーの段階で捉え直す全5回シリーズの導入として、地図を描きます。