📢 X投稿文
複数SNS対応のメディアクローラー。Playwrightのブラウザ自動化でJS逆向が不要。小紅書、抖音、B站などの公開データ取得に対応。
#MediaCrawler #AI #OSS #GitHub
https://github.com/NanmiCoder/MediaCrawler
🤖 AI考察
■ **概要**
Playwrightによるブラウザ自動化でログイン状態を保持し、複数の中国主流SNS(小紅書、TikTok、BiliBili等)の公開情報を採集するマルチプラットフォーム爬虫ツール。
■ **特徴・用途**
1. **技術的優位性**:JS署名パラメータの逆解析を回避し、保持されたセッション環境からJSコンテキストで直接データ取得するため、複雑な暗号化アルゴリズムの解読が不要で保守性が向上している。
2. **スケーラビリティ**:プロキシ池対応、ログイン状態キャッシュ、複数プラットフォーム統一インターフェースにより、大規模採集と複数ソース連携が容易。
3. **法的リスク**:免責声明が強調されているが、プラットフォーム利用規約違反や現地法規制(中国の爬虫関連判例集参照)の抵触リスクが高く、商用利用・大規模採集は違法化する可能性がある。
■ **結論**
技術的には堅実な設計だが、学習目的外の利用は法的問題を引き起こす可能性があり、採集対象プラットフォームの利用規約・各国法令確認が必須。
タグ