記事の概要
ByteDance が公開したマルチモーダルGUIエージェントスタック UI-TARS-desktop は、自然言語による指示と画面のスクリーンショットをセルフホスティングした視覚言語モデル(VLM)に入力することで、ローカルPCの操作を安全に自動化できるアプリ。GIGAZINEが実際に導入して「使えそうか」を検証した記事です。
公式発表の主な特徴
- VLMを利用した自然言語による制御
- スクリーンショットと画像認識のサポート
- 正確なマウス・キーボード操作
- クロスプラットフォーム対応(Windows・macOS・ブラウザ)
- リアルタイムなフィードバックとステータス表示
- プライベートでセキュアな完全ローカル処理
導入手順(Windows PCの場合)
クイックスタートではリリースページからインストーラーをダウンロードできるとされているものの、記事作成時点では見当たらなかったため、リポジトリをクローンして開発モードで実行する形を取っています。
前提条件
- ブラウザ(Chrome・Firefox・Edge)
- Git for Windows
- Node.js(v20以降)
- pnpm
注意:UI-TARS-desktopはシングルモニター構成のみ対応。マルチモニター環境では一部タスクが正常に動作しない可能性があるとのこと。
実行コマンド
git clone https://github.com/bytedance/UI-TARS-desktop.git
cd UI-TARS-desktop
pnpm install
pnpm run dev:ui-tars
起動後の画面と機能
- 起動直後の画面には 「Computer Operator」 と 「Browser Operator」 の2つの機能が表示される
- 過去に存在したリモートオペレーターの機能は、記事作成時点でサポート終了していた
- 画面左下の「Settings」→「VLM Settings」で使用するVLMを選択可能
選択できるVLMプロバイダー(4種類)
- Hugging Face for UI-TARS-1.0
- Hugging Face for UI-TARS-1.5
- VolcEngine Ark for Doubao-1.5-UI-TARS
- VolcEngine Ark for Doubao-1.5-thinking-vision-pro
ここで問題点が発覚:選択肢が4つともクラウドベースのVLMプロバイダーのみのため、特徴として謳われていた「プライベートでセキュアな完全ローカル処理」と現実との間に不一致が見られる、と筆者は指摘しています。
検証の結論
- UI-TARS-desktopはコンセプトとして非常に興味深いアプリ
- しかしドキュメントがあまりメンテナンスされておらず、リポジトリの更新もあまり活発ではない
- 記事作成時点では残念ながら「使える要素を見出せない」という厳しい評価
- とはいえコンセプトは魅力的なので、今後再び活発に更新されれば改めて検証したい、というのが筆者の見解
関連記事(GIGAZINE)
- CodexがWindowsの自動操作に対応 — ペイントでお絵描きやブラウザ操作を自動化
- 自然言語でブラウザを自動操作できるオープンソース「Browser-Use」
- AIエージェントでブラウザやファイルの自動操作ができる「Agent Zero」— ChatGPT・Claude・Gemini連携、ローカルAIも使用可能
- 複数のAIエージェントを1つのターミナルから統括できる「Herdr」
AIソフトウェアGUIエージェントByteDanceVLM