対話から実行へ
ツールの利用とコーディングエージェントによって、推論がファイル、ターミナル、テストにつながり、実環境で結果を確かめられるようになりました。
推論が現実と出会う進化 / エンジニアリングの方向性
モデルは時間とともに進歩します。記憶、スキル、ツール、ワークフローも改善できます。EvoForge は役立つ経験を次の仕事につなげる仕組みを開発しています。評価と承認を通じて、各変更を検証可能にし、主導権をあなたの手に保ちます。
ツールの利用、永続的な記憶、再利用可能なスキル、評価のサイクル。これらは、実際の仕事から学ぶエージェントに向けた、並行する複数の道筋です。
ツールの利用とコーディングエージェントによって、推論がファイル、ターミナル、テストにつながり、実環境で結果を確かめられるようになりました。
推論が現実と出会うOpenClaw のような常駐エージェントは、チャネル、記憶、拡張可能なスキルを組み合わせ、時間をまたいで仕事とコンテキストを継続できるようにしました。
作業に継続性が生まれるスキルは手順、参考資料、スクリプトを再利用可能な手法としてまとめます。レビューと保守によって、システムが成長しても手法の有用性を保ちます。
経験が再利用可能になるHermes のようなシステムは永続的な記憶とスキルの改訂を結び付けています。自己進化の研究では、プロンプト、スキル、ツールの説明、コードへと評価の対象を広げています。
変化が測定可能になるEvoForge は、繰り返し生じる不足を認識し、知識・手順・ツール・モデルのどこを改善すべきかを特定して結果を評価する、メタ認知の枠組みを探究しています。
システムが自らの成長を考えるRust で開発。上位には交換可能なモデルが接続し、下位にはコンピュータ、アプリ、ツールからなる作業環境があります。コンテキスト、記憶、権限、オーケストレーションが両者をつなぎます。
添付資料とツールの結果をコンテキストの上限内で整理し、長いタスクでも焦点と連続性を保てるようにします。
98 のツールで、文書処理、コード編集、ブラウザとデスクトップの操作、ターミナル作業、メディア制作をカバーします。
事実、好み、プロジェクトのコンテキストを適切な範囲に保存。有効期限と呼び出しの制御によって、今後の仕事に役立つ記憶を保ちます。
対象、データの機密性、復元手段、外部への影響からリスクを評価し、選択した自律性のレベルに従って判断します。
リードエージェントや共有タスクボードが、専門エージェント、長時間の作業、スケジュール済みタスクを調整し、進捗を一か所に集約します。
クラウドまたはローカルのモデルを接続し、タスクに合ったものを選べます。プロバイダーの稼働状態と認証情報は個別に管理します。
基盤モデルが推論を提供する。EvoForge は、その推論をあなたの環境で役立てる記憶、スキル、専門エージェント、証拠を保持し、次にどのモデルを選んでも引き継ぐ。
観察、提案、比較、採用、復元をそれぞれ独立した段階として扱います。変更候補は、今後の作業に影響する前に独立した評価を受けます。
直前に起きたことを短く見直す。残す価値のある事実、あなたが述べた好み、あなたがした訂正。毎回走らせても安く、邪魔にならないほど小さい。
行動の前に、何が見えるはずかを書き留められる。食い違いは驚きであり、驚きがより深い内省を引き起こす。較正は計測されるので、自信満々の間違いは隠されず捕まえられる。
バックグラウンドで最近の仕事を読み直し、重複した記憶を統合し、古いものを退役させ、繰り返し成功した軌跡を候補スキルにする。候補は上のループへ送られ、夢見だけで昇格するものはない。
記憶、スキル、ツール、専門エージェント、ポリシー、評価結果は、開く・テストする・バージョン管理する・共有する・無効化する・復元することのできる、確認可能な資産です。モデルを変えても、仕事とともに引き継げます。
永続的な事実、好み、プロジェクトの文脈、学んだ制約。それぞれにスコープと任意の有効期限。
54 のスキルを標準搭載。新しいスキルも同じ形式を使い、いつ、どのように使うべきかをチェックします。
プラグイン、コネクター、プロセス内ツールが作業の幅を広げます。導入には明示的なレビューとあなたの許可が必要です。
ルールには自己テストが含まれ、問題の早期発見とわかりやすい提示に役立ちます。
自分のブリーフ、記憶、ツール、権限、ライフサイクルを持つ永続的な存在。使い捨てのペルソナではなく、同僚。
比較可能な事例、回帰結果、あなたの決定、帰属、取り消し履歴。すべて再生できる台帳に。
候補は採用前に独立してテスト・比較します。引き継ぐものを決めるのは、自信ではなく証拠です。
スキルやルールの候補を、作業データから切り離した評価環境で、代表的なタスクを使って比較します。
修正を検証するテストは、元の問題を再現して変更を確認し、その後の仕事にも使えるよう残します。
比較可能な事例、結果、判断、復元履歴を、確認できる一つの記録にまとめます。
候補のスキルやルールは、実データに触れられない評価ホストの中で、同じタスクをベースラインと比較される。判定は適用の前に台帳へ書き込まれる。
あなたの git 履歴から、かつて間違えたタスクを掘り出し、二通りで再現し、失敗した修正と本物の修正の差を教訓に変える。カリキュラムはベンチマークではなく、あなたの仕事から育つ。
長期的には、評価済みのスキル、ツール、経験を交換しながら、何を信頼し採用するかを各自が決める分散型ネットワークを目指しています。このネットワークは研究段階です。個人の記憶はデフォルトでローカルに保管し、共有には許可が必要です。
アプリ内の独立した二つのスイッチ。生み出すものはすべて記憶パネルとスキルパネルに見え、どの項目も一操作で無効化または巻き戻しできる。
アイドル時に記憶を整理・統合し、スキルを提案します。新しいスキルを自動で有効にするかどうかは、別の承認設定で管理します。
オフの場合、新しいスキルはすべてあなたのレビューを待ちます。評価済み候補を自動採用したい場合にのみオンにしてください。