![]()
Klingの精度が低いと感じたら見直す設定とプロンプト改善5つ
この記事のポイント Klingの出力が思った通りにならない原因は、モデルの実力不足ではなく指示文と設定の組み合わせにあることがほとんどです。 特に効くのは「動詞を1つに絞る」「カメラワークを分離して書く」「尺を短くする」の3つ。 テキストから動画で粘るより、画像から動画へ切り替えたほうが当たり率は跳ね上がります。 この記事では書き換え前後の実例と、生成が崩れたときの原因の切り分け表をまとめました。
生成ボタンを押して、待って、出てきた動画が指示とまるで違う。クレジットだけが減っていく。あの徒労感、よく分かります。
先に答えを言うと、Klingの精度が低いと感じる場面の多くは、設定の1〜2箇所を変えるだけで解消します。モデルを疑う前に見る場所があるということ。
Kling(クリング)とは、中国の動画共有サービス「快手(Kuaishou)」が開発した動画生成AIです。テキストから動画を作る機能に加えて、手持ちの画像を動かす機能、静止画そのものを作る機能を備えています。2026年2月5日に公開された最新世代のKling 3.0では、4K相当の高画質出力や複数カットの連続生成、音声の同時生成にも対応しました。
つまり道具としての性能は十分あります。問題は使い方の側。
Klingの精度が低いと感じる原因はどこにある?

精度の不満は「モデルが弱い」ではなく「指示が読み取れない形になっている」ことに集約されます。原因は大きく5つに分かれます。
動画生成AIは、静止画生成AIと比べて指示の解釈幅が桁違いに広いです。1枚の絵なら「猫が座っている」で完結しますが、動画では猫がどう動くのか、カメラがどこにあるのか、時間がどう流れるのかまで全部決めないといけません。書かなかった部分はモデルが勝手に埋めます。
その「勝手に埋めた部分」が、あなたの想像と違っているだけ。
不満の出方ごとに原因を整理した表がこちらです。
| 症状 | よくある原因 | 最初に試すこと |
|---|---|---|
| 指示と全然違う映像が出る | 動詞を詰め込みすぎ | 動作を1つに絞る |
| 人物の顔が途中で崩れる | 尺が長い/被写体が小さい | 5秒に短縮+寄りの構図に |
| 手や指がぐにゃぐにゃになる | 手元が動く指示になっている | 手を映さない構図を指定 |
| 動きがほぼ静止画 | 動作の指示語が抽象的 | 具体的な動詞に置換 |
| 背景だけ別世界になる | 背景の記述がゼロ | 背景を1文で明示 |
つまり、症状ごとに打ち手はほぼ決まっています。闇雲に再生成を回すのが一番もったいない。
Klingの基本操作そのものに不安がある人は、Klingの使い方をまとめた記事を先に眺めておくと、この記事の後半が理解しやすくなります。
改善1: 動詞を1つに絞ると当たり率が上がる

1つの生成に動作を複数入れると、モデルはそのどれかを捨てるか、全部を中途半端に混ぜます。動詞は1つに絞るのが鉄則です。
これが最も効く改善で、しかも一番見落とされます。
日本語で考えるとき、私たちは自然に動作を連ねてしまいます。「女性がカフェに入ってきて、席に座り、コーヒーを一口飲む」。文章としては自然。でも5秒の映像に3つの動作を詰め込むのは物理的に無理があります。
モデルは3つを圧縮しようとして、結果的にどれも成立しない映像を出す。
書き換えの実例
悪い例と良い例を並べます。
| 書き換え前 | 書き換え後 |
|---|---|
| 男性が振り返って驚いた顔をして走り出す | 男性がゆっくり振り返る |
| 犬が走ってきてボールをくわえてジャンプする | 犬がボールをくわえたまま静止し、尻尾だけ揺れる |
| 花が咲いて風で散っていく | 花びらが1枚ずつ開いていく |
| 料理人が野菜を切って鍋に入れて混ぜる | 料理人が包丁でネギを刻む |
つまり、削るほど精度が上がるという逆説的な関係にあります。
複数の動作をどうしても入れたいなら、生成を分けて後でつなぐほうが確実。1本5秒を3本作って編集ソフトで並べたほうが、10秒の欲張り生成1本より使える映像になります。
動詞を減らすのは妥協ではありません。動画生成AIの「1カット1動作」は、実写の撮影現場でも同じ原則です。カット割りの発想に近づけるほど出力は安定します。
改善2: カメラワークは動作と分けて書く
被写体の動きとカメラの動きを同じ文に混ぜると、モデルはどちらが動いているのか判断できません。2つは別々の行に分けて書きます。
これも定番の詰まりどころ。
「カメラが人物に近づきながら人物が手を上げる」と書くと、人物が近づいてくる映像になったり、カメラが動かないまま手だけ上がったりします。主語が2つある文を、モデルは正確に分解できません。
分離して書く型
こう書き分けます。
被写体: 女性が窓の外を見ている
カメラ: ゆっくり左から右へパン
背景: 夕暮れのオフィス、ブラインド越しの光
行を分けるだけで、解釈の混線がかなり減ります。
指定できるカメラの動きは限られています。使える語彙を絞っておくほうが安定します。
| カメラ指定 | 効果 | 安定度 |
|---|---|---|
| static / 固定 | 三脚固定。被写体の動きが見やすい | 高い |
| slow zoom in | じわじわ寄る。感情表現向き | 高い |
| pan left / right | 横に振る。空間を見せる | 中くらい |
| dolly in | 前進しながら寄る | 中くらい |
| orbit / 回り込み | 被写体の周りを回る | 低い |
| handheld / 手持ち | 揺れを足す。ドキュメンタリー風 | 低い |
つまり、凝ったカメラワークほど破綻しやすいという当たり前の結論になります。迷ったら固定かスローズームの2択で十分。
回り込みや手持ちは、当たったときの見栄えは圧倒的ですが、5回に1回しか成功しないつもりで挑むものです。
改善3: 尺を5秒に落とすと崩れが激減する
生成尺は長くなるほど破綻の確率が上がります。品質に不満があるときは、まず最短の尺に戻して検証するのが早道です。
長い尺は「後半で崩れる」のではなく「全体の解像度が落ちる」形で効いてきます。
モデルは決められた計算量の中で全フレームを作ります。10秒を指定すれば、5秒のときと同じ計算資源を倍のフレーム数に配分することになる。1フレームあたりの丁寧さが落ちるのは自然な話です。
顔が溶ける、指が増える、服の柄が途中で変わる。この手の症状は尺を半分にするだけで消えることが珍しくありません。
尺の使い分け
用途ごとの目安をまとめます。
| 尺 | 向いている用途 | 注意点 |
|---|---|---|
| 5秒 | SNSの差し込みカット、商品の寄り | 情報量は1動作まで |
| 10秒 | 商品紹介、風景の見せ場 | 人物の顔は崩れやすい |
| 延長機能で継ぎ足し | ストーリー性のある尺 | 継ぎ目の一貫性は運任せ |
つまり、長い動画が欲しいなら「長く生成する」のではなく「短く作って並べる」のが正解です。
編集の手間は増えます。でも、10秒を20回引き直すより、5秒を4本作って編集したほうが早い。クレジットの消費という意味でも、こちらのほうが安く済みます。
生成そのものが失敗する、エラーで止まるといった症状に当たっている場合は、プロンプトの話ではなく別の原因かもしれません。Klingが動かないときの対処法に症状別の切り分けをまとめてあります。
Kling 質問の仕方で何が変わる?
指示文の書き方を変えると、同じモデル・同じ設定でも出力の質は目に見えて変わります。特に効くのは「抽象語を捨てて具体名詞に置き換える」という一点です。
ここが日本語話者の最大の落とし穴。
「おしゃれなカフェ」「かっこいい車」「きれいな海」。こういう形容詞は、モデルにとって情報量がほぼゼロです。何をもっておしゃれとするかの基準がない。結果として、平均的で個性のない、どこかで見た映像が出てきます。
抽象語を具体に落とす
置き換えの型を並べます。
| 抽象的な指示 | 具体化した指示 |
|---|---|
| おしゃれなカフェ | 木製カウンター、真鍮のペンダントライト、観葉植物 |
| かっこいい車 | 黒いセダン、雨に濡れたボディ、夜のネオンが反射 |
| きれいな海 | 遠浅の海、透明度の高い水面、白い砂が透けて見える |
| 楽しそうな人 | 口角が上がり、目を細めて笑う女性 |
つまり、形容詞を名詞と質感に分解するほど精度が上がります。
もう1つ効くのが、否定形を使わないこと。「手を映さない」ではなく「バストアップの構図」と書きます。動画生成AIは否定を苦手とするモデルが多く、「映さない」と書いた要素がむしろ強調されることがあります。
書いた通りではなく、書いた単語に引きずられる。この性質を覚えておくと事故が減ります。
日本語と英語、どちらで書くほうが精度が高い?
指示文は英語のほうが安定します。日本語入力にも対応していますが、細かいニュアンスの再現度で差が出ます。
学習データの分布を考えれば当然の結果です。
日本語で書いた指示は、内部で解釈される過程を1つ余分に通ります。「振り返る」がturn aroundなのかlook backなのかglance over shoulderなのか、日本語の1語では確定しません。英語で書けば、その揺れを自分で潰せます。
とはいえ、英語で書くのが面倒なのも事実。
現実的な運用
おすすめの流れはこうです。
- 日本語で構成を組み立てる(被写体・動作・カメラ・背景の4行)
- 翻訳ツールで英語化する
- 動詞と質感の語だけ自分で確認して調整する
翻訳の精度が気になるなら、DeepLとClaudeを使い分ける記事が参考になります。プロンプト翻訳は文脈依存が強いので、単純な直訳より意図を汲むタイプのほうが向いています。
| 記述言語 | 精度 | 手間 |
|---|---|---|
| 日本語のみ | 及第点。構図の再現は弱い | 少ない |
| 英語のみ | 安定。細部まで通る | 多い |
| 日本語→翻訳→微調整 | 実用上ほぼ英語と同等 | 中くらい |
つまり、翻訳を挟むひと手間で精度は英語ネイティブ記述にかなり近づきます。
改善4: テキストから動画をやめて画像から動画に切り替える
同じ題材でも、テキストから作るより画像を起点にしたほうが安定します。精度に悩んでいるなら、この切り替えが最も即効性のある一手です。
理由は単純で、決まっている情報の量が違うからです。
テキストから動画では、モデルは構図・色・人物の顔・背景・光の当たり方を全部ゼロから決めます。決める要素が多いほど、あなたの想像と外れる確率は上がる。一方で画像から動画なら、見た目はすでに確定していて、モデルが決めるのは「どう動くか」だけです。
変数が1つに減る。これが効きます。
Klingは画像から動画への変換で高い評価を得ているモデルで、静止画から自然な動きを作る点が海外のレビューでも繰り返し言及されています。強みが出る使い方をしたほうが得。
起点にする画像の作り方
画像はどう用意してもかまいません。
- Kling自身の静止画生成機能で作る
- 他の画像生成AIで構図を詰めてから持ち込む
- 自分で撮影した写真を使う(商品PRならこれが最強)
人物の顔を固定したい、商品の見た目を1ミリも変えたくない。こういう要件があるなら、画像から動画以外の選択肢は実質ありません。
画像を起点にする場合の指示文は、見た目の描写を削って動きだけに絞ります。すでに画像で確定している情報を文章で繰り返すと、かえって干渉します。
| 起点 | 指示文に書くこと | 書かないこと |
|---|---|---|
| テキストから動画 | 被写体・動作・カメラ・背景の4要素すべて | なし |
| 画像から動画 | 動作とカメラワークのみ | 色・服装・顔立ちなどの外見 |
つまり、画像から動画では書く量を減らすのが正解です。ここを間違えて全部書き足す人が多い。
Klingの世代ごとの機能差を押さえておきたいなら、Kling 2.0の解説記事で基本的な考え方を確認できます。
改善5: 設定パネルの数値を見直す
指示文だけでなく、生成画面の設定項目も出力を左右します。特にモード選択と参照強度の2つは、変えると結果が明確に動きます。
放置している人が多い場所。
Klingには生成の品質と速度を切り替えるモードがあります。高品質側を選ぶと生成時間もクレジット消費も増えますが、細部の破綻は目に見えて減ります。テスト段階は速いモード、本番は高品質モード。この使い分けをするだけで無駄打ちが減ります。
画像から動画を使うときは、元画像にどれだけ忠実にするかを調整する項目も重要です。忠実度を上げると見た目は保たれますが動きが小さくなり、下げると動きは出ますが元画像から離れていきます。
設定の当たりを探す順番
こう回すのが効率的です。
- 速いモード・5秒・デフォルト設定で3回生成して方向性を確認
- 方向性が合った指示文だけを高品質モードで生成
- それでも崩れるなら尺と構図を疑う
| 設定項目 | 上げたとき | 下げたとき |
|---|---|---|
| 品質モード | 細部が安定。時間とクレジット増 | 検証が速い。粗が出る |
| 生成尺 | 情報量が増える。破綻も増える | 安定するが1動作まで |
| 参照画像の忠実度 | 見た目が保たれる。動きが小さい | 動きは出る。別人化のリスク |
つまり、いきなり本番設定で回すのが最大の無駄です。安い設定で当たりを探してから、高い設定で仕上げる。
再生成を繰り返す前に確認すべきこと
同じ指示文で引き直すのは、当たりが出るまでコインを投げ続ける行為です。1回ごとに何を変えたか記録するほうが、結果的に早く着地します。
ここが運用の分かれ目。
動画生成は1回あたりのコストが画像生成より重いです。無料枠で回している人ならなおさら、無計画な再生成は致命的。何も変えずに5回引くくらいなら、1箇所ずつ変えて5回引いたほうが学びが残ります。
変更ログの取り方
スプレッドシートでもメモアプリでもかまいません。記録するのは4項目だけ。
- 指示文(全文)
- 設定(モード・尺・忠実度)
- 出力の評価(使える/惜しい/論外)
- 次に変える箇所
3回も回せば、自分の題材で何が効くのかが見えてきます。ジャンルによって効く要素は変わるので、他人のノウハウをそのまま持ってきても当たらないことがある。
自分用のパターン集を作るのが、結局いちばん精度が上がる方法です。
商用利用でつまずかないための確認事項
生成した動画を仕事で使うなら、プランの条件を先に確認しておく必要があります。無料枠で作ったものをそのまま納品するのは危険です。
ここは技術ではなく契約の話。
一般的に、動画生成AIは無料プランでの商用利用を制限しています。Klingも有料プランで商用利用を認める形を取っており、プランごとに条件が異なります。クライアントワークで使うなら、生成前に公式の利用規約で自分のプランの条件を確認しておくべきです。
透かし(ウォーターマーク)の有無もプランで変わります。無料枠の出力に透かしが入る場合、それを消す加工が規約違反になることもある。
| 確認項目 | なぜ重要か |
|---|---|
| 商用利用の可否 | 納品物に使えるかが決まる |
| 透かしの有無 | 消す加工が規約違反になる場合がある |
| 生成物の権利帰属 | 二次利用・再販の可否に関わる |
| クレジット表記義務 | プランによって求められることがある |
つまり、制作を始める前に規約を1回読むだけで、後の事故がほぼ消えます。
精度が上がらないときの最終手段は?
指示文と設定を一通り試しても納得いかないなら、題材そのものがKlingの不得意領域に入っている可能性があります。ツールを変える判断も選択肢です。
粘る場所を間違えないことが大事。
動画生成AIには、それぞれ得意な絵柄と苦手な絵柄があります。Klingは人物の表情やジェスチャーの自然さに定評があり、特にアジア系の顔の再現で評価されています。逆に、極端にスタイライズされたアニメ表現や、複雑な機械の駆動、文字の描画などは苦手側に入りやすい。
| 題材 | Klingとの相性 |
|---|---|
| 人物の表情・ジェスチャー | 得意 |
| 商品の寄りカット・質感 | 得意 |
| 風景・自然物の動き | 得意 |
| 画面内の文字表示 | 苦手 |
| 複雑な機械の連動 | 苦手 |
| 群衆シーン | 苦手 |
つまり、苦手な題材で粘るのは時間の無駄です。文字を入れたいなら編集ソフトで後から乗せる。この判断が早いほど制作は進みます。
AIツール全般の使い分けに興味があるなら、AIコーディングCLIの比較記事のように、用途ごとに向き不向きを整理した記事も参考になります。道具は一択で選ぶものではありません。
AI PICKS編集部の判定
Klingの精度に不満が出るのは、ほぼ全部が使い方の問題です。モデルの実力を疑う前にやることが5つ残っている、というのが正直な結論。
なかでも効果が圧倒的なのは「テキストから動画をやめて画像から動画に切り替える」の一手です。これだけで体感の当たり率が変わります。決める変数を減らせば結果は安定する、という単純な理屈が効いてくる。
逆に、いちばん無駄なのは同じ指示文での再生成です。何も変えずに引き直すのは、クレジットを捨てているのと同じ。1箇所ずつ変えて記録を取るほうが、結果的に速く着地します。
Kling自体の性能については、画像から動画の分野で評価が高いモデルという位置づけで見て問題ありません。海外のレビューでも、静止画から自然な動きを作る点は繰り返し評価されています。ただし文字表示や群衆シーンは今も苦手で、ここに時間を注ぐのは微妙。苦手領域は編集ソフトで補うと割り切るほうが賢いです。
道具は十分に良い。あとは指示の出し方次第、というのが今の実感に近い評価になります。
よくある質問(FAQ)
Q. Klingの精度が低いと感じるのは自分の使い方が悪いからですか?
多くの場合はそうです。ただし責める話ではなく、動画生成AIは指示の書き方で結果が大きく変わる道具だというだけ。動詞を1つに絞る、カメラワークを別行に書く、尺を5秒にする。この3つを試すだけで印象は変わります。
Q. 日本語で指示を書くと精度は落ちますか?
英語と比べると細部の再現度で差が出ます。ただし日本語がまったく通じないわけではありません。日本語で構成を組んでから翻訳ツールで英語化し、動詞だけ自分で確認する運用が現実的です。
Q. 同じ指示文で何回も生成し直すのは有効ですか?
おすすめしません。生成にはランダム性があるので当たりが出ることもありますが、クレジットの消費に対して学びがゼロです。1箇所ずつ変えて記録を残すほうが、少ない回数で目的の映像にたどり着けます。
Q. 人物の顔が途中で崩れます。どうすればいいですか?
尺を5秒に落とし、被写体を大きく映す構図に変えてください。それでも崩れるなら、画像から動画に切り替えて顔を固定するのが確実です。テキストから動画で顔の一貫性を保つのは、そもそも難易度が高い作業になります。
Q. 長い動画を作りたいときはどうすればいいですか?
短いカットを複数作って編集ソフトでつなぐ方法をおすすめします。1本で長尺を生成すると全体の解像度が落ちます。最新モデルには尺を延ばす機能もありますが、継ぎ目の一貫性は運の要素が残ります。
Q. 無料枠で作った動画を仕事で使えますか?
プランの条件によります。動画生成AIは無料プランでの商用利用を制限するのが一般的で、透かしが入る場合もあります。納品物に使うなら、生成前に公式の利用規約で自分のプランの条件を確認してください。
Q. 他の動画生成AIに乗り換えるべきか、どう判断すればいいですか?
題材との相性で判断します。人物の表情や商品の質感を撮りたいならKlingは強い選択肢です。画面内に文字を出したい、群衆を動かしたいといった苦手領域が主題なら、別のツールを検討するか、その部分だけ編集ソフトで作るほうが早く終わります。
あわせて見たいツール・カテゴリ
動画まわりの道具選びを広げたいときに役立つページを並べます。
- 動画生成AIのカテゴリ一覧 — Kling以外の選択肢を横並びで確認できます
- 画像生成AIのカテゴリ一覧 — 画像から動画の起点になる1枚を作るときに
- 動画生成AIのおすすめ一覧 — 用途別の向き不向きを整理しています
- AIライティングツールのカテゴリ — 企画やナレーション台本を作る工程で使えます
- AI音声・音楽生成のカテゴリ — 生成した映像に音を足したいとき
- AI動画編集のカテゴリ — 短いカットをつなぐ後工程はこちら
次に読むならこれ。生成そのものが止まる、エラーで進まないという症状に心当たりがあるなら、Klingが動かないときの対処法を先に読んでください。プロンプトの改善は、まず生成が通る状態を作ってからの話になります。
