"GPT"検索結果
2026-06-17 09:47

智普のGLM-5.2は、AAベンチマークで51ポイントを獲得し、オープンソースモデルの中で首位に立ち、GDPvalテストではGPT-5.5と同等の成績を示しています

Beating AIのモニタリングによると、Zhipuの最新モデルであるGLM-5.2は、Artificial Analysisの知能ベンチマークv4.1においてスコア51点でオープンソースモデルの中で1位にランクされています。MiniMax-M3(44点)やDeepSeek V4 Pro(44点)を上回っています。 GDPval-AA v2テスト(現実の知識労働を想定したシミュレーション)では、GLM-5.2は1,524点(人間の基準値: 1,000)を達成し、xhigh推論モードでクローズドソースのフロンティアモデルGPT-5.5と並びました。さらに、MiniMax-M3(1,418点)およびDeepSeek V4 Pro(1,328点)を上回りました。 このモデルは合計744Bのパラメータを持ち、40Bのアクティブパラメータを使用し、コンテキストウィンドウは200Kから1Mトークンへと拡張されています。GLM-5.2はMITライセンスのもとで動作し、Zhipu公式API、SiliconFlow、DeepInfraなど複数のプラットフォームで展開されており、平均タスクコストは1タス
もっと
2026-06-16 10:25

Claude Opus 4.8 は DeepSeek V4 Pro より 44 倍以上のコストがかかり、人工分析の最新評価が明らかにする

Artificial Analysisによると、最新のAI評価でClaude Opus 4.8は1タスクあたり$1.78のコストで56ポイントを獲得し、一方DeepSeek V4 Proはタスクあたり$0.04で44ポイントだった――Claudeの方が44倍高価です。この評価では、計画、ツールの使用、複雑なタスクの実行などの実世界での能力を測るためにベンチマークを見直し、より単純なマルチプルチョイスのテストを置き換えました。Claude Opus 4.8が利用可能なモデルで首位となり、その後にGPT-5.5が55ポイントで続きました。他の国内モデルも拮抗しており、MiniMax M3も44ポイント、Kimi K2.6は43ポイントでした。
2026-06-16 06:17

OpenAIは6月23日に、トークンコンテキスト1.5MのGPT-5.6をローンチし、Claude Fable 5の3分の1の価格で提供する予定です。

Beatingの監視によると、OpenAIは6月23日にGPT-5.6をリリースし、トークン換算で150万のコンテキストウィンドウを備え、APIの価格はAnthropicのClaude Fable 5のレートの3分の1になるという。タイミングは、Anthropicが6月9日にClaude Fable 5を発表し、その後6月12日に米国商務省がセキュリティ脆弱性のためにそれを削除したことと一致している。 予測市場では現在、GPT-5.6のリリースが6月22日から28日の間に行われる確率を78%と織り込んでいる。
もっと
2026-06-15 10:45

40+人のサイバーセキュリティ専門家が、トランプ政権にAnthropicのAI輸出禁止措置の解除を求める

Beatingによると、元Facebook最高セキュリティ責任者のAlex Stamosが率いる40人以上のサイバーセキュリティ専門家が、6月15日に公開書簡に署名し、トランプ政権によるAnthropicのAIモデル「Mythos」と「Fable 5」の輸出禁止に抗議した。専門家らは、これらの防衛ツールを制限すれば、中国に対するAI競争において米国の立場が損なわれると警告した。 この禁止措置は、Amazonのセキュリティ研究者が提出した脆弱性報告に端を発しており、Fable 5が悪用に対する実証概念(proof-of-concept)のコードを自動生成し得るとの懸念が示された。だがStamosは、Fable 5の公開版にはそのような自律的な攻撃能力はないと明確にした。彼は、OpenAIのGPT-5.5や中国モデルのKimi 2.7を含む他の主要なAIモデルが同等の脆弱性分析能力を備えていると指摘し、米国の最も先進的な防衛ツールを止めることは自滅的な妨害だと主張した。
もっと
2026-06-13 13:29

BBVA、OpenAIと提携してChatGPT Enterpriseを導入 従業員が2万以上のカスタムGPTを作成

PANewsによると、BBVAは6月13日にOpenAIとの戦略的パートナーシップを発表し、顧客対応、業務運営、ソフトウェア開発、従業員の業務フロー全体に人工知能を統合する。スペインの銀行グループは、AIネイティブな運用モデルへと変革することを目指しており、顧客体験、コマーシャルバンキングのサービス、リスク管理、業務効率、従業員の生産性を再設計する。 BBVAの従業員は社内で2万件以上のカスタムGPTを作成しており、そのうち約4,000件が法律、リスク管理、顧客サービス、財務、マーケティングの各機能で頻繁に利用されている。
もっと
2026-06-12 19:26

プロンプトインジェクション攻撃に対して脆弱なAIエージェント、研究者が79%の成功率を発見

南洋理工大学、STエンジニアリング、IBMリサーチ、イリノイ大学アーバナ・シャンペーン校の研究者によると、木曜日に発表された研究では、GPT-5 と Gemini を動力とする AI エージェントは、プロンプトインジェクション攻撃に対して一貫して抵抗できないことが分かった。 3,168 件の攻撃シミュレーションでは、直接的なプロンプトインジェクション攻撃が 79% 超の確率で成功した一方、Web 上のコンテンツに埋め込まれた間接的な攻撃は、成功率が 41.67% から 68.16% の範囲に収まった。研究者らは、現実的なオンライン環境でこのような攻撃に対する AI エージェントの応答を検証するベンチマーク「StakeBench」を開発し、AI エージェントが Web ブラウジング、調査、買い物、そして暗号資産取引において主流になるにつれて、プロンプトインジェクションは依然として重大な脆弱性だと指摘した。
もっと
2026-06-12 08:53

Googleがアンチグラビティのクォータ・ダッシュボードを公開し、毎週のGemini利用枠をリセットします

Beatingによると、GoogleのAntigravityはモデルのクォータ・ダッシュボードを立ち上げ、毎週のGeminiの利用枠をリセットしました。新しいダッシュボードでは、同じクォータ・プールを共有するモデルを(GeminiモデルとClaude/GPTモデルは別々に)グループ化し、残りクォータを詳細な割合表示で確認できるようにしています。Antigravityはさらに、/btwナレーション機能を導入し、複雑な作業中にユーザーが追加の質問や確認の質問をメインの会話履歴を邪魔することなく行えるようにしました。加えて、会話履歴の検索、PDF添付のアップロード、LaTeX書式の強化、ディレクトリ移動の最適化、MCPサーバーの安定性向上などの改善も含まれます。
2026-06-12 06:13

ChatGPTは5月に月間アクティブユーザー10億人に到達—最速でマイルストーンを達成したアプリ

市場インテリジェンス企業のSensor Towerによると、OpenAIのChatGPTは5月に月間アクティブユーザー(MAUs)が10億に到達し、2022年11月のローンチから約3.5年でこの節目を達成した。アプリはこのユーザーレベルに到達するまで史上最速となり、同じ規模に達するのに約5年かかったGoogleマップを上回った。 チャットGPTのリードにもかかわらず、競合するAIアプリが勢いを増している。Claudeの月間利用は前年比で640%上昇した一方、Meta AIは973%急増したが、ChatGPTの伸びは62%だったとSensor Towerは述べた。この勢いの変化は、ペンタゴンとの提携をOpenAIが発表したことを受けた2月の出来事の後に起きた。2月28日にはChatGPTのアンインストールが295%急増し、またClaudeはAnthropicが国防総省の関与を断った後、App Storeのトップスポットまで上昇した。
もっと
2026-06-11 07:01

0G Labsおよび提携大学は主要なコンセンサス・プロトコルにおいて15件のゼロデイ脆弱性を発見

ICML 2026で採択された論文によると、0G Labs、シンガポール国立大学、北京大学、北京郵電大学の研究協力が、コンセンサスプロトコルのセキュリティ向けの自動テストフレームワーク「Agora」を発表しました。Agoraは、Raft、EPaxos、HotStuff、BullShark などの主要プロトコルにまたがって、これまで未確認だった深刻な脆弱性を15件特定しました。特定された問題は、実行の不一致、単調性の違反、トポロジーの欠陥、そして署名検証の不備に及びます。この研究では、GPT-5.2やClaude 4.5を含む主流の大規模言語モデルが、同じテスト条件下ではこれらのプロトコルレベルの脆弱性を検出できなかったことが示されました。
2026-06-07 04:45

オープンソースのAIモデルはGPT-5.5 Proより40倍安い;チャマス氏は、監視されていないAPIの過剰支出を警告

Beatingによれば、Nvidia Nemotron 3 UltraやGoogle Gemma 4 12Bを含む25のオープンソース・モデルのリリースにより、オープンソースとクローズドソースのフロンティア・モデルの能力ギャップは急速に縮まりつつあるものの、価格は依然として大きく噛み合っていない。テック投資家のChamath Palihapitiyaは、月次で入力1 billionトークン、出力1 billionトークンを消費する企業にとって、GPT-5.5 Proは$105,000、Claude Opus 4.8は$30,000である一方、DeepSeek R1は$2,740にすぎず、その結果としてGPT-5.5 Proが40倍のプレミアムを要求していると指摘した。